跳到正文

#数据/训练

今日 4 条

今天 · 9月30日星期三 · 4 条

The Decoder

AMD 以 82 亿美元收购世界模型初创公司 World Labs

AMD 宣布以约 82 亿美元全股票交易收购专注空间智能的初创公司 World Labs,交易预计在 2026 年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 领导团队,出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报并负责前沿研究。

推荐理由:交易金额与团队去向之外,原文还梳理了世界模型路线与 AMD 追赶 Nvidia 的硬件逻辑。

Hacker News 首页

EFF 称 DraftKings 用 AI 定向投放亏损赌客

EFF 援引《纽约时报》报道称,DraftKings 用客户投注记录训练机器学习模型,找出可能下注亏损的赌客,再向其投放促销广告吸引回站下注。EFF 指出 DraftKings 仅使用自己收集的第一方数据,说明只限制第三方数据买卖的政策不足以阻止这类广告,并主张全面禁止在线行为广告。

昨天 · 9月29日星期二

Hacker News 首页

PostHog 开源 Jeeves:用推理改进 Jev 类决策模型

PostHog 在 GitHub 开源 Jeeves 项目,通过推理能力改进 Jev 类决策模型。仓库包含 drafter、inference、loader、model、prep、sdk 等模块,并附有 calibrate.py、checkpoint.py 等脚本,采用 master 单分支,已获 49 星、7 次 fork。

Hacker News 首页

Jeff:在家用消费级显卡训的 0.8B 决策模型,推理只要 30 毫秒

Jeff 是一组从 Qwen3.5 和 Gemma 4 微调出来的 0.8B 参数小模型,专门做零样本分类——也就是不给例子直接判断类别。亮点是作者说在家用普通显卡上就能训练,推理一次只要 30 毫秒左右,延迟很低,适合塞进实时决策流程。模型兼容 Jev 格式,GitHub 上放了代码和权重。不过正文没披露用了多大训练集、在什么基准上测过,所以实际效果...

Hacker News 首页

Vespper 发布 DOCX MCP:让 AI 代理改 Word 文档,号称快 3 倍、便宜一半

Vespper(YC F24)推出了一款专门为编辑 Word 文档微调的模型,打包成 MCP 服务器(一种让 AI 代理调用外部工具的标准接口)。核心思路是把 .docx 转成 Markdown 让代理改,再转回来——之前这么做会丢格式,他们用微调模型解决了这个“有损转换”问题。内部测试说比现有方案快 3 倍、成本低一半、改得更准。但正文没披露具体跑分...

9月28日星期一

Hacker News 首页

在 Recurse Center 的夏天:手写 DEFLATE 解压器、搭 Agent 沙箱、组数学小组

作者在布鲁克林的编程静修营 Recurse Center 待了一整个夏天。他参加了几个学习小组:在 Agentic Adventures 里,他和搭档给一个 vibe-coding agent 搭了远程沙箱,权限直接设成 dangerously-skip-permissions(跳过所有权限检查,风险很高);还用 minGPT 训练了一个能模仿莎士比亚...

9月26日星期六

Ars Technica · AI

特斯拉员工抵触训练 Optimus 人形机器人,担心被取代

特斯拉工厂工人被要求穿戴动作捕捉服为 Optimus 采集训练数据,部分员工因认为机器人最终将取代自己而抵触。Optimus 目前仍需在受控环境中编程执行特定任务,手部触觉传感器不可靠,特斯拉已改用可替换的传感器手套。特斯拉人形机器人还依赖中国供应商提供零部件,并面临丰田、现代等车企的竞争。

Ars Technica · AI

研究称 AI 未显著冲击应届生就业,与斯坦福结论相左

慕尼黑 CESifo 的新工作论文认为,没有证据显示应届大学毕业生的招聘出现显著、广泛的替代或减少。研究者 Robert Fairlie 和 Jane Wu 聚焦应届生,因为劳动力需求变化可能先体现在招聘减少上;这与上月一项斯坦福研究称"AI 影响"职业入门级就业落后的结论相反。

9月25日星期五

9月22日星期二

Anthropic News

Anthropic 与 WHO 等机构用 Claude 支持刚果(金)埃博拉疫情响应

Anthropic 的 Beneficial Deployments 与应用 AI 团队与 CEPI、WHO 非洲区域办事处、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(BDBV)响应中使用 Claude。

推荐理由:原文披露 Claude 在刚果(金)埃博拉疫情中的具体用法与耗时变化,可了解 AI 在公共卫生应急中的落地边界。

9月21日星期一

MIT Technology Review · AI

MIT Technology Review 如何绘制首张美墨边境“虚拟墙”沿线死亡地图

MIT Technology Review 与 Times of San Diego 用 15 个月调查,绘制出首张美墨边境监控塔附近死亡情况的综合地图与分析。团队分析可追溯至 2015 年的案例,向得州 17 个县警长办公室申请记录,收到超 4000 页文件,并用 Anthropic 的 Claude 通过 API 提取遗骸发现地点坐标后人工核验。

9月17日星期四

Hacker News 首页

花 9 美元让 Gemini 教出一个本地模型,替代它自己

作者用 Gemini 3.1 Pro 给 4290 条 Reddit 评论打上刀具品牌、型号和钢材的标签,花了 9 美元。然后用这些标签微调了一个叫 GLiNER 的开源命名实体识别模型。训练好的模型在本地跑,跟 Gemini 的标注结果对比,F1 分数达到 0.83,而直接零样本跑 GLiNER 只有大约 0.65。训练在 Tesla T4 上跑了 ...

推荐理由:一篇很实在的微调实战记录。作者用 Gemini 3.1 Pro 给 Reddit 刀具评论打标,只花了 9 美元就攒出 4290 条训练数据,把开源 NER 模型 GLiNER 的 F1 从 0.65 提到了 0.83。我会先打个折:领域太窄(刀具品牌型号钢材),分数不能给太高。但方法本身是通用的——用大模型蒸馏标签、微调小模型、本地部署省 API 钱——对从业者来说直接能用。正文没披露训练脚本细节和推理延迟,这点有点可惜。

9月14日星期一

Hacker News 首页

2026年AI就业市场:谁在被抢、谁在拿高薪、哪些岗位正在消失

Maksim Ilin 把 LinkedIn、世界经济论坛、斯坦福、普华永道和贝恩的数据拼在一起,画出了 2026 年 9 月的 AI 就业图景。最抢手的岗位是 AI 工程师,就是把大模型塞进产品里干活的人,美国周均新增约 1550 个职位,年薪中位数 17.6 万美元。最顶尖的是前沿实验室的研究科学家,Anthropic 年薪中位数约 74.6 万美...

推荐理由:一篇个人博客把几份公开报告的数据揉在一起,给出了 2026 年 9 月 AI 岗位的薪资和需求全景。数字具体、来源可查,对从业者有直接参考价值。扣分是因为本质上是二手数据整合,不是一手调研,权威性有限,所以停在 72 分。

OpenAI News

Fyxer 把邮件拆成 30-50 个小模型,草稿采纳率 53%

Fyxer 用 OpenAI 模型做了个 AI 行政助理,核心是把邮件处理拆成 30-50 个专用小模型,分别负责判断要不要回、分析意图、调取记忆、生成草稿。训练数据来自 50 万小时真人行政助理的工作记录,用 LoRA 微调,再通过用户编辑草稿的差异做 DPO 训练(偏好样本教模型学风格)。目前草稿直接采纳率 53%,90 天用户留存 90%。正文没...

9月12日星期六

r/LocalLLaMA

把2B小模型微调成微信群聊风格,全套代码开源了

有人在Reddit发帖,说自己用WhatsApp群聊记录微调了一个2B参数的小模型,并且把完整流程做成了GitHub cookbook开源。正文被Reddit屏蔽了,所以看不到基座模型、训练成本、效果评测这些关键信息。2B模型的好处是本地跑得动,适合拿自己的聊天记录训练一个模仿群聊口吻的玩具。如果你也想试试,这个cookbook是个不错的起点,但具体花...

9月11日星期五

AI HOT 精选

Together AI 微调服务升级:训练过程实时看曲线,新增 DeepSeek V4 Pro 等模型

Together AI 更新了微调服务,新增 DeepSeek V4 Pro、MiniMax M3、Gemma 4 31B 等模型。现在训练过程中就能实时看 loss 和准确率曲线,不用等跑完才知道效果。控制也更细了,可以调学习率调度器、优化器参数和早停条件。正文没披露定价和地区可用性,但模型列表和功能描述挺详细。

9月10日星期四

Mistral AI

Cloudera 与 Mistral 达成合作,将主权 AI 引入企业数据平台

Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与模型所有权均归企业,模型基于开放权重。Cloudera 平台上客户管理的数据规模达 30 exabytes。

9月8日星期二

Google DeepMind

Google DeepMind 发布 AlphaGenome Atlas,预测人类基因组全部单碱基变异

Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。

推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。

9月4日星期五

Computing Life · Share · 鸭哥调研

把模型搬回自己家之前,先算三本账

Lambda 工程师 Zach Mueller 公开承认,他家里那套 GPU 机架不省钱,电费可能翻倍,回报全在磨练技能。文章用 2026 上半年数据说明开源模型能力已够用,但自建部署的账比直觉复杂。核心要算三本账:钱上,两张 H100 每月得跑约 20 亿 token 才能打平云端 API,利用率一高延迟就涨,交互体验和成本天生打架;数据上,商业合规...

推荐理由:Zach Mueller 作为 Lambda 的工程师,亲手拆了自建 GPU 的省钱幻觉,三本账的框架很实在。扣分是因为这是一篇观点总结,不是一手发布,而且正文停在摘要层面,没把完整的成本拆解细节放出来。

9月3日星期四

Hugging Face 博客

用 100 步 GRPO 微调 3.5 亿参数模型,结构化输出合规率从 22.6% 提到 29.7%

Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...

推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。

8月28日星期五

Hacker News 首页

一套不用框架、在 Colab 上免费跑的 AI 工程师实操笔记

calmrocks 在 GitHub 上放出了一组 Colab 笔记本,面向 AI 工程师和前线部署工程师。内容覆盖了模型 API 调用、结构化输出、工具调用、外挂资料库(RAG)、把评测当主心骨的开发思路、从零手写 agent 循环、工具设计、安全护栏、MCP、Skills、微调与 LoRA 的对比、提示词注入攻击、LLMOps 以及客户落地技巧。所...

推荐理由:一套免费 Colab 笔记本,把 RAG、agent、微调、安全这些环节串起来了,而且不依赖任何框架,评测驱动、从零手写 agent 循环。对一线工程师来说实用价值很高。分数定在 72,因为目前还是个人开源项目,没有社区验证或多方讨论,我会先打个折。

8月27日星期四

Anthropic News

Anthropic 开放 1 万个科研人员 Claude 席位并扩大 AI for Science 计划

Anthropic 宣布通过新的 Claude team plan for scientists 向全球科研人员开放 1 万个席位,标准席位免费,5 倍用量上限的高级席位为每月 15 美元,为期一年,并计划在未来数月把该计划扩展到 1 万个席位之外。

推荐理由:Anthropic 公布面向科研人员的免费与折扣席位规模、申请门槛和额度上限,可据此判断科研团队的实际获取路径。

8月26日星期三

Hugging Face 博客

Hugging Face 教你微调多向量嵌入模型:一张 RTX 3090、14.5 小时,就能在自家数据上打败通用检索器

Sentence Transformers v6.0 新增了 MultiVectorEncoder 模型类型,专门做 ColBERT 那种“晚交互”检索——也就是查询和文档各自编码成多个向量,最后再逐 token 算分,比单向量模型更精细。这篇博客手把手教你怎么微调这种模型,作者用一张 RTX 3090(24GB 显存)只跑了 14.5 小时,训练出一...

8月25日星期二

Mistral AI

Mistral 与 HUMAIN 达成战略合作,推进沙特及中东主权 AI

Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。

8月6日星期四

Computing Life · Share · 鸭哥调研

微调回来了,但这次是为了省钱,不是为了让模型更聪明

2026年,工程团队重新捡起微调,目标变了:不是给模型灌新知识或提升推理能力,而是把高频、窄领域的推理成本打下来。FermiSense用Qwen3.5-9B做电商审核,每千次调用成本从几十美元压到0.5美元;Intercom的客服小模型解决率73.1%,成本只有GPT-5.4的五分之一。视觉端,鸭哥的DINOv3分类器工作流只用了839张审核样本就训出...

推荐理由:一篇有工程实感的趋势观察,FermiSense、Intercom 和视觉分类器三个案例都带着具体数字,把“微调回归”这个判断落到了成本账上。入选 featured 是因为观点明确、有数据支撑,不是空谈趋势。分数停在 78 而不是更高,主要是它属于综合观察和案例整理,没有给出新的方法论或评测框架,信息增量更多在验证已知方向。

8月4日星期二

Hacker News 首页

Soup:一个命令就能在 4GB 显存的笔记本上微调 8B 模型

Soup 把大语言模型的微调流程打包成一个命令行工具,最低只要 4GB 显存就能跑。它底层用了 QLoRA(一种省显存的微调方法)和 Unsloth 加速,支持 Llama、Mistral、Qwen 这些主流的 8B 模型。你准备好 JSONL 格式的数据集,写一个 YAML 配置文件,敲一句 `soup run` 就开始训练了。训练完还自带一个 St...

推荐理由:一个把 QLoRA 微调压到 4GB 显存、一句命令跑通的工具,实用性和知识性都到位,正好卡在 featured 门槛。但项目太新,没有社区验证或真实场景的 benchmark,争议性为零。如果后续有人贴出训练效果对比或社区开始用起来,分数会更有支撑。

7月31日星期五

AI HOT 精选

Inkling-Small 开源:总参数 276B、激活 12B,体积缩到四分之一,性能号称打平原版

Thinking Machines 把 Inkling 模型缩小到原来的四分之一,放出了 Inkling-Small。总参数量 276B,但每次推理只激活 12B 参数,相当于用更少的算力跑出相近的效果。完整权重已经公开,可以在 Tinker 上直接微调,也能在 Tinker Playground 里用文字、图片、音频跟它对话。不过正文没给出具体的基准...

推荐理由:Thinking Machines 把 Inkling 压缩到 276B 总参数、12B 激活参数,还开源了完整权重。压缩比和开放程度都挺实在,但正文没给出具体基准分数,所以分数没往上拉。

7月22日星期三

7月20日星期一

Product Hunt · AI

Thinking Machines 开源 Inkling:一个 975B 参数、专为微调设计的多模态模型

Thinking Machines 在 Product Hunt 上发布了 Inkling,一个 975B 参数的混合专家(MoE)模型,每次推理实际激活 41B 参数,支持 100 万 token 的上下文窗口。它原生处理文本、图片和音频,你可以手动控制它“思考”的深度。模型权重用 Apache 2.0 协议开源,主打让你拿去微调。配套的 Tinke...

推荐理由:Thinking Machines 扔了个 975B 参数的 MoE 开源模型,实际干活只动用 41B 参数,推理成本应该不高。100 万上下文加原生多模态,规格表看着挺能打。但正文没给任何跑分或真实延迟数据,所以分数先压一压,别急着冲太高。

7月16日星期四

Hacker News 首页

Thinking Machines 开源 Inkling:9750 亿参数 MoE 模型,激活 410 亿,能看图听音,还能自己微调自己

Thinking Machines 把 Inkling 模型完整开源了。这是个总参数 9750 亿的混合专家模型,每次推理只激活 410 亿参数,上下文窗口能塞进 100 万 token。它用 45 万亿个文本、图片、音频和视频 token 训练出来,原生就能处理文字、图片和声音。团队没把它吹成跑分王,而是定位成一个好改、好定制的基座模型——你可以控制...

推荐理由:Thinking Machines 第一个开源模型,参数规模够大,但定位不是跑分怪兽,而是可定制基座,差异化明显。没给 p1 是因为新团队首秀,生态和实际落地验证还缺,featured 刚好——值得关注,但先别急着封神。

7月15日星期三

Hugging Face 博客

Thinking Machines 发布 Inkling:一个万亿参数、原生多模态的开源模型

Inkling 是一个总参数量约 1 万亿(975B)、每次推理激活 41B 参数的混合专家(MoE)模型,能直接吃进文字、图片和音频,支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练,还内置了多 token 预测(MTP)投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本,Hugging...

推荐理由:Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型,规格写得挺满:975B 总参、41B 激活、100 万上下文、45T token 训练量,还自带投机解码加速。硬指标和实用性都有料,所以 H 和 K 都站得住。但团队没品牌积累,没故事可讲,R 这块确实弱,大家会先打个折观望。

7月14日星期二

Hacker News 首页

Thinking Machines 认为值得构建的未来是人形的,不是全自动的

Thinking Machines 发了一篇技术理念文章,核心就一句:AI 应该延伸人的意志和判断,而不是替代人。他们引用了哈耶克关于知识是分散的、默会的观点,又举了丰田把老师傅请回生产线教机器的例子,说明真正有用的知识藏在每个具体干活的人手里,没法被一个中心化模型全吞下去。所以他们要走的路是把模型也做得分散、多样,让用的人自己能微调、能持续干预。文章...

推荐理由:Thinking Machines 发了篇长文,核心就一句:AI 应该延伸人的意志,不是替代人。他们搬出哈耶克说知识是分散的、默会的,又举丰田的例子说明真正有用的知识藏在每个干活的人手里,没法被一个中心模型吞掉。所以主张模型也要做得分散、多样,让用的人自己能微调、能持续干预。观点立得鲜明,论证有料,但说到底还是一篇愿景文章,正文没披露具体产品计划或落地时间表,激动之前先打个折。

Hacker News 首页

DoorDash 用多个大模型当“陪审团”给菜品打标签,准确率比人工高 20%

DoorDash 的菜单上有几百万个菜品,名字写法千奇百怪,靠人一个个标辣度、菜系太慢也太贵。他们搭了一套 AI 标注平台,同时看菜名、图片和网页搜索结果来推断属性。最特别的是,他们不用人审,而是让多个强模型组成“陪审团”独立投票、取共识,标注准确率比普通人工审核高出约 20%。另外,他们用“上下文优化代理”在几分钟内自动迭代提示词,把精度又提升了 2...

推荐理由:DoorDash这篇工程博客分享了一套多模态+LLM陪审团的标注流水线,有具体准确率数字和自动调提示词的玩法。对搞AI数据管道的同学挺有启发,但外卖菜单这个领域太垂直,受众面不够广,所以R轴没打勾,整体放在featured档。

6月10日星期三

r/LocalLLaMA

用约3美元API调用微调Qwen2.5-7B,在特定任务上达到Claude Haiku 96%的表现

一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...

推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。

6月9日星期二

AI HOT 精选

腾讯混元开源 UniRL:一套强化学习框架同时管图像生成和语言模型,还带了两个新算法

UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里,流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度,可以自由组合,目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法:Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束,训练更稳...

推荐理由:UniRL 不是新模型发布,而是一个多模态强化学习的训练框架,把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦,搭配开源的两个算法(Flow-DPPO 和 DRPO),对做多模态对齐和微调的从业者来说,省了自己搭轮子的功夫。信息量够、开源动作实在,但属于基础设施层发布,不是旗舰模型,所以重要性给到 81,放在 featured 位置。

彭博科技

马斯克从 Starlink 调人来管 Grok 的训练团队

彭博社的消息说,xAI 从 SpaceX 的 Starlink 部门拉了一位高管过来,接手 Grok 模型的训练团队,顶替了之前负责的年轻工程师 Diego Pasini。不过正文被付费墙挡住了,具体是谁、什么时候上任、训练流程会怎么变,这些都没披露。

推荐理由:HKR 三项都过了,但本质是一次训练团队负责人变动,不是模型发布或高管离职。彭博社的信源和 Diego Pasini 这个细节让它够得上 featured 门槛。正文被付费墙挡住,具体是谁、什么时候上任、训练流程会怎么改都没披露,我会先打个折,不往大了吹。