AMD 以 82 亿美元收购世界模型初创公司 World Labs
AMD 宣布以约 82 亿美元全股票交易收购专注空间智能的初创公司 World Labs,交易预计在 2026 年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 领导团队,出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报并负责前沿研究。
推荐理由:交易金额与团队去向之外,原文还梳理了世界模型路线与 AMD 追赶 Nvidia 的硬件逻辑。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
AMD 宣布以约 82 亿美元全股票交易收购专注空间智能的初创公司 World Labs,交易预计在 2026 年底前完成,尚待监管批准。World Labs 创始人李飞飞将加入 AMD 领导团队,出任执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报并负责前沿研究。
推荐理由:交易金额与团队去向之外,原文还梳理了世界模型路线与 AMD 追赶 Nvidia 的硬件逻辑。
Anthropic 的 Beneficial Deployments 与应用 AI 团队与 CEPI、WHO 非洲区域办事处、INRB 合作,在刚果(金)Bundibugyo 型埃博拉疫情(BDBV)响应中使用 Claude。
推荐理由:原文披露 Claude 在刚果(金)埃博拉疫情中的具体用法与耗时变化,可了解 AI 在公共卫生应急中的落地边界。
作者用 Gemini 3.1 Pro 给 4290 条 Reddit 评论打上刀具品牌、型号和钢材的标签,花了 9 美元。然后用这些标签微调了一个叫 GLiNER 的开源命名实体识别模型。训练好的模型在本地跑,跟 Gemini 的标注结果对比,F1 分数达到 0.83,而直接零样本跑 GLiNER 只有大约 0.65。训练在 Tesla T4 上跑了 ...
推荐理由:一篇很实在的微调实战记录。作者用 Gemini 3.1 Pro 给 Reddit 刀具评论打标,只花了 9 美元就攒出 4290 条训练数据,把开源 NER 模型 GLiNER 的 F1 从 0.65 提到了 0.83。我会先打个折:领域太窄(刀具品牌型号钢材),分数不能给太高。但方法本身是通用的——用大模型蒸馏标签、微调小模型、本地部署省 API 钱——对从业者来说直接能用。正文没披露训练脚本细节和推理延迟,这点有点可惜。
Maksim Ilin 把 LinkedIn、世界经济论坛、斯坦福、普华永道和贝恩的数据拼在一起,画出了 2026 年 9 月的 AI 就业图景。最抢手的岗位是 AI 工程师,就是把大模型塞进产品里干活的人,美国周均新增约 1550 个职位,年薪中位数 17.6 万美元。最顶尖的是前沿实验室的研究科学家,Anthropic 年薪中位数约 74.6 万美...
推荐理由:一篇个人博客把几份公开报告的数据揉在一起,给出了 2026 年 9 月 AI 岗位的薪资和需求全景。数字具体、来源可查,对从业者有直接参考价值。扣分是因为本质上是二手数据整合,不是一手调研,权威性有限,所以停在 72 分。
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,是 AlphaFold Database 的 30 多倍。
推荐理由:原文给出覆盖 90 亿单核苷酸变异的预测数据集与 AVI 评分,读者可据此了解基因组变异解读的新工具形态。
Lambda 工程师 Zach Mueller 公开承认,他家里那套 GPU 机架不省钱,电费可能翻倍,回报全在磨练技能。文章用 2026 上半年数据说明开源模型能力已够用,但自建部署的账比直觉复杂。核心要算三本账:钱上,两张 H100 每月得跑约 20 亿 token 才能打平云端 API,利用率一高延迟就涨,交互体验和成本天生打架;数据上,商业合规...
推荐理由:Zach Mueller 作为 Lambda 的工程师,亲手拆了自建 GPU 的省钱幻觉,三本账的框架很实在。扣分是因为这是一篇观点总结,不是一手发布,而且正文停在摘要层面,没把完整的成本拆解细节放出来。
Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...
推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。
calmrocks 在 GitHub 上放出了一组 Colab 笔记本,面向 AI 工程师和前线部署工程师。内容覆盖了模型 API 调用、结构化输出、工具调用、外挂资料库(RAG)、把评测当主心骨的开发思路、从零手写 agent 循环、工具设计、安全护栏、MCP、Skills、微调与 LoRA 的对比、提示词注入攻击、LLMOps 以及客户落地技巧。所...
推荐理由:一套免费 Colab 笔记本,把 RAG、agent、微调、安全这些环节串起来了,而且不依赖任何框架,评测驱动、从零手写 agent 循环。对一线工程师来说实用价值很高。分数定在 72,因为目前还是个人开源项目,没有社区验证或多方讨论,我会先打个折。
Anthropic 宣布通过新的 Claude team plan for scientists 向全球科研人员开放 1 万个席位,标准席位免费,5 倍用量上限的高级席位为每月 15 美元,为期一年,并计划在未来数月把该计划扩展到 1 万个席位之外。
推荐理由:Anthropic 公布面向科研人员的免费与折扣席位规模、申请门槛和额度上限,可据此判断科研团队的实际获取路径。
2026年,工程团队重新捡起微调,目标变了:不是给模型灌新知识或提升推理能力,而是把高频、窄领域的推理成本打下来。FermiSense用Qwen3.5-9B做电商审核,每千次调用成本从几十美元压到0.5美元;Intercom的客服小模型解决率73.1%,成本只有GPT-5.4的五分之一。视觉端,鸭哥的DINOv3分类器工作流只用了839张审核样本就训出...
推荐理由:一篇有工程实感的趋势观察,FermiSense、Intercom 和视觉分类器三个案例都带着具体数字,把“微调回归”这个判断落到了成本账上。入选 featured 是因为观点明确、有数据支撑,不是空谈趋势。分数停在 78 而不是更高,主要是它属于综合观察和案例整理,没有给出新的方法论或评测框架,信息增量更多在验证已知方向。
Soup 把大语言模型的微调流程打包成一个命令行工具,最低只要 4GB 显存就能跑。它底层用了 QLoRA(一种省显存的微调方法)和 Unsloth 加速,支持 Llama、Mistral、Qwen 这些主流的 8B 模型。你准备好 JSONL 格式的数据集,写一个 YAML 配置文件,敲一句 `soup run` 就开始训练了。训练完还自带一个 St...
推荐理由:一个把 QLoRA 微调压到 4GB 显存、一句命令跑通的工具,实用性和知识性都到位,正好卡在 featured 门槛。但项目太新,没有社区验证或真实场景的 benchmark,争议性为零。如果后续有人贴出训练效果对比或社区开始用起来,分数会更有支撑。
Thinking Machines 把 Inkling 模型缩小到原来的四分之一,放出了 Inkling-Small。总参数量 276B,但每次推理只激活 12B 参数,相当于用更少的算力跑出相近的效果。完整权重已经公开,可以在 Tinker 上直接微调,也能在 Tinker Playground 里用文字、图片、音频跟它对话。不过正文没给出具体的基准...
推荐理由:Thinking Machines 把 Inkling 压缩到 276B 总参数、12B 激活参数,还开源了完整权重。压缩比和开放程度都挺实在,但正文没给出具体基准分数,所以分数没往上拉。
Thinking Machines 在 Product Hunt 上发布了 Inkling,一个 975B 参数的混合专家(MoE)模型,每次推理实际激活 41B 参数,支持 100 万 token 的上下文窗口。它原生处理文本、图片和音频,你可以手动控制它“思考”的深度。模型权重用 Apache 2.0 协议开源,主打让你拿去微调。配套的 Tinke...
推荐理由:Thinking Machines 扔了个 975B 参数的 MoE 开源模型,实际干活只动用 41B 参数,推理成本应该不高。100 万上下文加原生多模态,规格表看着挺能打。但正文没给任何跑分或真实延迟数据,所以分数先压一压,别急着冲太高。
Thinking Machines 把 Inkling 模型完整开源了。这是个总参数 9750 亿的混合专家模型,每次推理只激活 410 亿参数,上下文窗口能塞进 100 万 token。它用 45 万亿个文本、图片、音频和视频 token 训练出来,原生就能处理文字、图片和声音。团队没把它吹成跑分王,而是定位成一个好改、好定制的基座模型——你可以控制...
推荐理由:Thinking Machines 第一个开源模型,参数规模够大,但定位不是跑分怪兽,而是可定制基座,差异化明显。没给 p1 是因为新团队首秀,生态和实际落地验证还缺,featured 刚好——值得关注,但先别急着封神。
Inkling 是一个总参数量约 1 万亿(975B)、每次推理激活 41B 参数的混合专家(MoE)模型,能直接吃进文字、图片和音频,支持 100 万 token 的上下文窗口。它用 45 万亿个多模态 token 训练,还内置了多 token 预测(MTP)投机解码层来加速推理。模型提供了 BF16 和压缩后的 NVFP4 两种版本,Hugging...
推荐理由:Thinking Machines 这家新面孔一上来就扔了个近万亿参数的多模态 MoE 模型,规格写得挺满:975B 总参、41B 激活、100 万上下文、45T token 训练量,还自带投机解码加速。硬指标和实用性都有料,所以 H 和 K 都站得住。但团队没品牌积累,没故事可讲,R 这块确实弱,大家会先打个折观望。
Thinking Machines 发了一篇技术理念文章,核心就一句:AI 应该延伸人的意志和判断,而不是替代人。他们引用了哈耶克关于知识是分散的、默会的观点,又举了丰田把老师傅请回生产线教机器的例子,说明真正有用的知识藏在每个具体干活的人手里,没法被一个中心化模型全吞下去。所以他们要走的路是把模型也做得分散、多样,让用的人自己能微调、能持续干预。文章...
推荐理由:Thinking Machines 发了篇长文,核心就一句:AI 应该延伸人的意志,不是替代人。他们搬出哈耶克说知识是分散的、默会的,又举丰田的例子说明真正有用的知识藏在每个干活的人手里,没法被一个中心模型吞掉。所以主张模型也要做得分散、多样,让用的人自己能微调、能持续干预。观点立得鲜明,论证有料,但说到底还是一篇愿景文章,正文没披露具体产品计划或落地时间表,激动之前先打个折。
DoorDash 的菜单上有几百万个菜品,名字写法千奇百怪,靠人一个个标辣度、菜系太慢也太贵。他们搭了一套 AI 标注平台,同时看菜名、图片和网页搜索结果来推断属性。最特别的是,他们不用人审,而是让多个强模型组成“陪审团”独立投票、取共识,标注准确率比普通人工审核高出约 20%。另外,他们用“上下文优化代理”在几分钟内自动迭代提示词,把精度又提升了 2...
推荐理由:DoorDash这篇工程博客分享了一套多模态+LLM陪审团的标注流水线,有具体准确率数字和自动调提示词的玩法。对搞AI数据管道的同学挺有启发,但外卖菜单这个领域太垂直,受众面不够广,所以R轴没打勾,整体放在featured档。
一位Reddit用户用1040组偏好样本(DV-DPO,一种让模型学会回答风格的方法)微调了Qwen2.5-7B,成本按Claude Haiku的API价格算大约3美元,没花钱请人标注。在特定领域任务上,这个微调模型的综合得分达到了Claude Haiku的96%。部署在4-bit量化的T4机器上,生成一次回答的延迟是11秒。不过正文没披露具体是什么任...
推荐理由:这条信息本身是个Reddit帖子,任务范围和评测细节正文没展开,所以分数先打个折停在74。但3美元、零标注、96% Haiku这几个数字组合在一起,对想省钱又不想雇人标数据的团队来说,是个值得看一眼的信号。
UniRL 把扩散模型、流匹配模型、大语言模型和视觉语言模型的强化学习训练塞进了同一个后训练循环里,流程就是生成、打分、算优势、更新参数再同步。框架把模型和算法拆成两个独立维度,可以自由组合,目前已经用在 Hunyuan-Image 3 和 Bagel 上。这次一并开源了两个算法:Flow-DPPO 给流/扩散模型加了基于精确散度的信任域约束,训练更稳...
推荐理由:UniRL 不是新模型发布,而是一个多模态强化学习的训练框架,把扩散、流匹配、LLM 和 VLM 的 RL 训练流程统一了。框架设计上把模型和算法解耦,搭配开源的两个算法(Flow-DPPO 和 DRPO),对做多模态对齐和微调的从业者来说,省了自己搭轮子的功夫。信息量够、开源动作实在,但属于基础设施层发布,不是旗舰模型,所以重要性给到 81,放在 featured 位置。
彭博社的消息说,xAI 从 SpaceX 的 Starlink 部门拉了一位高管过来,接手 Grok 模型的训练团队,顶替了之前负责的年轻工程师 Diego Pasini。不过正文被付费墙挡住了,具体是谁、什么时候上任、训练流程会怎么变,这些都没披露。
推荐理由:HKR 三项都过了,但本质是一次训练团队负责人变动,不是模型发布或高管离职。彭博社的信源和 Diego Pasini 这个细节让它够得上 featured 门槛。正文被付费墙挡住,具体是谁、什么时候上任、训练流程会怎么改都没披露,我会先打个折,不往大了吹。