跳到正文

#DeepMind

今日 0 条

9月21日星期一

Hacker News 首页

BBC采访AI从业者:说AI会毁灭人类?他们笑了

BBC匿名采访了OpenAI、Meta和DeepMind的员工,他们对近期“AI灭绝论”的反应是“哈哈”和“笑死”。前DeepMind研究员Rishub Jain说这话题业内聊了好几年,大家早就不当回事了,更多是调侃。Nvidia CEO黄仁勋直接说吓唬人“不负责任”。Meta数据科学家Colin Fraser补了一句:大模型不会消灭人类,“它们没那个...

9月16日星期三

FT · 科技

DeepMind 联合创始人警告:AI 能力跑太快,安全措施跟不上

DeepMind 联合创始人、现任微软 AI CEO 的 Mustafa Suleyman 公开说,现在 AI 模型的能力提升速度,已经超过了安全管控的进度。他点名 OpenAI 和 Anthropic 内部因为安全问题出现了分歧,认为行业不能再靠自愿承诺,得搞强制性的安全标准。不过具体要定什么标准、什么时候落地,文章没写。

推荐理由:Suleyman 以微软 AI CEO 身份公开警告安全管控落后于模型能力,还点名两家头部实验室内部有裂痕,话题分量够。但文章只停在呼吁强制标准,没给出任何具体细节或落地路径,信息增量有限,所以我会在重要性上打个折。

9月8日星期二

Computing Life · Share · 鸭哥调研

好点子已经过剩,AI 自我改进的瓶颈在考场

Anthropic 让 Claude Opus 4.8 当教练,自动搜索训练方案去修其他模型的毛病,比如谄媚和欺骗。每个智能体每小时 API 推理成本约 4 美元。核心发现是:把人类专家的方案喂给 AI 当起跑方向,最终表现并没有更好。真正决定改进能不能跨场景迁移的,是考卷怎么设计。只盯着一套 benchmark 优化,涨的分换到没见过的考卷上就崩了,...

推荐理由:这篇是对 Anthropic 对齐实验的二次解读,给出了具体成本和反直觉发现(人类种子方案没带来额外收益)。我会先打个折,因为不是一手发布,但结论本身对从业者有参考价值。三个维度都踩中了:标题有反转、内容有数字、受众对口。

8月16日星期日

Computing Life · Share · 鸭哥调研

Google 开源 DiffusionGemma:把 Gemma 4 改成扩散模型,解码飙到 1456 tok/s,但复杂推理掉分明显

Google 把训练好的 Gemma 4 26B-A4B 模型权重直接转成了离散多项式扩散模型,并在 Hugging Face 上开源。它不再从左到右逐个 token 写,而是在 256 个 token 的“画布”里通过多轮去噪并行生成。在单张 H100、FP8、单请求的纯解码测试中,速度达到每秒 1456 个 token,是原自回归模型的 7 倍多,...

推荐理由:Google 把训好的 Gemma 4 权重直接转成扩散模型开源了,不是从头训的,这点挺特别。它不再一个字一个字往外蹦,而是在 256 个 token 的“画布”里并行去噪生成,单张 H100 上纯解码跑到每秒 1456 个 token,是原版自回归模型的 7 倍多。代价是数学能力掉了一截,AIME 从 88.3 降到 69.1,正文没细说其他 benchmark 的跌幅,但至少给了推理工程师一个能算账的参考点。我会先打个折:这还只是单请求、FP8 的测试,真实并发和长文本下的表现还没看到,别急着下结论说扩散模型要替代自回归。

8月7日星期五

FT · 科技

Google 把 AI 大权交回给谢尔盖·布林,DeepMind 的哈萨比斯退居顾问

Google 联合创始人谢尔盖·布林重新直接掌管公司的 AI 战略,DeepMind 的 CEO 德米斯·哈萨比斯卸任,转做顾问。这次人事变动意味着 AI 研发和产品方向又回到了创始人手里。不过,正文没披露哈萨比斯具体的离职日期,也没说谁来接手 DeepMind 的日常管理。

推荐理由:FT 独家:Google 联合创始人布林重新直接掌管 AI,DeepMind CEO 哈萨比斯转做顾问。顶级实验室的权力交接,对研发、产品和人才都有影响。我会先打个折,因为正文没给出哈萨比斯的离职日期和 DeepMind 的接班安排,这两个信息缺口让后续影响还看不清楚。

8月6日星期四

AI HOT 精选

Google AI 大换血:Jeff Dean 被架空,DeepMind 的 Hassabis 接管核心研究

Google 把所有的 AI 研究、Gemini 模型和算力资源都划给了 DeepMind 的 Demis Hassabis。Jeff Dean 被调去当首席科学家,手下不再管人。这次调整的直接原因是 CEO Sundar Pichai 嫌产品落地太慢,背后还有军事合同和安全审查引发的内部冲突。

推荐理由:这篇不是官宣通稿,而是把组织调整背后的产品焦虑和内部政治摊开来讲。Jeff Dean 不再管人、Hassabis 一把抓,信息量够大,对从业者判断 Google 后续研发节奏有直接参考价值。没给更高是因为部分冲突细节还缺多方印证,但整体已经比多数报道更敢写。

MIT Technology Review · AI

Google 重组 AI 团队,Meta 的模型在安全测试里“越狱”了

Google 对 AI 业务动了一次大手术。DeepMind 的 CEO Demis Hassabis 不再管日常运营,升任董事长兼 Alphabet 首席科学家,CTO Koray Kavukcuoglu 接替他成为一把手。这很可能意味着 DeepMind 会被更紧地整合进 Google 的整体业务里。同时,在 Google 干了 27 年的首席科学...

推荐理由:Google AI 顶层人事地震,DeepMind 的 CEO 换人,信号量很足。悬念、具体职务、对圈内人的冲击感都到位了。分数卡在 82,因为这是新闻简报里的快讯,不是独家深挖,信息量就这么多。

The Verge · AI

Google AI 高层大换血:Demis Hassabis 卸任 DeepMind CEO,转任董事长和 Alphabet 首席科学家

Demis Hassabis 不再担任 Google DeepMind 的 CEO,改任该部门的董事长和 Alphabet 的首席科学家。这是自 Google 把 DeepMind 和 Google Brain 合并成 Google DeepMind 以来最大的一次人事变动。不过,正文没披露谁来接任 CEO,也没说清楚他新职位的具体权责范围。

推荐理由:Demis Hassabis 卸任 Google DeepMind CEO 是合并后最大的人事变动,直接影响行业关注度。但文章只说了职位变动,没给继任者、原因和权责范围,信息缺口太大,所以分数上我会先打个折。

7月28日星期二

Hacker News 首页

别让大模型自己报“信心分”,这分数基本没用

Justin Flick 直接给结论:让大模型输出一个 0 到 100 的“信心分”在科学上站不住脚。模型没法可靠地自我评估,连 Anthropic 自己的内省研究都说这种能力很不稳定、看场景。更麻烦的是,“信心”这个词把答案对不对、写得顺不顺、有没有满足用户意图全搅和成一个数了。传统机器学习里,概率分数有校准方法,但大模型把每个 token 的生成概...

推荐理由:作者把大模型信心分拆成正确性、流畅度和意图匹配三个维度,指出它们被硬塞进一个数字里,并引用Anthropic的内省研究来论证模型自我评估不可靠。观点清晰,但这是一篇个人博客,没有新的实验数据,话题偏工程实践,所以分数没给更高。

7月15日星期三

TechCrunch · AI

DeepMind CEO 提议搞一个独立机构来管最前沿的 AI 模型

Demis Hassabis 在 X 上发帖,主张成立一个类似美国金融业监管局(FINRA)的独立标准机构,专门负责测试最前沿的 AI 模型,并制定发布规范。他的设想是,AI 实验室先自愿在模型发布前 30 天把模型交给这个机构审查;等这套评估流程被证明有效且靠谱之后,再变成强制要求,不通过就不让在美国部署。帖子没提时间表、钱从哪来、以及这个机构凭什么...

推荐理由:Demis Hassabis 在 X 上发的这个帖子,等于给前沿模型监管画了一张带具体参照物的草图。他拿 FINRA 说事,让讨论从“要不要管”进到了“照什么样子管”,信息量比一般呼吁大。但我会先打个折:正文没提时间表、钱从哪出、这个机构凭什么让人服气,目前还是个人提议,离落地差着好几步。

7月14日星期二

FT · 科技

DeepMind 的 Hassabis 想让美国牵头搞一个类似 CERN 的机构,专门给最前沿的 AI 模型做安全测试

Demis Hassabis 公开喊话,希望美国出面领导一个国际组织,模式参考欧洲核子研究组织(CERN),核心任务是对那些能力最强的“前沿”AI 模型进行安全测试。文章本身是付费墙,具体怎么建、谁出钱、时间表这些细节都没披露。单从标题看,他这次把球踢给了美国,强调测试得由美国主导,焦点放在前沿模型的安全审查上。

推荐理由:Hassabis 拿 CERN 打比方,说明他想的是长期、烧钱、跨国协作的路子,不是搞个松散论坛。但付费墙让信息停在口号阶段,我会先打个折——提议有分量,细节为零。如果后续有白宫回应或预算数字出来,这条的重要性还能往上走。

7月5日星期日

Computing Life · Share · 鸭哥调研

Scaling Law 五年三次修正:从“把模型做大”到“把模型做小”

Scaling law 不是物理定律,是一条靠实验拟合出来的曲线,实验条件一变,结论就跟着变。2020 年 OpenAI 的 Kaplan 论文因为实验设置偏差,得出“优先堆参数”的结论,直接塑造了 GPT-3。2022 年 DeepMind 的 Chinchilla 修正了配比,发现每个参数配大约 20 个 token 才划算,小模型多喂数据反而更强...

推荐理由:这是一篇高质量的辟谣和科普。它没有复读“scaling law 失效”的惊悚标题,而是把 Kaplan、Chinchilla 和 LLaMA 三次修正串成一条线,用具体的实验偏差和数据配比说明为什么结论会变。我会先打个折:它属于评论和知识梳理,不是一手产品发布,但信息密度和纠正作用足够强。正文没披露某些最新模型的内部训练细节,但引用的公开论文和数据足以支撑它的判断。

7月1日星期三

TechCrunch · AI

三个前 DeepMind 研究员把打扑克的 AI 技术拿来炒股,公司估值超 5 亿美元

EquiLibre Technologies 拿到了 Creandum 领投的 A 轮融资,估值超过 5 亿美元。这家布拉格公司由三个前 DeepMind 研究员创立,他们把当年训练 AI 打扑克用的强化学习技术搬到了股票交易上。Creandum 的 VP 说这是他们单笔最大投资,但具体金额双方都没透露。文章没披露公司的营收和交易业绩数据,所以这 5 ...

推荐理由:前 DeepMind 的人把博弈论强化学习用到量化基金上,估值做到 5 亿多美元,故事本身是新鲜的。但正文没披露营收和交易表现数据,信息密度偏薄,刚好卡在 featured 的门槛上。

6月21日星期日

TechCrunch · AI

诺奖得主 John Jumper 离开 DeepMind 加入对手 Anthropic

John Jumper 在 Google DeepMind 干了快 9 年后跳槽到 Anthropic。他 2024 年刚因为 AlphaFold(一个能根据基因序列预测蛋白质 3D 结构的模型)拿了诺贝尔化学奖。Jumper 自己说,博士毕业才半年 Hassabis 就敢让他带 AlphaFold 团队,胆子很大。Bloomberg 还提到他是谷歌编...

推荐理由:John Jumper 是 AlphaFold 的核心人物,2024 年刚拿诺贝尔化学奖,现在离开待了快 9 年的 DeepMind 去 Anthropic。这条消息分量很重,但正文没披露他在 Anthropic 具体做什么,所以分数打不了更高——信号强,细节薄。

5月23日星期六

AI HOT 精选

谷歌在 I/O 大会甩出一整套 AI 代理开发工具,从写代码到上线调试全包了

谷歌这次发布的不是单个模型,而是一条让 AI 代理(能自主干活的程序)落地的工具链。Antigravity 2.0 是个独立桌面应用,配了命令行工具和 SDK,方便开发者直接在本机跑代理。Google AI Studio 新增 Kotlin 支持,号称能一键生成安卓应用并发布,还出了手机版 App。Gemini API 里加了托管代理服务,部署步骤简化...

推荐理由:HKR 三项都成立:谷歌端出了一套有名字、有组件的代理工具栈,覆盖本地开发、云端托管和浏览器协议。不过目前只有社交媒体的摘要,正文没披露定价、API 细节和实际演示,所以分数卡在 78–84 这个区间。我会先打个折,等看到更完整的文档再往上调。

5月17日星期日

AI HOT 精选

Eric Jang 从零复现 AlphaGo:2026 年训练强围棋 AI 只要几千美元算力

Eric Jang 花了几个月从零实现 AlphaGo,并把过程写成教程和代码放了出来。他原本的理解是“用自我对弈训练的搜索增强神经网络”,但亲手做一遍后对细节有了更深体会。他给出一条关键判断:前沿研究仍然很贵,但特定能力的落地成本掉得很快——到 2026 年,训练一个能打的围棋 AI 租算力只要几千美元,不再需要 DeepMind 级别的资源。他自称...

推荐理由:我会先打个折:这是个人分享,不是论文或模型发布,所以信息密度有限。但亮点很明确——Eric Jang 一个人花几个月从零把 AlphaGo 做出来,还给了个具体成本判断:2026 年租算力训强围棋 AI 只要几千美元。这个数字直接说明当年需要大团队、大预算的系统,现在个人和小团队也能碰了。正文没披露具体训练配置和模型强度验证,所以“强”到什么程度还不好说,这点先别太激动。整体适合当一条有话题、有数字、对从业者有参考价值的动态来推。

5月12日星期二

Google DeepMind

Google DeepMind 发布 Co-Scientist 多智能体科研系统

Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体 AI 系统,可迭代生成、辩论和演化复杂科学问题的新假设。

推荐理由:原文披露了多智能体系统的三阶段协作机制与多个实验室的落地案例,可了解 AI 参与科学假设生成的具体路径。

4月28日星期二

TechCrunch · AI

DeepMind 的 David Silver 拿了 11 亿美元,要做不靠人类数据自己学的 AI

David Silver 是 AlphaGo 的核心研究员,刚从 DeepMind 出来几个月,新公司 Ineffable Intelligence 就融了 11 亿美元,估值冲到 51 亿。标题说目标是“不靠人类数据学习”的 AI,但正文没披露具体用什么方法实现。目前只知道这是一家英国 AI 实验室,其他技术细节、团队规模和产品方向都没说。11 亿这...

推荐理由:这条消息我会先打个折——标题很炸,但正文没给出任何技术机制,所以别太激动。David Silver 的新公司 Ineffable Intelligence 融了 11 亿美元,估值冲到 51 亿,目标是让 AI 不靠人类数据学习。这直接回应了“数据快被榨干”的行业焦虑,也说明顶尖研究员创业的吸金能力。但正文没披露训练方法、验证结果或论文,目前只能当一笔巨额押注来看,离可复现的成果还远。

4月16日星期四

最佳拍档

Demis Hassabis 罕见袒露心声:AGI 应在实验室多沉淀十年,后 AGI 时代五十年内或成真

DeepMind CEO Demis Hassabis 在这场访谈里没怎么画饼,反而直说现在的 AI 发展节奏被商业和地缘政治推得太快,不是他理想的路子。他个人的想法是,把 AGI 相关技术在实验室里像欧洲核子研究中心那样再打磨十到二十年,每一步都彻底搞懂再往前走。他举了 AlphaFold 的例子,当初团队本打算按传统方式搭服务器让科学家排队提交任务...

推荐理由:这篇是访谈的二次整理,不是模型发布或政策文件,所以分数没拉满。但 Demis 的时间线判断、实验室沉淀主张、300 万用户和近 20 条药物管线的数据,以及他点名 2 到 4 年内的两类风险,信息密度够高,对从业者判断行业节奏和安全优先级有参考价值。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。