跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 381–400 条 · 共 409 条

4月21日星期二

机器之心 · 公众号

谢尔盖·布林重回一线盯 AI 编程,谷歌拉了一支突击队

谷歌悄悄组了一支 AI 编程突击队,由前 DeepMind 研究员 Sebastian Borgeaud 带队,谢尔盖·布林和 Koray Kavukcuoglu 直接参与,目标是提升长上下文编程能力和内部代码自动化。压力信号很直接:谷歌自己说约 50% 的代码已由编程 agent 生成、工程师负责审核,而 Anthropic 那边放话 Claude ...

推荐理由:HKR 三项都成立:布林回归的 hook 够强,谷歌 50% 代码由 agent 写的数字是硬信息,AI 编程的竞争态势也是圈内真痛点。但正文没披露团队规模、上线时间和具体模型版本,所以没给更高优先级。

Hacker News 首页

就算号称“无审查”的模型,也不敢把话说明白

Morgin.ai 用 4,442 个句子测试了 6 个预训练模型,发现即便是去掉拒绝机制的“无审查”模型,碰到敏感词时概率也会被大幅压低,差距从几百倍到约 1.6 万倍不等。他们管这叫“退缩”:模型不会拒绝回答,但会把敏感词的概率压到几乎为零。比如同一句话填空,Pythia-12B 首选“驱逐出境”,概率 23.27%;而 Qwen3.5-9B 把同...

推荐理由:这篇文章最值钱的地方是把“无审查”这个标签撕开给你看。它没讲拒答,而是讲预训练阶段词的概率分布就已经歪了——比如 qwen3.5-9b-base 把 deportation 排到第 506 位,概率只有 0.0014%。我会先打个折:这只是单篇研究博客,不是正式论文,样本和模型覆盖有限。但它的视角够刁,用 4,442 个上下文测出的 flinch 现象,比泛泛讨论“模型审查”实在得多。对从业者来说,提醒了一件事:别光盯着后训练的安全对齐,预训练数据的分布偏移才是更底层的坑。这点先别太激动,但值得跟。

彭博科技

Google 要发新的 AI 推理芯片,直接跟英伟达抢生意

Bloomberg 这条视频提到 Google 准备推出一批专做推理的新 AI 芯片,正面挑战英伟达。不过正文被付费墙挡了,没披露具体发布时间、型号、性能参数、定价和客户。我会先打个折:目前能确认的信号是推理芯片的供给竞争在升温,但产品到底多能打、什么时候落地,都还是未知数。

推荐理由:HKR-H 和 HKR-R 通过,因为这条消息把 Google 和 Nvidia 在推理芯片上的直接竞争摆上了台面。HKR-K 弱:报道只确认了推理这个方向,芯片叫什么、跑分多少、卖多少钱、什么时候出、谁会买,这些关键信息正文都没披露,所以信息缺口很大。

彭博科技

Google 本周要发新一代 TPU,专做推理

Bloomberg 的视频预告说 Google 这周会公布新的定制芯片,定位是 AI 推理任务。正文被付费墙挡了,没拿到具体型号、性能、功耗和价格。我会先打个折:重点不是又发芯片了,而是这批 TPU 能不能把推理成本打下来、供货稳不稳。

推荐理由:标题说新芯片,但正文其实只给了两个信息:本周发布、面向推理。我会先打个折——型号、性能、功耗、价格一概没披露,现在激动还太早。之所以还放在 featured 里,是因为 Google 把新 TPU 直接框在推理上,这对算力成本和供给是个实打实的信号,AI 团队会追。但信息缺口太大,重要性停在 74 是合理的。

4月19日星期日

量子位 · 公众号

高德发布全栈具身智能体系 ABot,号称在 15 项指标上拿了最优

高德这次公开的 ABot 是一套想让机器人真正干活的全栈技术体系,分视觉感知、物理世界模型和视觉语言动作模型几块。ABot-3DGS 能用厘米级地图数据重建上万平米的三维场景,ABot-PhysWorld 则是一个 140 亿参数的扩散模型,用 300 万条真实机械臂操作视频训练,让机器人先在大脑里模拟动作再执行。文章说横扫 15 项 SOTA,但具体...

推荐理由:高德这次公开的 ABot 体系,我会先打个折——15 项 SOTA 具体是哪些基准、跟谁比,正文没列,挑战赛名称也没给,这点先别太激动。但能聊的东西确实有:ABot-3DGS 拿厘米级地图和轨迹数据生成了上万组 3D 场景,号称覆盖率 99%,如果属实,等于用地图老本行给具身训练铺了一条低成本数据管道;ABot-PhysWorld 用 14B 的 DiT 加 300 万条真实操作视频做物理判别训练,规模不小。真正该盯的是他们把世界模型和 VLA 闭环绑在一起做的思路,不是单点炫技。开源范围和时间表都没披露,落地成色还得等。

r/LocalLLaMA

实测 8 个模型当桌游主持人:27B 小模型叙事质量干翻了 405B 巨无霸

作者用 6 个固定跑团场景测了 8 个模型,让它们当桌游主持人。评分用了 8 项自动指标加 3 个 LLM 裁判打分,整轮测试只花了约 0.02 美元。最终 google/gemma-3-27b-it 以 4.33 的综合叙事分排第一。标题说 27B 赢了 405B,但正文被屏蔽了,没披露那个 405B 具体是哪个模型,也没给出完整排名。这点先别太激动...

推荐理由:这篇来自 Reddit 的个人评测,钩子够锋利——小模型在叙事质量上干翻大模型,HKR 三项全中。我把它留在 featured 而不是更高,是因为正文截断了,405B 具体是哪个模型、完整排名都没给出来,信息有缺口,先别太激动。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

TechCrunch · AI

Google 的 AI Mode 现在能在桌面端 Chrome 里把网页和对话窗口并排打开

Google 在 4 月 16 日给桌面端 Chrome 的 AI Mode 加了一个并排浏览功能:你在 AI Mode 里点开一个链接,网页会在右侧打开,左侧的对话窗口不会消失。这样你一边看网页,一边可以接着问 AI 问题,AI 会结合当前页面内容和全网信息来回答。比如挑咖啡机时,你可以让 AI 直接告诉你某款好不好清洗。正文没提这个功能的具体推送范...

推荐理由:Google 把搜索对话和网页浏览塞进同一个工作流里,不再是“搜完就走”或“聊完再点”。正文给了上下文保留和页面+全网回答的机制,但覆盖范围、上线节奏和地区限制都没说,所以重要性先打个折,放在 featured 里观察。

4月16日星期四

Ben's Bites

Ben 的上下文清理小抄:别让 AI 被垃圾信息喂饱

Ben 在飞往旧金山的航班上没网,临时下载了 Gemma 4 26B 模型离线干活,顺便分享了他管理 AI 上下文窗口的几条硬经验。核心观点是:别迷信 100 万 token 的超长窗口,他根本不信任那种窗口下的稳定记忆,任务所需的完美回忆不该超过 15 万 token。他建议在上下文用量达到 60% 左右就收手,因为网页搜索会塞进大量你来不及看的 A...

推荐理由:这是一份个人工作流笔记,不是产品发布或论文,但给出的 60% 上下文红线和对 1M token 记忆的不信任,对天天跟 agent 打交道的人有直接参考价值。我会先打个折:正文没披露这些数字背后的系统测试,更像经验之谈,但胜在具体、可验证。污染链条那段提醒很实在,长上下文不是越大越好,垃圾进去只会放大。

最佳拍档

Demis Hassabis 罕见袒露心声:AGI 应在实验室多沉淀十年,后 AGI 时代五十年内或成真

DeepMind CEO Demis Hassabis 在这场访谈里没怎么画饼,反而直说现在的 AI 发展节奏被商业和地缘政治推得太快,不是他理想的路子。他个人的想法是,把 AGI 相关技术在实验室里像欧洲核子研究中心那样再打磨十到二十年,每一步都彻底搞懂再往前走。他举了 AlphaFold 的例子,当初团队本打算按传统方式搭服务器让科学家排队提交任务...

推荐理由:这篇是访谈的二次整理,不是模型发布或政策文件,所以分数没拉满。但 Demis 的时间线判断、实验室沉淀主张、300 万用户和近 20 条药物管线的数据,以及他点名 2 到 4 年内的两类风险,信息密度够高,对从业者判断行业节奏和安全优先级有参考价值。

TechCrunch · AI

谷歌给 Mac 做了个原生 Gemini 应用,快捷键一按就能用

谷歌在 4 月 15 日上线了 Gemini 的 Mac 原生应用,要求 macOS 15 以上系统。跟之前用网页版不同,现在按 Option + 空格就能在任何界面呼出它,不用切窗口。你可以把当前屏幕内容或本地文件直接丢给它,让它帮你总结图表、核对日期或写公式。应用还内置了 Nano Banana 生图和 Veo 生成视频的功能。简单说,谷歌终于追上...

推荐理由:Google 给 Mac 发了个原生 Gemini 应用,快捷键一按就能呼出,还能直接把整个屏幕或本地文件丢给它看。我会先打个折:这不算模型能力飞跃,更像在抢桌面入口和用户上下文。正文没提和网页版在回答质量上有没有区别,也没给延迟或资源占用数据,所以别急着说体验一定更好。但能共享屏幕和文件,意味着它想当个看得见你桌面的助手,这点比多一个客户端重要。整体是中等体量的产品更新,放在 featured 低位合适。

X · @dotey(宝玉)

OpenAI Agents SDK 加了内置沙箱和原生执行框架,TypeScript 版还在开发

OpenAI 给自家 Agents SDK 塞进了一个内置沙箱,Agent 可以直接在里面读写文件、跑代码、装依赖、保存状态,不用开发者自己搭环境。沙箱支持 Cloudflare、Vercel、Modal 等云厂商,也能接自己的方案。另一个更新是 Harness 架构,把状态存外面、计算跑里面,容器崩了能捡起来接着跑,不用重来,也能防提示注入导致凭证泄...

推荐理由:OpenAI 把 Agents SDK 从玩具级推到可上生产的级别,核心是两件事:内置沙箱让 agent 能安全跑代码和装东西,Harness 把执行和状态拆开,容器挂了任务还能接着跑。对做 agent 的团队来说,这省了自己搭隔离环境和写恢复逻辑的功夫。TypeScript 支持还在开发,正文没给时间,这点先别太激动。整体是工具链的扎实升级,不是概念发布,所以放 featured。

Google DeepMind

Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,已在 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 中开放预览。

推荐理由:原文给出新语音模型的音频标签控制方式、Elo 分数与多平台开放入口,可据此判断语音生成的可控性变化。

4月13日星期一

Google DeepMind

Google DeepMind 发布 Gemini Robotics-ER 1.6 机器人推理模型

Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力。

推荐理由:原文给出新模型在空间推理、多视角与仪表读数上的能力变化和开放入口,可据此判断机器人高层推理的进展。

最佳拍档

谷歌CEO皮查伊:2027年是企业AI落地爆发年,搜索不会死,会变成替你干活的管家

谷歌CEO皮查伊在2026年4月的一次专访里,把家底和判断都摊开了。他说明年(2027年)会是企业AI agent workflow(让模型进业务流程干活)的爆发点,AI将从程序员提效工具变成非技术岗位的智能核心。关于搜索,他认为不会被聊天机器人取代,而是会进化成一个“Agentic Manager”,能直接帮你规划旅行、处理多线程任务,他自己已经在用...

推荐理由:这不是产品发布,而是高管在访谈里给出的判断和内部数据,信号密度很高。Pichai 把 2027 年定为 Agent 爆发点,配合千亿级资本开支和毫秒级延迟管控,让这个判断比一般预测更有分量。搜索演进和算力稀缺这两条线也直接关联从业者当下的决策。分数没给到 P1,因为信息来自二手转述而非一手访谈原文,但 H、K、R 三项都扎实成立。

4月12日星期日

最佳拍档

DeepMind 用在线学习加主动探索,把 RLHF 的数据效率提升了 10 倍

Google DeepMind 团队在 Gemma 9B 上做了一组实验,证明 RLHF 数据效率低不是算法本身不行,而是用法错了。他们对比了四种算法:离线 RLHF 需要约 20 万条偏好标注才能达到 55% 左右的胜率;而他们提出的在线 RLHF 加上信息导向探索,不到 2 万条标注就做到了同样的水平,数据效率提升超过 10 倍。信息导向探索的核心...

推荐理由:我会先打个折:反馈是用 Gemini 1.5 Pro 模拟的,不是真人标的,1000倍增益也只是在不超过100万条标注区间外推出来的。但方法论值得看——在线 RLHF 加信息导向探索,让模型自己挑该问什么,把标注预算花在刀刃上。这点先别太激动,但如果是真的挺省钱。

4月10日星期五

最佳拍档

Sakana AI 开源 Shinka Evolve:让大模型自己写程序进化,用更少样本跑赢 AlphaEvolve

Sakana AI 开源了一个叫 Shinka Evolve 的框架,核心思路是让大语言模型像进化算法一样自己改代码、写新程序,不断迭代出更强的解法。它主要想解决谷歌 DeepMind 之前 AlphaEvolve 的一个痛点:太费资源,动不动就要评估上千个程序。Shinka Evolve 在经典的圆堆积问题上,用少得多的评估次数就超过了 AlphaE...

推荐理由:这篇值得 featured,但不到 P1。钩子清楚——用更少评估超越 AlphaEvolve,机制也讲得明白,比如用 UCB 老虎机在 GPT-5、Claude Sonnet 4.5、Gemini 之间动态选模,还加了程序交叉和全文件重写。对做 agent 的人来说,评估贵、任务设计和硬验证一直是头疼的事,文章直接点出系统仍需人类给题、自动发明问题和严格验证没解决,这点很实在。我会先打个折:关键指标、成本和主发布链接都没给,所以停在 80 分。

4月7日星期二

Latent Space

Gemma 4 首周下载量破 200 万,本地跑模型成了新趋势

Google 的 Gemma 4 上线第一周就冲到约 200 万次下载。做个对比:Gemma 3 过去一年总共 670 万次,Gemma 2 从 2024 年 6 月到现在 140 万次,而 Qwen 3.5 在大约一个半月里拿了约 2700 万次。这次最值得关注的是本地部署的速度——有人用 iPhone 17 Pro 跑 Gemma 4 E2B,通过...

推荐理由:这条消息的看点不是 Google 又发了个模型,而是首周 200 万下载这个数字本身,以及它和 Qwen 3.5 一个半月 2700 万的对比——开源模型的采用速度在明显变快。更实在的是有人已经在 iPhone 上跑出 40 tok/s,这对做端侧部署的人来说是个可参考的实测数据,不是公关稿里的理论值。我会先打个折:下载量不等于日活,正文也没披露留存或实际调用量,所以别直接当成市场份额来看。但生态支持列得挺全,至少说明主流推理框架没掉队,这点对选型有帮助。

X · @AnthropicAI

Anthropic 跟 Google、Broadcom 签了 TPU 大单,2027 年起用新芯片训练 Claude

Anthropic 发推说,他们和 Google、Broadcom 签了一份协议,要拿“好几个 GW”的下一代 TPU 算力,2027 年开始上线,用来训练和跑 Claude 模型。推文只提了“多个 GW”和 2027 这个时间点,没说是哪一代 TPU、合同金额多少、具体交付节奏。这不像普通采购公告,更像提前几年锁定训练和推理用的算力位子。

推荐理由:这不是普通的云服务采购消息,Anthropic提前几年就把未来训练和推理用的下一代TPU产能占住了。我会先打个折:正文没披露具体芯片代际、合同金额和交付节奏,所以没法判断性价比和实际落地风险。但“数吉瓦”这个量级本身就很说明问题——前沿模型对算力的饥渴已经大到要用发电厂的单位来计量了。对同行来说,这等于在算力军备竞赛里提前划了一块地盘,信号意义比合同细节更大。

4月3日星期五

X · @op7418(歸藏)

谷歌发布 Gemma 4,四个尺寸全 Apache 2.0 开源,主打本地跑 agent 和多模态

Gemma 4 一口气发了四个版本:E2B 给手机和 IoT 用,E4B 给移动端和 Jetson/树莓派,26B MoE 每次只激活 3.8B 参数、延迟低吞吐高,31B 全密集版适合桌面或单卡 H100。这次把 agent 工作流当第一优先级,原生支持函数调用、JSON 输出和系统指令,还直接能处理图像、视频和语音转文本,可以做本地语音助手。全部用...

推荐理由:谷歌发 Gemma 4 是一次有分量的开源模型更新。HKR 三项都成立:26B MoE 只激活 3.8B 的部署弹性够抓人,四个规格和商用许可给了新事实,成本敏感场景的参考价值也明确。分数定在 81 是因为基准、上下文窗口和测试细节都没披露,我会先打个折,这点先别太激动。