跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 341–360 条 · 共 409 条

5月7日星期四

The Verge · AI

谷歌关停网页任务实验 Project Mariner,技术已并入 Gemini Agent

谷歌在 2026 年 5 月 4 日关掉了 Project Mariner,一个能让 AI 在浏览器里自动完成多步骤网页任务的实验项目。它之前最多支持同时跑 10 个任务。关停不是因为技术失败,而是这套能力已经挪到了谷歌正式产品里,比如 Gemini Agent 和 AI Mode。正文没披露具体迁移时间点和用户数据,所以实际落地效果还得看后续产品表现。

推荐理由:HKR 三项都过,但正文能拿到的硬信息就三块:关停时间、最多 10 个并发任务、技术并入了 Gemini Agent。Google 官方信源够硬,所以给 featured 低档,不是重大发布。

5月6日星期三

The Verge · AI

Google 的 AI 搜索摘要开始引用 Reddit 帖子了

Google 更新了 AI 搜索功能,会在摘要里直接展示来自 Reddit、社交媒体和论坛的“第一手观点”预览,把搜索词和相关的网络讨论串起来。官方说这是为了满足越来越多人在搜索时想看到真人建议的需求。不过公告没提这个功能具体什么时候、在哪些地区上线。对搜索团队来说,核心问题是 AI 摘要如何引用和排序这些用户生成内容来源。

推荐理由:我会先打个折,因为正文没写覆盖范围和上线时间,所以重要性停在 76 的产品更新档位是合理的。钩子够强——Google 把 Reddit 这种论坛内容塞进 AI 摘要,搜索的流量分配逻辑可能又要变。新事实是 perspectives 预览机制,但具体怎么触发、哪些讨论会被选中都没说。风险点很实在:UGC 来源的引用和排序机制一旦偏了,小站和原创作者会更难拿到流量。这点先别太激动,等看到实际覆盖数据再调整判断。

机器之心 · 公众号

阿里开源 PromptEcho:用冻结的视觉语言模型给文生图训练打分,省掉额外训练成本

PromptEcho 的做法很直接:拿一个现成的、参数冻结的 Qwen3-VL-32B 模型,让它“读”一遍原始提示词,算出模型自己生成这些词的概率(交叉熵),然后把这个概率的负值当作连续奖励信号,喂给文生图模型做训练。好处是不用再单独训一个评分模型,省事。在 5000 张海报测试里,文字准确率从 68% 提到了 75%。不过正文没披露这个奖励信号跟人...

推荐理由:我会先打个折:这不是一个新模型发布,而是训练侧的 reward 方法开源,所以重要性给 78 算合理。钩子在于冻结大模型直接当 reward 用,省成本;知识密度够,把 teacher-forcing CE 怎么变成连续 reward 讲明白了,还给了 10 万张图的规模和具体数字;相关性上,文生图圈对廉价 reward 和文字准确率这两个需求很实在,75% 虽然不算完美,但方向对。正文没披露这个 reward 方法在更大规模训练下的稳定性,这点先别太激动。

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

r/LocalLLaMA

Gemma 4 出了 MTP 草稿模型,解码速度翻倍但输出质量不变

Google 在 Hugging Face 上放了 4 个 Gemma 4 的 MTP 检查点。MTP 的做法是拿一个小号草稿模型一次预测好几个 token,再由主模型并行验证,相当于让模型“先猜后验”,最终解码速度能提一倍,而且输出质量跟原来一模一样。不过 Reddit 原帖被网络策略挡了,正文没披露具体模型尺寸、硬件要求或实测延迟数据。

推荐理由:H、K、R 都站得住:钩子是 2 倍低延迟解码,有检查点和机制说明,不是画饼。它不是旗舰模型发布,属于实用更新,75 分放在 featured 低位合理。

5月5日星期二

r/LocalLLaMA

Heretic 1.3 发布:模型可复现、内置跑分、显存占用更低

Heretic 1.3 这个版本主要干了三件事。第一,它现在能把跑模型时的环境——PyTorch 版本、GPU 型号、驱动、加速库这些——都打包记录下来,别人照着做就能复现结果,不用再猜“为啥我跑出来不一样”。第二,它内置了一套跑分系统,直接用 lm-evaluation-harness 测 MMLU、EQ-Bench、GSM8K 和 HellaSwa...

推荐理由:我会先打个折:正文没给出 VRAM 具体降了多少,这点先别太激动。但 Heretic 这次更新确实踩到了两个实在需求——一是让模型运行环境可复现,把 PyTorch、GPU、驱动版本都记下来,方便排查问题;二是内置了 lm-evaluation-harness 基准测试,不用再自己搭评测流程。项目有 2 万星、1300 万次下载,社区验证度够高。缺憾是 VRAM 优化只提了方向没给数字,所以重要性停在 72 分,放在 featured 里合适。

Hacker News 首页

Google、微软和 xAI 同意把早期 AI 模型交给美国商务部做安全评估

Google、微软和马斯克的 xAI 跟特朗普政府谈好了,会在模型公开发布前,先把早期版本交给美国商务部的一个中心做能力和安全审查。这个中心叫 AI 标准与创新中心,已经测过 40 多个模型,包括一些还没发布的。OpenAI 和 Anthropic 在 2024 年就签过类似的协议。不过正文没披露具体要交哪些模型、审查标准是什么、有没有时间表,也没说如...

推荐理由:标题信息量不小,但正文只给了一个事实:三家同意共享早期模型。谁接收、看哪些模型、怎么审、什么时候开始,正文全都没写。我会先打个折——这件事的后续影响取决于审查机制怎么落地,现在只能按已知事实给到 featured 中段。HKR 三条都踩中了,但信息缺口明显,分数暂时不动。

FT · 科技

Google、xAI 和微软同意让美国政府对新的 AI 模型做国家安全审查

三家大模型公司跟美国政府达成了协议,以后发布新模型前要先过一道国家安全审查。起因是 Anthropic 最新的 Mythos 模型让官方有些紧张。不过这篇报道正文被付费墙挡住了,具体怎么审、审哪些模型、什么时候开始执行,这些关键细节都没披露。

推荐理由:我会先打个折:正文只说了三家同意审查,起因是 Anthropic 的 Mythos 模型引发了担忧,但怎么审、审哪些模型、什么时候开始,全都没写。所以这条消息更像一个政策风向标,而不是一份可操作的合规指南。对从业者来说,知道大厂开始接这种审查就够了,具体影响还得等细节出来再判断。

5月4日星期一

r/LocalLLaMA

Gemma 4 E2B 在 8GB 安卓手机上跑得动,还搭了个本地语音笔记 App

一位 Reddit 用户把 Gemma 4 E2B(2.4GB 模型)塞进 8GB 内存的 OnePlus CE 5 手机里,做了个完全离线的语音笔记应用。流程是:Whisper Small(244MB)先把语音转成文字,Gemma 4 E2B 再负责把文字拆成笔记并打标签。录一段 10 到 15 秒的语音,从转录到出结果总共花 12 到 15 秒。搜...

推荐理由:这是 Reddit 个人项目帖,不是官方发布,但信息量够。作者把 Whisper Small 转写和 Gemma 4 E2B 分类都塞进手机,还搭了检索管道(查询扩展、多路全文搜索、RRF 融合,可选 Gemma 重排,超时 15 秒回退),工程细节比很多官方 demo 实在。我会先打个折:没提功耗、发热和长时间稳定性,12-15 秒延迟对语音笔记算可用但不算快。如果是真的,2.4GB 模型在 8GB 手机上跑通整套流程挺省钱,对想做离线 AI 应用的人有参考价值。

5月2日星期六

量子位 · 公众号

腾讯混元开源 440MB 翻译模型,手机离线跑,自称翻译质量超谷歌

腾讯混元放出了一个叫 Hy-MT1.5-1.8B-1.25bit 的翻译模型,把原本 1.8B 参数的模型压到了 440MB,能在骁龙 888、8GB 内存的安卓手机上离线跑。它支持 33 种语言、1056 个翻译方向。压缩的关键是一种叫 Sherry 1.25 比特量化的技术,做法是每 4 个权重里,3 个用 1 比特存,1 个直接置零。官方说翻译质...

推荐理由:我会先打个折:这是个垂直翻译模型,不是基础模型大更新,所以没到 P1。但亮点很实在——1.8B 模型压到 440MB,靠的是 1.25-bit Sherry 量化,每 4 个参数里 3 个用 1-bit、1 个直接置零,这种压缩方式少见。正文给了骁龙 888、8GB 内存的离线跑分,不是空口说白话。翻译质量超谷歌这点先别太激动,正文没披露具体测试集和对比条件,但如果是真的,端侧翻译的性价比会明显拉高。

5月1日星期五

The Verge · AI

五角大楼跟 OpenAI、Google、Nvidia 签了涉密 AI 合同,但把 Anthropic 排除在外

五角大楼一口气和七家公司签了涉密 AI 使用协议,包括 OpenAI、Google、微软、亚马逊、Nvidia、xAI 和 Reflection。Anthropic 被挡在门外,理由是供应链风险。合同金额、具体要用哪些模型、怎么部署,正文都没披露。之前五角大楼处理机密信息时用过 Anthropic,这次突然不带它玩,原因没说透。

推荐理由:我会先打个折:正文没披露合同金额、模型范围和部署条件,所以重要性停在82。但五角大楼点名7家涉密AI供应商、唯独不带上Anthropic,这个选择本身就很有信息量。国防部给出的理由是供应链风险,等于把安全审查摆到了台面上,对从业者来说,这比一份普通合作公告更值得留意。

r/LocalLLaMA

研究称大模型更“丧”,小模型反而更“快乐”

Reddit 上有人分享了一份所谓的“AI 幸福感指数”,用 500 段对话去测模型的情绪倾向。结果 Claude Haiku 4.5 的负面回复只占 5%,而 Gemini 3.1 Pro 高达 55%。不过帖子自己也说了,测试集故意塞了很多刁钻的负面对话,不代表日常使用场景。另外,原帖链接点进去直接报 403 错误,看不到原始数据和具体方法,所以这...

推荐理由:我会先打个折:数据来自 Reddit 帖子,测试集故意塞了很多棘手负面对话,5% 和 55% 不代表真实均值。真正值得盯的是指标怎么定义的,而不是“AI 会痛苦”这种标题。帖子没披露评分标准,这点先别太激动。

TechCrunch · AI

谷歌把 Gemini 助手装进了几百万辆车里

谷歌宣布 Gemini 会逐步替换掉车机里原来的 Google Assistant,首批覆盖的是内置谷歌服务的车型。官方说法是能让车载语音对话更自然、更聪明,但正文没披露具体用了哪个版本的 Gemini 模型、哪些功能会先上、什么时候推完,也没提要不要额外收费。这点先别太激动——目前看更像是一次品牌升级和底层模型切换,实际体验能好多少还得等实车评测。

推荐理由:标题说 Gemini 要上车,规模是“数百万辆”,听着挺唬人。但正文基本就是一句话新闻,没给车型、没给时间、没给功能细节,也没说要不要额外收费。我会先打个折:这事方向对,但落地信息太少,现在激动还太早。对从业者来说,知道 Google 在铺车载渠道就够了,具体怎么打、打不打得赢,还得等后续。

4月30日星期四

Google DeepMind

Google DeepMind 发布 AI co-clinician 医疗研究计划

Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,医生更偏好其回答而非主流证据综合工具;在 140 项问诊技能评估中,它在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和关键体格检查上整体仍更优。

推荐理由:Google DeepMind 公开 AI co-clinician 研究计划与多模态问诊评测,可了解医疗智能体当前能力边界。

FT · 科技

Google 在 AI 军备竞赛中跑赢对手,科技巨头们计划砸下 7250 亿美元

这篇付费文章只露了个头,正文没披露具体的时间范围和各家花钱的明细。从摘要看,Google 在云计算增速上超过了亚马逊和微软,而 Meta 因为大幅上调资本支出,股价承压。7250 亿美元这个数字是几家巨头 AI 投资计划的总额,但具体怎么算出来的、覆盖几年,文章没给。这点先别太激动,关键细节都锁在付费墙后面。

推荐理由:这篇 FT 报道扔出一个 7250 亿美元的 AI 支出预期,说 Google 跑得比同行快,Alphabet 云业务增速也压过 Amazon 和 Microsoft。我会先打个折——正文没披露这数字怎么拆到各家公司、覆盖哪几年、投在模型还是基础设施上,所以别急着拿它当精确坐标。但即便模糊,这个量级和竞争格局对从业者判断算力成本、云厂商选择和资本热度还是有参考价值。

The Verge · AI

Google 搜索量上季度创历史新高,但没公布具体数字

Alphabet 一季度财报电话会上,CEO Sundar Pichai 说 Google 搜索的查询量达到了“历史最高”,搜索广告收入涨了 19%。他把增长归因于 AI 功能(比如 AI Overviews 那种直接在搜索结果顶部给答案的体验)和 Gemini App 的拉动。另外,YouTube 订阅和 Google One 这类付费服务总订阅数超...

推荐理由:HKR 三项全中:Alphabet 报出搜索查询量历史新高、搜索收入涨 19%、付费订阅破 3.5 亿。但正文没给查询量基数,也没拆 AI Overviews 带来的增量,所以信息有缺口。整体够得上 72–77 分的 featured 档位。

4月29日星期三

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

彭博科技

谷歌与美国防部签协议,允许其 AI 用于机密军事工作

谷歌和美国国防部达成了一项协议,让谷歌的 AI 系统能进入机密军事工作流程。五角大楼官员确认了这笔交易,但正文没披露具体用了哪些系统、合同金额有多大,也没说使用上有什么限制。这件事发生在研究人员持续抗议谷歌参与军事项目的背景下,我会先打个折——目前公开信息太少,没法判断这到底是一次性试点还是深度绑定。

推荐理由:这条消息本身够硬:Google 和五角大楼的机密军事 AI 合作被确认了。我会先打个折,因为正文没写具体系统、金额和使用限制,没法判断规模。但 H、K、R 三点都踩中了——冲突感强、事实新、跟从业者的职业伦理直接相关,所以放在 featured 里没问题。

TechCrunch · AI

Anthropic 拒绝五角大楼后,Google 签下新合同扩大军方 AI 使用权限

Anthropic 明确禁止自家 AI 被用于国内大规模监控和自主武器,五角大楼转头就找了 Google。Google 已经和美国国防部签了一份新合同,进一步开放 AI 的使用。不过正文没披露合同金额、具体用到哪些模型,也没说什么时候开始部署。

推荐理由:这条新闻的看点不在合同本身,而在两家公司面对军方订单时截然不同的选择。Anthropic 划了红线,Google 没划,从业者自然会追问:Google 的安全框架到底怎么界定军事用途?正文没披露合同金额、模型范围或部署时间,所以具体影响有多大还不好判断。我会先打个折,但话题性够强,放在 featured 里让读者自己掂量。

4月28日星期二

The Verge · AI

谷歌被曝与五角大楼签了份机密 AI 合同,允许军方“任何合法用途”

The Verge 报道,谷歌和美国国防部签了一份保密协议,允许军方把谷歌的 AI 模型用于“任何合法的政府目的”。合同具体金额、用了哪些模型、部署范围多大,正文都没披露。就在消息曝光不到一天前,谷歌员工刚联名要求 CEO 皮查伊阻止公司 AI 被五角大楼使用。报道还提到,这份合同没给谷歌否决权,也就是说谷歌没法对军方具体怎么用它的模型说“不”。

推荐理由:这条消息的钩子很明确:一家大模型公司悄悄给了军方一张几乎不设限的通行证。我会先打个折,因为合同金额、模型清单和实际部署范围全是空白,没法判断影响到底多大。但“任何合法政府目的”这个表述本身就够有争议,再加上报道出来前不到一天员工还在要求 CEO 阻止合作,时间线很紧凑。对关心 AI 安全与政策的从业者来说,这比一般的合作声明更值得留意。