跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 121–140 条 · 共 409 条

7月7日星期二

AI HOT 精选

Gemini API 的托管智能体新增后台任务、远程 MCP 和自定义函数

Google 给 Gemini API 里的 Managed Agents 加了三样东西:后台异步执行,让跑得久的任务不用一直占着连接;远程 MCP,让智能体可以调用外部的工具或服务;自定义函数,用来塞进自己的业务逻辑。这篇公告面向想把智能体推到生产环境的开发者,但正文没提价格和哪些地区能用。

推荐理由:Google 给 Gemini API 的 Managed Agents 加了后台执行、远程 MCP 和自定义函数,这三样都是智能体进生产环境绕不开的能力。后台执行解决了长任务占连接的问题,远程 MCP 让模型能直接调外部服务,自定义函数用来塞业务逻辑。对开发者来说实用,但公告没披露定价和区域限制,我会先打个折——想上生产的人还得自己算账。

AI HOT 精选

给模型看模糊图反而更烧钱:OpenRouter 实测图像清晰度与成本倒挂

OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图(detail: low)经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本...

推荐理由:OpenRouter 拿五款模型在 MMMU-Pro Vision 上跑了一遍,发现给推理模型喂低清图经常既费钱又拉胯。gpt-5.5 用低清图准确率从 79% 掉到 65.2%,但每题成本反而从 4.5 美分涨到 5.1 美分——因为模型看不清,被迫多想了 1.6 倍的推理 token,输出端多花的钱直接吞掉了省下的输入成本。Gemini 2.5 Pro 也一样,低清下准确率掉 5 个百分点,成本涨 15%。文章还给了 Gemini 2.5 Flash 的对比,低清下成本确实降了,但准确率也崩了,说明非推理模型可能适用不同策略。我会先打个折:测试...

AI HOT 精选

Google 悄悄改了隐私设置,你上传的图片、文件、音视频默认拿去训练 AI 了

Google 在 6 月通过一封邮件低调更新了搜索服务的隐私条款,新增了“搜索服务历史记录”和“个性化推荐”两个设置。这次改动覆盖搜索、地图、购物、航班、酒店和翻译,默认允许公司存储并使用你上传的图片、文件、音视频来改进 AI 模型。换句话说,只要你没手动关掉这两个开关,你传上去的媒体内容就会被拿去训练 AI。TechCrunch 给出了逐步退出指南—...

推荐理由:Google 悄悄把默认设置改成用你的媒体数据训练 AI,TechCrunch 给出了可操作的退出方法。这事有用,但不是模型或产品发布,影响就定在 featured 这一档。

7月6日星期一

Hacker News 首页

Chrome 偷偷在你电脑上装了个 4GB 的 AI 模型,删了还会自动下回来

瑞典隐私研究员 Alexander Hanff 发现,只要你的电脑内存大于 16GB、剩余硬盘空间超过 22GB,Chrome 就会在后台静默下载一个叫 Gemini Nano 的本地 AI 模型,文件名叫 weights.bin,体积 4GB。这个模型藏在系统文件夹里,名字故意起得很技术化,普通人根本看不出是 AI。更麻烦的是,手动删掉之后,Chro...

推荐理由:这件事把隐私、本地 AI 部署和用户知情权三个敏感点全占了,HKR 拉满。没给更高分是因为目前只有 OZ Talking 一家在报,原文是 newsletter 评论而非一手技术拆解,信号强度会打折扣。

7月5日星期日

Computing Life · Share · 鸭哥调研

Scaling Law 五年三次修正:从“把模型做大”到“把模型做小”

Scaling law 不是物理定律,是一条靠实验拟合出来的曲线,实验条件一变,结论就跟着变。2020 年 OpenAI 的 Kaplan 论文因为实验设置偏差,得出“优先堆参数”的结论,直接塑造了 GPT-3。2022 年 DeepMind 的 Chinchilla 修正了配比,发现每个参数配大约 20 个 token 才划算,小模型多喂数据反而更强...

推荐理由:这是一篇高质量的辟谣和科普。它没有复读“scaling law 失效”的惊悚标题,而是把 Kaplan、Chinchilla 和 LLaMA 三次修正串成一条线,用具体的实验偏差和数据配比说明为什么结论会变。我会先打个折:它属于评论和知识梳理,不是一手产品发布,但信息密度和纠正作用足够强。正文没披露某些最新模型的内部训练细节,但引用的公开论文和数据足以支撑它的判断。

Hacker News 首页

一条评论就能让 YouTube 的 AI 助手泄露创作者的私密视频标题

安全研究员发现 YouTube Studio 的 AI 助手“Ask Studio”会读取视频评论来生成摘要,但藏在评论里的指令可以劫持它的输出。攻击者先发一条正常评论,之后悄悄编辑成攻击指令,创作者一旦点击系统推荐的 AI 提示,助手就会把攻击者写的内容当成自己的回复显示出来。更严重的是,攻击指令可以构造一个链接,把创作者的私密视频标题作为参数传到外...

推荐理由:安全研究员发现 YouTube 工作室里的 AI 助手“Ask Studio”会读评论来生成摘要,但藏在评论里的指令能劫持它的回复。攻击者先发一条正常评论,之后悄悄编辑成攻击指令,创作者一旦点击系统推荐的 AI 提示,助手就会把攻击者写的内容当成自己的回复显示出来。更严重的是,攻击指令可以构造一个链接,把创作者的私密视频标题作为参数传到外部服务器。整条攻击链完整、可复现,而且涉及的是 Google 自家的产品,属于一手高质量披露。正文没提 Google 是否已经修复,这点先别太激动。

7月2日星期四

AI HOT 精选

谷歌 AI 扩建让 2025 年用电量涨了 37%

谷歌 2025 年的总用电量比前一年多了 37%,主要原因是 AI 数据中心在快速扩张。公司说正在用清洁能源合同来对冲碳排放,但正文没披露清洁能源实际覆盖了多少用电,也没提净排放到底变了多少。签了合同不等于电网就真的给你供绿电,关键还得看电网本身脱碳的速度。

推荐理由:谷歌 2025 年用电量涨了 37%,这个数字够硬,直接跟 AI 数据中心扩张挂钩。文章没写成公关稿,反而指出清洁能源合同和电网实际脱碳是两码事,但正文确实没披露净排放变化,所以信息有缺口。评分卡在 featured 档,因为只是单家公司数据,而且缺了净排放这个关键结论。

7月1日星期三

TechCrunch · AI

Google 的桌面 AI 助手 Gemini Spark 现在能在 Mac 上用了

Google 把 Gemini Spark 带到了 Mac 上,这是一个能帮你整理文件、跨应用干活的 AI 助手,相当于让模型直接进你的电脑里操作。它能读取本地文件,比如把一堆发票自动转成预算表格。目前还是测试版,只对 Google One AI Premium 订阅用户开放。文章提到后续还会支持从手机远程指挥电脑干活,但具体什么时候上线没说。

推荐理由:我会先打个折:这不是新东西发布,而是 Gemini Spark 从预告到落地 Mac 的一步,所以重要性给 72 分,放在 featured 里刚好。亮点在于它把“让模型进电脑干活”这件事讲得比较实在,不是画饼,发票转表格这种例子让人一看就懂能省多少事。但限制也很明显——只对 Google One AI Premium 用户开放测试,正文没提免费开放时间,也没说 Windows 什么时候上,这点先别太激动。整体看,它给桌面 agent 的竞争加了把火,但还没到引爆的程度。

AI HOT 精选

Cloudflare 把 AI 爬虫拆成搜索、干活、训练三类,网站主可以按用途放行或收费

Cloudflare 去年搞了个一键屏蔽 AI 爬虫的功能,今年更进一步,把自动流量分成三种:搜索类(建索引、应该给网站带回流量)、智能体类(替用户实时办事,比如 ChatGPT-User 或浏览器操控工具)、训练类(抓数据去训模型)。这么分是想解决小网站的困境——屏蔽爬虫怕没人搜得到,不屏蔽又等于免费给人练模型。Cloudflare 呼吁爬虫运营方按...

推荐理由:Cloudflare 把去年的一键屏蔽升级成了三档分类管理:建索引的搜索爬虫、替用户实时办事的智能体爬虫、抓数据训模型的训练爬虫。这个分法很实际,因为小网站最怕的就是流量被薅走还换不回一点曝光。文章没给出具体误判率或分类准确度数据,实际效果得看上线后的反馈。我会先打个折,这属于工具层面的实用更新,不是模型或协议突破,但对内容站运营者来说,比很多论文都解渴。

TechCrunch · AI

三个前 DeepMind 研究员把打扑克的 AI 技术拿来炒股,公司估值超 5 亿美元

EquiLibre Technologies 拿到了 Creandum 领投的 A 轮融资,估值超过 5 亿美元。这家布拉格公司由三个前 DeepMind 研究员创立,他们把当年训练 AI 打扑克用的强化学习技术搬到了股票交易上。Creandum 的 VP 说这是他们单笔最大投资,但具体金额双方都没透露。文章没披露公司的营收和交易业绩数据,所以这 5 ...

推荐理由:前 DeepMind 的人把博弈论强化学习用到量化基金上,估值做到 5 亿多美元,故事本身是新鲜的。但正文没披露营收和交易表现数据,信息密度偏薄,刚好卡在 featured 的门槛上。

AI HOT 精选

ADK Go 2.0 发布:用图来编排多智能体流程,内置人工审批和动态路由

ADK Go 2.0 把多智能体协作建模成一张有向图,节点可以是 Go 函数、LLM 智能体或工具,边负责路由、并行分发和结果汇聚。新加的“发射函数节点”让一个函数就能暂停等人审批,不用再单独写动态节点。整张图本身就是一个智能体,跑在现有运行器里,状态能跨重启保留。正文没给性能基准或延迟数据。

推荐理由:ADK Go 2.0 把多智能体协作抽象成有向图,加上发射函数节点简化人工审批,设计思路有新意。但正文没给性能基准或延迟数据,Go 的 AI 框架受众也偏窄,所以分数打到这里。

6月29日星期一

Hacker News 首页

给大模型做一次“嗅觉镜子测试”:偷偷改掉它说过的话,看它会不会发现

作者用 Gemma 4 31B 做了一个非正式实验:先让模型正常聊詹姆斯·邦德电影,然后把对话历史里模型自己的回复中所有字母“g”替换成“sg”(比如 Goldfinger 变成 sgoldfinsger),再继续若无其事地聊。前两轮模型完全没反应,照常接话。到第三轮,它的思考链里突然自发冒出“等等,我之前的回复里有些奇怪的拼写错误”,接着在试图解释时...

推荐理由:作者没发论文,就是拿 Gemma 4 31B 做了个非正式实验。先正常聊邦德电影,然后偷偷把模型自己之前的回复里所有字母 g 改成 sg,再若无其事地继续聊。前两轮模型完全没反应,照常接话。到第三轮,它的思考链里突然自发冒出“等等,我之前的回复里有些奇怪的拼写错误”,接着试图解释。这个行为说明模型在内部对自己的输出有某种表征,能检测到被篡改的痕迹,而且不是靠外部提示。正文没披露实验跑了几次、有没有对照,所以结论先别太激动,但思路比现有文献里那些方法都直接,值得复现验证。

6月28日星期日

Hacker News 首页

Google 开始限制 Meta 使用 Gemini 模型,因为算力不够分了

据《金融时报》报道,Google 对 Meta 使用其 Gemini 模型设置了上限。原因是 Meta 申请的算力超过了 Google 能提供的量。除了 Meta,还有几家客户也受到了影响,但程度轻一些。报道没具体说限制了什么、涉及哪个版本的 Gemini,也没提 Meta 拿这些模型来做什么。

推荐理由:这条消息本身够有话题性——两家巨头在模型供应上直接撞车。但 CNBC 这篇只是转述《金融时报》的报道,所有关键事实都缺失:限制了什么、哪个版本、用途是什么,信息密度撑不起更高分。72 分先放着,等后续有具体细节再重新评估。

6月27日星期六

AI HOT 精选

华邮实测主流聊天机器人政治倾向:GPT-5.5 八成回答偏左,Grok 4.3 是唯一右倾超三成的模型

《华盛顿邮报》用一套达特茅斯和斯坦福的方法,拿约 30 个政策议题(税收、医保、移民等)去测了几家大模型的政治倾向。GPT-5.5 的回答 80% 偏左,只有 3% 偏右;Gemini 3.1 Pro 最谨慎,93% 的回答都是“两边都有道理”,几乎不站队;Claude Opus 4.8 的“两边说”占 57%。Grok 4.3 是唯一一个右倾回答占到...

推荐理由:《华盛顿邮报》拿达特茅斯和斯坦福的方法测了四家大模型的政治倾向,给出了具体的偏左/偏右/中立比例,不是空对空喊偏见。GPT-5.5 80% 偏左、Grok 4.3 是唯一右倾回答占优的模型,这些数字对做对齐和评估的团队有直接参考价值。不过它本质是一份媒体测评报告,不是产品发布或技术突破,所以放在 featured 里比较合适。

6月26日星期五

Latent Space

OpenAI 内部 Codex 输出量半年暴涨 56 倍,研究部门用得最猛

OpenAI 经济研究团队晒了自家员工用 Codex 的数据:从 2025 年 11 月到 2026 年 6 月,非编程任务的中位输出 token 数在研究部门涨了 56 倍,客服涨了 32 倍,工程涨了 27 倍,法务涨了 13 倍。有意思的是,2025 年 8 月之前员工花在 Codex 上的 token 不到总量的 10%,说明就算不限量供应,大...

推荐理由:OpenAI 经济研究团队放出的内部 Codex 使用数据,是近期少有的、能直接感受 AI 在企业内部渗透速度的信号。部门级倍数具体、有来源,不是公关稿。没给更高分是因为这是付费 newsletter 对原报告的转述,不是一手全文,但核心数字已经够用了。

AI HOT 精选

Gemini 3.5 Flash 现在能直接操作你的电脑和手机了

Google 把 Computer Use 功能塞进了 Gemini 3.5 Flash,让模型可以看屏幕、点按钮、滑页面,在浏览器、手机和桌面上跑长时间任务。这次更新给了几个实用的东西:内置了对手机和桌面操作系统的支持,不用自己搭环境;每次函数调用都会带上意图参数,方便你判断模型想干嘛;还加了可定制的人工接管机制,关键时刻能把控制权交回给人。安全方面...

推荐理由:Google 把 Computer Use 塞进 Gemini 3.5 Flash,让模型能看屏幕、点按钮、滑页面,手机和桌面都支持,不用自己搭环境。我会先打个折,因为正文没给延迟、成功率和定价数据,实际跑起来稳不稳、贵不贵还不知道。但意图参数和人工接管这两个安全设计是实打实的,让模型在干活时能多一层判断和刹车,这点对做自动化的团队挺关键。整体看,这是个能直接上手的 agent 工具,但缺关键指标,先别太激动。

6月25日星期四

AI HOT 精选

Meta员工警告:用大模型替代人工审核推得太快,误判和影子封禁仍在发生

Meta在2025年已经把大约一半的内容审核请求交给了大语言模型处理,并计划年底前把部分内容类型的AI审核比例推到90%以上。公司说自家模型比人工审核错误少13%,能多揪出10%的违规内容,一年能省下几十亿美元。但内部员工不这么看,他们说模型还是会误删或悄悄限流(影子封禁)无害内容,而且这么快的铺开速度,监管根本跟不上。另外,Meta后台还在做模型切换...

推荐理由:这条消息的核心矛盾很清楚:公司拿省钱和准确率说事,员工拿误删和影子封禁反驳。数字本身有参考价值,但要注意这是二手报道,不是一手内部文件,员工那边的具体案例和模型切换细节正文没展开,所以判断上我会先打个折。对从业者来说,这比单纯宣布AI审核上线有用,因为它暴露了部署速度和监管跟不上的老问题。

TechCrunch · AI

谷歌再失两员大将:Gemini 核心研究员跳槽 Anthropic

Jonas Adler 和 Alexander Pritzel 是谷歌 Gemini 模型的关键研究员,现在都去了 Anthropic。这已经是近期第四起高层出走:上周 Noam Shazeer 刚宣布跳槽 OpenAI,而诺贝尔化学奖得主 John Jumper 也去了 Anthropic。Shazeer 的离开尤其尴尬——谷歌为了把他从 Chara...

推荐理由:TechCrunch 爆出的是带名字和时间线的连续离职,不是传闻。四个人都去了直接竞对,信号够硬。但正文没披露内部原因和具体项目影响,所以上限压在 85,不往产品冲击上过度解读。

彭博科技

Google 又有两名资深 AI 研究员要跳槽去 Anthropic

彭博社消息,Google 即将再失去两名资深 AI 研究员,去向是 Anthropic。这是 Google 向 Anthropic 持续流失人才的最新一例。不过,报道没有公布这两人的姓名和具体负责方向,所以暂时没法判断这对 Google 哪个团队影响最大。

推荐理由:彭博独家消息,Google 再失两名资深 AI 研究员给 Anthropic,人才流动的叙事本身就有吸引力。但缺了姓名和职责,知识增量打了折扣。H 和 R 都踩中,K 偏弱,刚好落在 featured 门槛上。

Hacker News 首页

Gemini 3.5 Flash 现在能直接操作电脑了

Google 给 Gemini 3.5 Flash 加了一个内置的“操作电脑”工具,模型可以直接截图、移动鼠标、点击和打字,不用像 Anthropic 那样还得在外面套一个虚拟机。现在开发者可以在 Google AI Studio 里试用。不过这篇公告没给出跑分成绩,也没提操作延迟有多高,实际在复杂界面上的表现还得等上手测了再说。

推荐理由:Google 给 Gemini 3.5 Flash 塞了个内置的电脑操作工具,直接截图、点鼠标、打字,不用像 Anthropic 那样还得在外面套一层虚拟机。开发者现在就能在 AI Studio 里试。我会先打个折:公告没给任何跑分,也没提操作延迟有多高,所以实际在复杂界面上的表现还得等上手测了再说。但这件事本身对做 agent 的人挺重要,因为内置方案意味着部署更轻、链路更短,这点先别太激动,等实测数据出来再判断值不值。