跳到正文

#MCP/工具调用

今日 5 条

5月22日星期五

AI HOT 精选

Runway 上线 Aleph 2.0 和 Edit Studio,把生成、剪辑、后期塞进一个平台

Runway 把新模型 Aleph 2.0 直接做成了一个叫 Edit Studio 的剪辑工具,主打用自然语言改视频,改之前还能先预览效果。从页面看,它把视频生成、多镜头合成、场景搭建、画质增强、动作捕捉和物体移除这些功能都打包在一起了,想覆盖从创意到出片的完整流程。不过正文没披露 Aleph 2.0 的具体技术参数、定价和推送范围,实际效果和成本还...

推荐理由:Runway 是 AI 视频领域的主要玩家,这次更新属于中等体量的产品动作。我会先打个折:标题听起来挺大,但正文没给价格、没给参数、没给上线范围,所以实际能判断的东西有限。HKR 三项都能过——一句话能讲清卖点,有具体新名字,也踩中了行业竞争的脉络——但信息缺口让它停在 featured 这档,再往上就缺硬证据了。

AI HOT 精选

Claude 企业版接入 28 款安全合规工具,IT 团队能像管其他应用一样管 AI 了

Anthropic 给 Claude 企业版和平台新增了 28 个安全合规集成,背后靠的是 Claude Compliance API。这个 API 能把 Claude 里的对话内容和操作记录,直接送进企业已经在用的数据防泄漏(DLP)、安全信息与事件管理(SIEM)这类监控系统里。简单说,就是让安全团队用现有工具就能看到员工跟 Claude 聊了什么...

推荐理由:Anthropic 给 Claude 企业版和平台加了 28 个安全合规集成,通过 Compliance API 把对话内容和活动事件喂给数据防泄露(DLP)和安全信息管理(SIEM)系统。对想用 Claude 又怕合规翻车的团队来说,这波操作把审计和监控的坑填了不少。正文没提延迟和成本影响,但集成数量本身说明他们在补企业落地的课。

AI HOT 精选

谷歌发布 Kotlin 版和 Android 版 Agent 开发套件 0.1.0,让 AI 能在手机本地跑任务

谷歌把 Agent 开发套件(ADK)带到了 Kotlin 和 Android 上,版本号 0.1.0。Kotlin 版负责后端流程,Android 版则专门为手机端做了优化,能直接调用 Gemini Nano 这类本地模型干活。这套东西的核心是混合调度:你可以让云端大模型当总指挥,把涉及隐私的具体任务(比如查本地文件里的酒店预订)派给手机上的子 Ag...

推荐理由:Google 这次发了两个 ADK:Kotlin 版给后端搭 Agent 工作流,Android 版让 Agent 跑在手机上。版本号 0.1.0 说明还在早期,功能边界和稳定性都别抱太高期待。正文只交代了平台和版本,没给性能数据、实际案例或开发者规模,所以我会先打个折——方向对,但落地效果还得看后续。

Hacker News 首页

Runtime 给团队里每个人配一个沙盒编程助手,支持 Claude Code、Cursor 等主流工具

Runtime 做了一套开源的沙盒基础设施,让公司里不只有工程师能用编程助手,产品、设计、市场、客服也能在安全隔离的环境里让 AI 帮忙改代码、查数据、发 PR。它兼容 Claude Code、Codex、Cursor、Copilot、Gemini CLI 和 Devin 这些主流编程助手,可以接入公司自己的工具链(比如 Datadog、Salesfo...

推荐理由:我会先打个折:正文没披露实际客户或用量数据,所以别当成熟产品看。但它的切入点很准——企业不敢让编程代理直接跑在内部环境,Runtime 用沙盒把代理隔离开,还开源了基础设施,等于给团队一个低风险试水的入口。支持六种代理、不加价 token 的定价,也让成本更可预测。对正在评估编程代理的团队,这是个值得跟进的信号。

5月21日星期四

r/LocalLLaMA

LLM 硬件规划器:按你的用途、模型或预算挑一套跑本地模型的机器,或者给现有机子选模型

totosse17 做了一个叫 LLMRequirements 的硬件规划工具,整理了 60 多套装机方案、50 多个模型,还附了 130 多个有来源标注的每秒 token 生成速度、150 多个评测视频。它会标每套配置的待机功耗和满载功耗,价格覆盖多个地区,数据放在 GitHub 上公开更新。不过 Reddit 原帖正文被屏蔽了,具体界面长什么样、交...

推荐理由:这是一个 Reddit 社区作者做的本地 LLM 硬件规划器,不是大厂产品发布,但信息密度很高。我会先打个折:它更像一个持续更新的公开数据集和参考表,不是一键自动优化的工具。正文没披露数据更新频率的具体机制,但 130 多个 tok/s 来源和 150 多个评测视频让它比一般论坛帖子可信不少。对想自己攒机器跑模型的人来说,功耗和地区价格都列出来,省得自己到处翻,这点挺实在。

The Verge · AI

我用谷歌 AI Studio 一个下午“氛围编程”搞出了三个安卓 App,第一个只靠 148 个字的提示词

The Verge 的编辑 Sean Hollister 用谷歌 AI Studio 试了一把“氛围编程”,一个下午生成了三个安卓 App。其中一个 App 他只输入了 148 个字的提示词,大概 10 分钟后就在自己的安卓手机上装好跑起来了。前提是他提前把手机开了 USB 调试模式并连上电脑,剩下的活 AI Studio 全包了。他感叹这速度让他差点...

推荐理由:这不是 Google 官方大发布,而是一篇带实测细节的第一人称体验文,有梗有数字,适合放进精选。

r/LocalLLaMA

腾讯发布 Hy-MT2 翻译模型,覆盖 33 种语言,最小 1.8B 版压缩后仅 440MB

腾讯放出了 Hy-MT2 系列翻译模型,有 1.8B、7B 和 30B-A3B 三个尺寸,支持 33 种语言互译。1.8B 小模型用上 AngelSlim 1.25-bit 量化后,存储占用压到 440MB,推理速度还快了 1.5 倍,适合本地跑。不过 Reddit 原帖被屏蔽了,正文没披露具体翻译质量评测和更多技术细节,这点先别太激动。

推荐理由:我会先打个折:Reddit 信源比较散,所以分数没再往上拉。但 440MB 这个数字太直观了,比单纯列三个模型尺寸更有传播力,从业者一眼就能算出部署成本。正文没披露量化后的翻译质量损失,这点先别太激动,但“小模型干翻译”这个方向本身值得关注。

AI HOT 精选

Cursor 复盘云端智能体踩坑史:环境没配好,模型再强也白搭

Cursor 团队把云端智能体从本地搬到服务器上跑了一年,最大的教训是:开发环境本身就是产品。本地跑的时候,模型直接继承你电脑上的全套工具链,但云端得从零重建,缺个依赖、少个配置,模型不会报错,只会悄悄变笨。他们后来把任务调度迁到 Temporal 上,可靠性从 99% 拉到了 99.9% 以上,现在平台每天处理超过 5000 万次操作。文章还聊了怎么...

推荐理由:HKR 三项都成立:Cursor 在编程 agent 圈子里是核心玩家,文章给出了 Temporal 迁移、99.9%+ 可靠性和 5000 万次日操作量这些实打实的数据。不是产品发布,所以放在 featured 低段位。

阿里技术 · 公众号

从零搭一个 Agent:原理拆解与个人助手实操

这篇文章因为微信环境异常,正文内容没抓到,只看到标题和作者信息。标题说会讲 Agent 的原理分析和从零搭建个人助手的实践,作者是 Zhan Xupeng,预计阅读时间 50 分钟,属于长文干货。但具体讲了什么——比如记忆模块怎么设计、ReAct 规划怎么落地、技能加载是渐进式还是一次性、子 Agent 怎么协作、故障恢复怎么做——这些细节正文都没披露...

推荐理由:我会先打个折:标题确实平平无奇,像又一篇入门教程。但点进去会发现,作者把 Agent 的骨架拆得很实在——记忆怎么存、ReAct Plan 怎么跑、skill 怎么按需加载、subagent 怎么分工、harness 怎么兜底,这些设计都写到了。对正在折腾个人助手或想让 Agent 稳定跑业务的同学来说,这篇比大多数水文有料。不过正文没给出量化验证,效果到底怎么样还得自己试。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

r/LocalLLaMA

用 API 原生结构约束替代提示词校验,Claude 输出解析成功率从 65% 跳到 90%+

一位 Reddit 用户对比了两种让 Claude 稳定输出结构化数据的方法。靠提示词描述格式再事后用正则或 JSON 解析(方案 A),首次解析成功率只有 65%–70%;换成直接调用 tool_use 功能,用强类型 schema、枚举值约束和分步校验(方案 B),成功率拉到 90%–95% 以上。方案 B 的原理是让 API 在模型生成前就卡死输...

推荐理由:我会先打个折:数据来自 Reddit 个人测试,样本量和具体任务都没披露,不能当正式基准看。但 hook 很清晰——从提示词正则校验换成 schema 强制输出,首轮解析率从 65–70% 拉到 90–95%+,说明让模型按类型 schema 直接吐结果比事后用正则捞靠谱得多。这点先别太激动,正文没交代测试条件,但方向对工程选型有参考价值,所以给 featured 低档。

AI HOT 精选

Google DeepMind 给 Antigravity 配了一套科学工具包,把 UniProt、AlphaFold 等 30 多个生命科学数据库接进 ...

Google DeepMind 在自家 Antigravity 平台上推出了 Science Skills,相当于给 AI 装了一个生命科学专用工具箱。它直接接入了 UniProt、AlphaFold 等 30 多个主流数据库,让模型在回答问题时能实时调取蛋白质结构、基因功能这些专业信息,而不是靠训练时记下的旧知识硬猜。正文没披露具体延迟和准确率提升数...

推荐理由:Google DeepMind 这次没发新模型,而是给自家 Antigravity 装了个科学技能包,把 UniProt、AlphaFold 这类数据库直接塞进工作流。我会先打个折:这不是底层突破,更像给研究员配了个能查资料、跑数据的助手。30 多个来源听着不少,但正文没披露实际任务成功率或延迟,也没说和现有工具比快多少、省多少。对做生命科学的人有用,但对不碰这行的从业者,暂时看不出必须关注的理由。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。

Latent Space

Railway:为 AI 代理而生的云,35 人撑起 300 万用户

Railway 创始人 Jake Cooper 聊了他们怎么从 18 个月攒 100 个用户,做到现在每周新增 10 万注册。团队只有 35 人,服务 300 万用户,融了 1.24 亿美元。他们把大部分工作负载搬到了自建裸金属数据中心,回本周期只要 3 个月,对比租用云服务能省下不少钱。Jake 认为未来的软件是给 AI 代理用的,不是给人用的,所以...

推荐理由:这篇访谈不是讲模型本身,而是讲基础设施怎么为 agent 工作负载重新设计。Railway 用一个小团队撑起 300 万用户,还做了裸金属迁移,对做 agent 部署的开发者来说是个很实在的参考。信息密度和话题性都够,但毕竟不是核心模型发布或重大产品更新,给 74 分放在 featured 里比较合适。

AI HOT 精选

Google 把设计搭子 Stitch 升级了,现在能读你的代码库直接生成界面

Stitch 这次更新主要干了四件事。一是实时流式出设计稿,你边改它边生成,不用干等。二是能直接导入现有代码库或 Design.md 文件,拿你项目里真实在用的组件来做设计,品牌风格不容易跑偏。三是加了动态界面生成,四是做完的设计可以导出成一个可分享的线上链接,省掉从原型到上线中间一堆部署步骤。工具现在已经全球开放,正文没提收费模式。

推荐理由:我会先打个折:正文没披露模型细节、定价和实际输出质量,所以别急着当生产工具。但 Stitch 这次更新把实时流式构建和代码库导入加进来,等于让 AI 直接读你的代码和设计文档来生成页面,不再是画个样子就完事。对天天在 Figma 和代码编辑器之间切换的团队,这个流程缩短挺实在。全球开放也让更多人能上手试,不过没看到成本或准确率数据,这点先别太激动。

AI HOT 精选

ChatGPT 手机版接入 Codex,手机上问一半,回到电脑能接着聊

OpenAI Devs 发帖说 ChatGPT 移动端现在支持 Codex,你可以在手机 App 里提问,之后在桌面端继续同一个对话。帖子没提支持哪些平台、需要哪个 App 版本,也没说是不是逐步推送。

推荐理由:OpenAI Devs 是官方渠道,消息可信,HKR 三项都踩中了。但正文只确认了移动端能用 Codex 和跨设备接续对话,具体支持哪些平台、版本号、推送范围全都没提,所以信息量刚好卡在 featured 门槛上,先别当全量上线看。

The Verge · AI

谷歌搜索的 AI 进化,就是塞进更多广告

谷歌开始在搜索广告里用 Gemini 自动生成产品介绍,还会在部分广告里直接嵌入聊天机器人。文章拿胶囊咖啡机举了个例子,但没提具体覆盖范围和广告价格怎么算。说白了,你搜东西时看到的“赞助产品”描述,以后可能都是 AI 写的,有些广告点进去还能跟机器人聊两句。

推荐理由:Google 开始在 Gemini 的商品搜索结果里塞赞助商品和广告聊天机器人了。我会先打个折:正文完全没提投放范围有多大、怎么收费、效果数据如何,所以这更像一次试探性铺开,而不是大规模产品发布。对从业者来说,值得盯的是它把广告嵌进对话式搜索的路径,但现阶段信息缺口太大,先别太激动。

5月20日星期三

The Verge · AI

如果连 Google 都做不出有用的 AI 智能体,那可能没人能了

Google 在 I/O 2026 上发了好几个 AI 智能体,能帮人搜资料、规划活动、总结邮件和日历。这些智能体可以在后台一直跑,但文章没提什么时候上线、怎么收费,也没给任何实测数据。作者的意思是,Google 在 AI 智能体上折腾了好几年,这次借着 OpenClaw 的热度再推一把,但如果连手握海量用户数据的 Google 都搞不定,那整个行业吹...

推荐理由:H 和 R 都很强,因为文章把 Google 的 agent 当成整个行业能不能成的风向标,而且直接踩中从业者对实用性、平台权力和成本的焦虑。K 给了新信息,但只限于后台运行这一点,正文没披露上线时间、定价和实际评测结果,所以整体还是落在 featured 偏下位置。

TechCrunch · AI

Figma 在协作画布里塞了个 AI 助手,能直接用对话生成和修改设计

Figma 在它的多人协作画布上直接加了一个 AI 助手。你可以用大白话让它生成新设计、改现有设计,或者自动跑一些重复活儿,比如批量出不同版本的设计稿。你还能同时开好几个助手,让它们各干各的。Figma 说这个助手能理解设计语境和元素,因为它背后用的模型是专门针对设计场景调过的。不过正文没披露这个助手具体是用自家模型还是接了别家的 API,也没提生成结...

推荐理由:Figma 把 AI agent 塞进了协作画布,你打字就能让它生成或改设计。我会先打个折:正文只说了能力范围,没提用的是什么模型、成本多少、什么时候上线,所以别太激动。但这件事本身值得关注,因为它意味着设计师的工作流可能要被 agent 插一脚了。

AI 群聊日报

Karpathy 加入 Anthropic 预训练团队,Google I/O 发布 Gemini 3.5 Flash 并给 Vertex AI 改名

今天最炸裂的消息是 Karpathy 宣布加入 Anthropic 预训练团队。群友分析,他先后拒绝回 Tesla 和加入导师的 world model 项目,唯独选了这里,说明大语言模型可能真要有新突破了。另一件大事是 Anthropic 收购 Stainless 后直接关停其托管服务,切断了 OpenAI 的 SDK 同步管道,群友把这叫“基础设施...

推荐理由:这是群聊日报的二手消息汇总,没有给出原始链接、具体任命细节或产品参数。Karpathy 去 Anthropic 这事我会先打个折,等官方确认再激动。Gemini 3.5 Flash 和 100 美元订阅档位正文没披露性能数据和权益清单,只能当个风向标看。整体信息量够上推荐,但可信度和细节都偏弱,所以放在 featured 的低分段。

AI HOT 精选

OpenAI 给每家 YC 创业公司投 200 万美元 API 额度,换股权

OpenAI 要给 Y Combinator 当前批次的每家创业公司提供价值 200 万美元的 API 信用额度,不是现金,是直接抵扣调用 GPT 等模型的费用,换取一定股权。正文没披露具体占股比例、额度有效期和使用上限。这招有点像当年 Sam Altman 在 YC 当合伙人时,Yuri Milner 给每家创业公司投钱的打法,只不过这次 OpenA...

推荐理由:我会先打个折:正文没写股权比例、使用期限和额度上限,所以这笔账到底划不划算还不好说。但 OpenAI 直接拿 API 额度换 YC 系公司的股权,等于在早期就把自己嵌进一堆创业公司的技术栈里,锁客意图很明显。对缺钱的团队来说,200 万美元的 API 信用确实能省下一大笔早期推理成本,只是别忽略绑定的代价。这点先别太激动,等条款出来再算总账。

AI HOT 精选

微软内部警告:AI 编程工具让 GitHub 的代码托管生意面临生存危机

微软内部认为,Cursor、Claude Code 这类 AI 编程助手正在改变开发者写代码和协作的方式,大家不再需要频繁把代码传到 GitHub 仓库,这让 GitHub 的托管业务受到根本性冲击。微软已经要求部分团队在 2026 年 6 月底前停用 Claude Code,统一改用自家的 GitHub Copilot CLI,表面理由是统一工具链和...

推荐理由:这条消息的杀伤力在于“内部示警”和“生存级风险”这两个词,把 AI 编程工具对 GitHub 托管业务的威胁摆到了台面上。我会先打个折:目前只有一家媒体爆料,微软和 GitHub 都没公开回应,所以不能当定论看。但信息量够硬——微软一边推 Copilot CLI,一边给 Claude Code 设了停用 deadline,说明内部已经在用行政手段抢开发者入口了。对从业者来说,这比单纯的产品更新更有嚼头:如果 AI 编程工具真的让代码托管变得可有可无,GitHub 的护城河就塌了一大块。正文没披露这个决策覆盖多大规模、是否全球执行,这点先别太激动。整...

AI HOT 精选

通义千问发布 Qwen3.7-Max,主打长时间自主干活和跨平台编程

Qwen 团队推出了 Qwen3.7-Max,一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务,官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面,它在 Terminal Bench 2.0 上拿了 69.7 分,超过了 DeepSeek-V4-Pro Max 的 67.9 分;在 SWE-Pro 这类复杂...

推荐理由:Qwen Studio 发了 Qwen3.7,一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成,摆明要往智能体方向走。我会先打个折:正文没给任何 benchmark、定价、上下文窗口或延迟数据,所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项,说明模型不只是聊天,而是被设计成能进业务流程干活。这点先别太激动,等看到具体评测和接入方式再说。

AI HOT 精选

Gemini 3.5 Flash 发布:价格涨了,但谷歌打算把它塞进所有产品里

谷歌在 I/O 大会上直接发布了 Gemini 3.5 Flash,跳过预览阶段。输入价格涨到每百万 token 1.5 美元,输出 9 美元,分别是上一代 Flash 预览版的 3 倍和 Flash-Lite 的 6 倍,已经快追上自家的 Pro 型号了。涨价不是谷歌一家的事,OpenAI 和 Anthropic 的新模型也都在提价,各家似乎都在试探...

推荐理由:我会先打个折:正文只给了价格和全面铺开的意图,没提能力提升、跑分或上下文窗口,所以没法判断涨得值不值。但涨价幅度本身对开发者是硬信号,值得放进精选。

AI HOT 精选

Gemini 推出个人 AI 代理 Spark 和每日简报,能跨 Gmail、文档、幻灯片自动干活

Gemini 这次加了两个功能。一个是 Gemini Spark,相当于一个常驻的个人 AI 代理,你授权后它可以自己在 Gmail、Google Docs 和 Slides 之间跑流程,官方说笔记本合上也能继续运行——这点先别太激动,正文没披露具体怎么实现、延迟和资源消耗也没提。另一个是 Daily Brief,根据你设定的个人目标,每天给你推定制摘...

推荐理由:Gemini 应用这次加了两个东西:Gemini Spark 可以在你授权后跨 Gmail、Docs、Slides 自动操作,Daily Brief 则给美国 18 岁以上订阅用户推送每日简报。等于从聊天助手往个人代理迈了一步,让模型直接进你的文档和邮件里干活。正文没提延迟、错误率和权限撤回细节,实际稳不稳还得看上线后的反馈。

AI HOT 精选

Claude Code 团队把主力输出格式从 Markdown 换成了 HTML

Claude Code 团队发现让模型直接生成 HTML 页面,比用 Markdown 更能把事说清楚。文章举了四个具体用法:用表格做对比、用 CSS 控制排版样式、用 SVG 画图表、用 JavaScript 加交互操作。他们没说性能数据或成本变化,更像是一篇内部实践分享,告诉你“我们这么用下来效果不错”。

推荐理由:Claude Code 团队把默认输出从 Markdown 切到 HTML,这篇官方博文列出了表格、CSS、SVG 和 JS 交互四种用法,说明 HTML 在展示结构化结果和可交互内容上比纯文本强。对写代码的人有实操参考价值,但不算重大产品发布,放在 featured 档合适。

TechCrunch · AI

Gmail 现在能直接语音问收件箱了,Google I/O 2026 上演示了用 Gemini 翻找邮件细节

Google 给 Gmail 的 AI 收件箱加上了语音对话搜索,你可以直接开口让 Gemini 帮你从邮件堆里挖出具体信息。目前正文没披露这个功能会推给哪些用户、支持什么语言、要不要额外付费、响应有多快,也没说背后是用什么检索机制把邮件捞出来的。

推荐理由:我会先打个折:这功能听起来挺方便,开车时动嘴就能查邮件里的航班号或报销金额。但正文只说了“可以语音搜 Gmail”,没交代支持哪些语言、是不是全球推送、要不要额外付费,也没讲清楚 Gemini 到底怎么从邮件里捞出答案——是直接扫全文还是先建索引。这点先别太激动,等有实测再判断到底省不省事。

The Verge · AI

Google I/O 画了一堆 AI 大饼,但前提是你得把个人数据交出来

Google 在 I/O 2026 上发布了 Gemini Spark(常驻 AI 助手,能帮你张罗活动)、Daily Brief(每日简报)和 Gmail AI 收件箱(根据邮件自动生成待办和回信草稿)。这些功能听起来都挺实用,但核心都是靠大量个人数据喂出来的。文章点出了这个信任问题,不过正文没披露具体的数据处理条款,所以先别急着说它安全还是不安全。

推荐理由:Google 在 I/O 2026 亮出的几个新工具,核心卖点是替你读邮件、替你整理信息,但前提是你得把大量个人数据交出去。正文只说了这些功能依赖个人信息,没写数据怎么处理、存多久、会不会拿去训练模型。我会先打个折:产品方向很明确,就是让 AI 住进你的邮箱和日程里,但隐私和信任那部分目前只有表态,没有细节。这点先别太激动,等 Google 把数据处理规则说清楚再判断值不值得跟进。

AI HOT 精选

Claude 操控真实界面的生产实践指南:点击更准、长任务不跑偏、操作可回放

Claude 现在能直接操作真实软件界面了,这篇博客讲的是怎么把它用到生产环境里,而不是只跑个 demo。文章给了四个具体机制:一是提高点击准确率,减少点错按钮的概率;二是可以选“思考努力级别”,在速度和效果之间做取舍;三是在长会话里保持上下文,避免任务跑到一半忘了前面在干嘛;四是把 Claude 的操作录成可重放的演示日志,方便排查和复现。正文没给出...

推荐理由:我会先打个折:这不是官方模型或产品发布,更像一份实战经验总结,所以放在质量教程档位。但它把 Claude 操控真实界面的四个关键机制讲得很清楚——怎么提高点击准头、怎么控制模型思考深度、怎么处理长会话不丢上下文、怎么把操作录下来复现。对正在把 agent 塞进业务流程的团队来说,这些点比 benchmark 数字更有用。

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

TechCrunch · AI

Google 学 Meta 做音频眼镜,在 I/O 2026 上发了款靠语音交互的智能眼镜

Google 在 I/O 大会上宣布和 Warby Parker、Gentle Monster 合作,推出新的“音频眼镜”。这副眼镜没有屏幕,主要靠语音指令来操作 Google 自家的应用和服务,包括调用 Gemini 助手。它会同时支持 Android 和 iOS,设计上有三星参与,预计今年晚些时候上市。正文没披露具体价格、硬件参数和确切发售日期,所...

推荐理由:我会先打个折:正文没给价格、上市时间和硬件参数,所以只能当个信号看,别太激动。但 Google 在 I/O 上亮出这副音频眼镜,摆明了要跟 Meta 抢 AI 穿戴入口,语音调用 Gemini 这条信息本身是实的。对从业者来说,这比单纯发个模型更能说明大厂在把 AI 往硬件里塞的节奏。

AI HOT 精选

Google 把 Gemini 科研助手 ERA 发在 Nature 上,并开放早期测试

Google Research 在《自然》杂志上发表了他们基于 Gemini 的“经验研究助手”(ERA),同时通过 Google Labs 的可信测试者计划开放了早期访问。这个工具想帮研究人员自动完成文献综述、提出假设和设计实验这些耗时的工作。文章主要讲了 ERA 从一篇 Nature 论文走向实际计算发现工具的过程,但正文没披露它在真实科研场景里的...

推荐理由:Google Research 把基于 Gemini 的 ERA 发在了 Nature 上,同时通过 Google Labs 的可信赖测试者计划开放初步试用。我会先打个折:正文没给出具体指标、基准测试设置,也没讲可复现的工作流细节,所以没法判断它到底有多能打。但这件事本身值得关注——它不是在秀一个 demo,而是试图把论文里的研究助手推到真实科研场景里去验证。这点先别太激动,等看到实际使用反馈和量化结果再说。

Hacker News 首页

Gemini CLI 将于 2026 年 6 月 18 日停服,全面转向 Antigravity CLI

Google 宣布 Gemini CLI 将在 2026 年 6 月 18 日停止服务,个人免费用户和 Pro/Ultra 订阅用户届时都无法再使用。这个命令行工具去年发布后攒了超过 10 万 GitHub 星标和 6000 个合并请求,但 Google 认为用户现在需要的是多个 AI 代理互相配合干活,而不是单打独斗,所以决定把精力集中到新的 Ant...

推荐理由:Google 开发者博客扔出一个 Gemini CLI 的停用日期,并指向 Antigravity CLI 作为替代。标题本身就是一个硬截止日,对依赖这条命令行的开发者冲击不小,所以 HKR 三项都站得住。不过正文除了日期和迁移目标外,没解释怎么迁、兼容性如何、旧项目会不会断,信息量其实很薄。我会先打个折,把它放在 featured 的低位,因为截止日本身就有新闻性,但细节缺口太大,不值得给更高分。

AI HOT 精选

谷歌搜索 25 年来最大改版:用 Gemini 3.5 Flash 把搜索框变成聊天框

谷歌在 I/O 大会上宣布搜索业务改版,核心是把搜索入口从“敲关键词”改成“直接说完整需求”。底层用新发布的 Gemini 3.5 Flash 模型跑响应,官方说速度是 GPT-5.5 的四倍,但没给具体延迟数据。AI Mode 上线一年后月活过了 10 亿,查询量每季度翻倍,说明用户确实在用。交互上,搜索框会动态变大,支持文字、图片、视频、文件甚至当...

推荐理由:谷歌搜索这次改版不是换个皮肤,而是把 AI 直接塞进搜索框和结果页,交互逻辑都变了。10 亿月活和每季度翻倍的查询量说明用户已经在用脚投票,不是实验室里的 demo。对做搜索、做内容、做 SEO 的人来说,这波改动会直接冲击流量分配和产品设计,所以优先级给到 p1。

TechCrunch · AI

谷歌搜索不再是那个链接列表了

谷歌在 I/O 大会上把搜索框彻底重做了。以后你输入问题,它不再只给你一排蓝色链接,而是直接展开成对话式回答,甚至能派“信息代理人”去帮你跑腿查资料、生成一个临时小工具。文章没给出具体上线时间,也没提这次改动对网站流量的影响有多大,但可以确定的是,那个靠排序链接来呈现信息的搜索时代结束了。

推荐理由:我会先打个折:正文没给上线时间、流量影响数据,也没说清楚代理具体能干什么,更像一篇观点评论。但 Google 把搜索从链接列表改成对话回答加自主代理,这个方向如果落地,对依赖搜索流量的产品和内容生态是实打实的冲击。标题虽然夸张,但抓住了搜索产品逻辑在转向这个点,所以给了 88 分、p1 级别。

The Verge · AI

Gmail 要能语音对话了:对着收件箱直接问,它帮你翻邮件找答案

Google 给 Gmail 加了一个叫 Gmail Live 的语音功能,点搜索栏图标就能直接开口问收件箱里的内容。发布会上员工现场演示,问了孩子学校的活动和自己去底特律的行程,Gmail 直接从邮件里抓出了学校展示活动的日期地点和行程信息。正文没披露这个功能什么时候上线、支持哪些语言,也没说离线能不能用。

推荐理由:我会先打个折:正文只给了两个演示例子,没写什么时候上线、要不要付费、背后用的什么模型。所以判断停在 featured 低段。但这件事本身挺直观——Gmail 搜索栏加了个语音入口,你对着它问“底特律的酒店订单”或者“孩子学校活动日期”,它直接回话,不用翻邮件。对每天被邮件淹没的人来说,省事是真的。这点先别太激动,等正式推送再看实际识别率和隐私处理。

The Verge · AI

Google I/O 推出 AI 购物通用购物车,让 Gemini 帮你跨店下单

Google 在 I/O 大会上发布了一个“通用购物车”,用户在搜索或跟 Gemini 聊天时就能把不同零售商的商品加进去,最后通过 Google 统一结账。这个购物车还会追踪价格、提示补货、推荐折扣,并提醒你选的商品可能有什么问题。未来会接入 YouTube 和 Gmail,但正文没披露定价、具体上线时间和首批覆盖哪些零售商。

推荐理由:Google 在 I/O 上放了个挺大胆的购物功能:你在 Search 或 Gemini 里看到想买的东西,AI 直接帮你加进购物车,最后通过 Google 结账。正文说未来还会接入 YouTube 和 Gmail,等于把购物触点铺到更多地方。我会先打个折——目前只说了发布,没给上线时间、覆盖商家和退款纠纷怎么处理,这些才是决定它能不能用的关键。但方向很明确,Google 想把 AI 从“帮你搜”推到“帮你花”,信任门槛比普通搜索高得多。

The Verge · AI

Google AI Studio 现在能靠一句话生成安卓原生 App

Google 给 AI Studio 加了个新功能:你输入想法,它直接生成一个能在安卓手机上跑的 App。平台里内嵌了安卓模拟器,写完可以先预览;想真机体验的话,把手机连上电脑就能安装。Google 说后续还会开放测试邀请功能,但目前还没上线。这次首发主要面向个人小工具类应用,不是啥都能做。

推荐理由:Google AI Studio 现在能靠提示词直接吐出可安装的 Android 原生应用,还带模拟器预览和真机安装。初版只覆盖个人工具类应用,不是完整开发环境,所以算中等分量的产品更新,不是 P1。

TechCrunch · AI

Google 发布 Android CLI 1.0,让 Claude Code、OpenAI Codex 这类 AI 编程工具也能直接命令行开发安卓应用

Google 在 I/O 大会上把 Android CLI 推到了 1.0 稳定版。这东西是个命令行工具,主要作用是让各种 AI 编程助手(比如 Claude Code、OpenAI Codex,或者 Google 自家的 Antigravity)能直接通过命令行来构建安卓应用,不用非得打开 Android Studio 的图形界面。它内置了一个“an...

推荐理由:我会先打个折:正文没给版本号、发布时间,也没性能数据,所以只能当个信号看。但 Google 加 Android 加 agentic coding 这个组合,本身就够上 featured 线。它不是在秀技术指标,而是在开一扇门——让 agent 从命令行直接插手 Android 构建,这对移动端开发者的工作方式冲击不小。