跳到正文

#Agent

今日 39 条

5月22日星期五

AI HOT 精选

Codex 现在能远程操控锁屏的 Mac,手机就能指挥它干活

OpenAI 开发者账号发帖说,Codex 可以在 Mac 锁屏、屏幕关闭的情况下,通过手机安全地使用 Mac 上的应用。帖子没提权限边界、怎么收费、什么时候上线,我会先打个折——正文只给了一个文档链接,具体怎么实现“安全”也没展开。

推荐理由:HKR 三项全中:OpenAI Devs 给出了 Codex 操控 Mac 的具体条件,但正文没披露权限边界、价格和发布时间,所以重要性停在 82 分,没上 85+。我会先打个折——这个功能听起来很省事,但没讲清楚锁屏下到底能碰哪些文件、会不会被滥用,这点先别太激动。

AI HOT 精选

谷歌发布 Kotlin 版和 Android 版 Agent 开发套件 0.1.0,让 AI 能在手机本地跑任务

谷歌把 Agent 开发套件(ADK)带到了 Kotlin 和 Android 上,版本号 0.1.0。Kotlin 版负责后端流程,Android 版则专门为手机端做了优化,能直接调用 Gemini Nano 这类本地模型干活。这套东西的核心是混合调度:你可以让云端大模型当总指挥,把涉及隐私的具体任务(比如查本地文件里的酒店预订)派给手机上的子 Ag...

推荐理由:Google 这次发了两个 ADK:Kotlin 版给后端搭 Agent 工作流,Android 版让 Agent 跑在手机上。版本号 0.1.0 说明还在早期,功能边界和稳定性都别抱太高期待。正文只交代了平台和版本,没给性能数据、实际案例或开发者规模,所以我会先打个折——方向对,但落地效果还得看后续。

Hacker News 首页

Runtime 给团队里每个人配一个沙盒编程助手,支持 Claude Code、Cursor 等主流工具

Runtime 做了一套开源的沙盒基础设施,让公司里不只有工程师能用编程助手,产品、设计、市场、客服也能在安全隔离的环境里让 AI 帮忙改代码、查数据、发 PR。它兼容 Claude Code、Codex、Cursor、Copilot、Gemini CLI 和 Devin 这些主流编程助手,可以接入公司自己的工具链(比如 Datadog、Salesfo...

推荐理由:我会先打个折:正文没披露实际客户或用量数据,所以别当成熟产品看。但它的切入点很准——企业不敢让编程代理直接跑在内部环境,Runtime 用沙盒把代理隔离开,还开源了基础设施,等于给团队一个低风险试水的入口。支持六种代理、不加价 token 的定价,也让成本更可预测。对正在评估编程代理的团队,这是个值得跟进的信号。

5月21日星期四

AI HOT 精选

Anthropic 快成第一家赚钱的 AI 实验室了,二季度预计营收 109 亿、运营利润 5.59 亿美元

华尔街日报的消息,Anthropic 二季度营收预计冲到 109 亿美元,同比增长 130%,运营利润约 5.59 亿美元,比它自己去年说的 2028 年前不盈利提前了不少。增长主要靠两件事:一是编程工具被大量公司用起来,二是 Claude 开始接那种能自己跑一段时间的“干活型”任务,需求大到算力一度不够用,逼着 Anthropic 去签新数据中心合同...

推荐理由:这条消息的钩子很清晰:Anthropic可能要成为第一个赚钱的头部AI实验室了。给出的数字挺吓人,单季营收109亿,运营利润5.59亿,如果属实,说明卖模型服务真的能跑通。但我会先打个折,因为这只是《华尔街日报》根据预测数据做的报道,不是官方审计后的财报,正文也没披露成本结构里算力烧了多少、企业客户贡献了多少。这点先别太激动,等正式文件出来再看。不过,光是“盈利”这两个字就足够让整个行业讨论一阵子了,所以优先级给到p1,重要性88分。

r/LocalLLaMA

Fireworks 提出“Agent 执行税”:浏览器智能体跑任务时,22.9% 的推理算力都浪费了

Fireworks 在 WebVoyager 上跑了 720 个浏览器智能体任务,发现平均有 22.9% 的推理调用属于无效消耗,他们管这个叫“Agent 执行税”——也就是为了完成任务,模型多做的无用功。具体到各家模型:MiniMax M2.5 每成功完成一个任务的成本比 Gemini 低了 2.3 倍;GLM-5 的任务成功率做到 57.1%;Ki...

推荐理由:HKR 三项都站得住:它把一个跑分现象包装成了可复用的采购指标,有具体数字支撑,而且直接回应了从业者在选型时对隐性成本的焦虑。信源是 Fireworks 自己的博客和 Reddit 讨论,不是第三方独立评测,所以重要性停在 74 分 featured 档,没往上拉。

MIT Technology Review · AI

Anthropic 在伦敦办了一场开发者大会,近半数人举手说上周刚发过完全由 Claude 写的代码,而且很多人没看就直接上线了

Anthropic 在伦敦的 Code with Claude 大会上展示了一个趋势:开发者越来越愿意把写代码的活直接交给 AI。工程师 Jeremy Hadfield 在现场问谁上周发过完全由 Claude 写的 pull request(提交审核的代码改动),近一半人举手;再问谁没读代码就直接发了,大部分手还举着。Anthropic 说公司内部大部...

推荐理由:这篇 MIT Tech Review 的现场报道不是产品发布稿,但抓到了一个很实的信号:开发者已经在把 Claude 写的代码直接往仓库里合,而且不少人连看都不看。我会先打个折,这个数字来自活动现场举手统计,样本量和代表性都有限,不能直接推成行业常态。但“近一半”这个比例还是够高,说明在重度用户里,对 AI 代码的信任已经跨过了一道心理门槛。文章没给 PR 的复杂度或后续回滚率,这点信息缺口让判断只能停在“行为在发生”而不是“行为没问题”。整体适合放进 featured,因为它比功能更新更能让人停下来想一下自己的工作流。

The Verge · AI

我用谷歌 AI Studio 一个下午“氛围编程”搞出了三个安卓 App,第一个只靠 148 个字的提示词

The Verge 的编辑 Sean Hollister 用谷歌 AI Studio 试了一把“氛围编程”,一个下午生成了三个安卓 App。其中一个 App 他只输入了 148 个字的提示词,大概 10 分钟后就在自己的安卓手机上装好跑起来了。前提是他提前把手机开了 USB 调试模式并连上电脑,剩下的活 AI Studio 全包了。他感叹这速度让他差点...

推荐理由:这不是 Google 官方大发布,而是一篇带实测细节的第一人称体验文,有梗有数字,适合放进精选。

AI HOT 精选

Cursor 复盘云端智能体踩坑史:环境没配好,模型再强也白搭

Cursor 团队把云端智能体从本地搬到服务器上跑了一年,最大的教训是:开发环境本身就是产品。本地跑的时候,模型直接继承你电脑上的全套工具链,但云端得从零重建,缺个依赖、少个配置,模型不会报错,只会悄悄变笨。他们后来把任务调度迁到 Temporal 上,可靠性从 99% 拉到了 99.9% 以上,现在平台每天处理超过 5000 万次操作。文章还聊了怎么...

推荐理由:HKR 三项都成立:Cursor 在编程 agent 圈子里是核心玩家,文章给出了 Temporal 迁移、99.9%+ 可靠性和 5000 万次日操作量这些实打实的数据。不是产品发布,所以放在 featured 低段位。

阿里技术 · 公众号

从零搭一个 Agent:原理拆解与个人助手实操

这篇文章因为微信环境异常,正文内容没抓到,只看到标题和作者信息。标题说会讲 Agent 的原理分析和从零搭建个人助手的实践,作者是 Zhan Xupeng,预计阅读时间 50 分钟,属于长文干货。但具体讲了什么——比如记忆模块怎么设计、ReAct 规划怎么落地、技能加载是渐进式还是一次性、子 Agent 怎么协作、故障恢复怎么做——这些细节正文都没披露...

推荐理由:我会先打个折:标题确实平平无奇,像又一篇入门教程。但点进去会发现,作者把 Agent 的骨架拆得很实在——记忆怎么存、ReAct Plan 怎么跑、skill 怎么按需加载、subagent 怎么分工、harness 怎么兜底,这些设计都写到了。对正在折腾个人助手或想让 Agent 稳定跑业务的同学来说,这篇比大多数水文有料。不过正文没给出量化验证,效果到底怎么样还得自己试。

新智元 · 公众号

Anthropic 买下 SDK 工具商 Stainless,OpenAI 等客户得自己维护代码库了

Anthropic 把 Stainless 给收购了。Stainless 是一家专门帮公司自动生成和维护 API 的 SDK(软件开发工具包)的公司,OpenAI、Meta、Cloudflare 之前都是它的客户。收购之后,Stainless 会关掉它的托管产品,也不再给老客户提供后续支持。不过,之前已经生成的 SDK 代码所有权还归客户自己,只是后续...

推荐理由:我会先打个折:这不是模型发布或核心能力更新,所以分数不会顶满。但 Anthropic 这手挺狠,Stainless 是给 API 自动生成 SDK 的,全球据说四分之一开发者都在用,客户包括 OpenAI 和 Meta。收购后 Anthropic 直接要把托管产品关停,等于断了竞争对手一条现成的开发者工具链。正文没披露收购金额和具体关停时间表,但光是“断供 OpenAI”这个动作,就够让依赖这套工具的团队紧张一阵了。

AI HOT 精选

腾讯发布操作系统层级的 AI 助手“马维斯”,Windows、Mac、安卓同步上线

腾讯公关总监张军宣布 AI 助手“马维斯”正式上线,覆盖 Windows、Mac 和安卓。它不是一个普通的聊天窗口,而是直接长在系统层,能理解文件结构、归类解析文档、识别处理图片,甚至帮你修电脑。官方说市面上 Agent 能做的事它基本都能做,还能调度不同模型、在电脑上操控手机应用。比较实在的一点是,它预装了不少本地模型,通过路由机制把轻量任务分给本地...

推荐理由:腾讯把 AI 助手直接做进操作系统层,Windows、Mac、安卓一起发,能读文档、识图、做系统维护,还能跨设备操控,部分功能离线可用。我会先打个折:正文没披露背后的模型、定价和权限设计细节,所以目前只能看到产品形态,看不到技术底牌。这点先别太激动,但三端同步和系统级操控确实把桌面 agent 的竞争往前推了一步,对做 agent 和端侧部署的团队来说是个值得盯的样本。

Latent Space

Railway:为 AI 代理而生的云,35 人撑起 300 万用户

Railway 创始人 Jake Cooper 聊了他们怎么从 18 个月攒 100 个用户,做到现在每周新增 10 万注册。团队只有 35 人,服务 300 万用户,融了 1.24 亿美元。他们把大部分工作负载搬到了自建裸金属数据中心,回本周期只要 3 个月,对比租用云服务能省下不少钱。Jake 认为未来的软件是给 AI 代理用的,不是给人用的,所以...

推荐理由:这篇访谈不是讲模型本身,而是讲基础设施怎么为 agent 工作负载重新设计。Railway 用一个小团队撑起 300 万用户,还做了裸金属迁移,对做 agent 部署的开发者来说是个很实在的参考。信息密度和话题性都够,但毕竟不是核心模型发布或重大产品更新,给 74 分放在 featured 里比较合适。

r/LocalLLaMA

Cohere 联合创始人亲自回应:Command A+ 是他们第一个 MoE 开源模型,主打在 1-2 张 GPU 上跑得动

Cohere 的 Nick Frosst 在 Reddit 上发帖,正式推出了 Command A+。这是他们第一个混合专家(MoE)模型,用 Apache 2.0 协议开源。帖子里说,这个模型最大的卖点是效率,做了很极限的量化工作,在 1 到 2 张消费级 GPU 上就能跑得很流畅,对个人开发者和小团队比较友好。不过他也直说,模型的顶尖性能还有待打磨...

推荐理由:我会先打个折:正文没披露参数量、基准测试成绩和上下文窗口,这些关键指标全缺,所以重要性只能给到 74。亮点是 Cohere 终于把 Command-A 这条线捡起来,换成 MoE 架构还给了 Apache 2.0,量化后能在 1 或 2 张 GPU 上跑,对想自己部署的人是个实在消息。但信源只有 Reddit 讨论,没有官方技术报告或实测数据,这点先别太激动。

AI HOT 精选

Google 把设计搭子 Stitch 升级了,现在能读你的代码库直接生成界面

Stitch 这次更新主要干了四件事。一是实时流式出设计稿,你边改它边生成,不用干等。二是能直接导入现有代码库或 Design.md 文件,拿你项目里真实在用的组件来做设计,品牌风格不容易跑偏。三是加了动态界面生成,四是做完的设计可以导出成一个可分享的线上链接,省掉从原型到上线中间一堆部署步骤。工具现在已经全球开放,正文没提收费模式。

推荐理由:我会先打个折:正文没披露模型细节、定价和实际输出质量,所以别急着当生产工具。但 Stitch 这次更新把实时流式构建和代码库导入加进来,等于让 AI 直接读你的代码和设计文档来生成页面,不再是画个样子就完事。对天天在 Figma 和代码编辑器之间切换的团队,这个流程缩短挺实在。全球开放也让更多人能上手试,不过没看到成本或准确率数据,这点先别太激动。

The Verge · AI

谷歌搜索的 AI 进化,就是塞进更多广告

谷歌开始在搜索广告里用 Gemini 自动生成产品介绍,还会在部分广告里直接嵌入聊天机器人。文章拿胶囊咖啡机举了个例子,但没提具体覆盖范围和广告价格怎么算。说白了,你搜东西时看到的“赞助产品”描述,以后可能都是 AI 写的,有些广告点进去还能跟机器人聊两句。

推荐理由:Google 开始在 Gemini 的商品搜索结果里塞赞助商品和广告聊天机器人了。我会先打个折:正文完全没提投放范围有多大、怎么收费、效果数据如何,所以这更像一次试探性铺开,而不是大规模产品发布。对从业者来说,值得盯的是它把广告嵌进对话式搜索的路径,但现阶段信息缺口太大,先别太激动。

5月20日星期三

The Verge · AI

如果连 Google 都做不出有用的 AI 智能体,那可能没人能了

Google 在 I/O 2026 上发了好几个 AI 智能体,能帮人搜资料、规划活动、总结邮件和日历。这些智能体可以在后台一直跑,但文章没提什么时候上线、怎么收费,也没给任何实测数据。作者的意思是,Google 在 AI 智能体上折腾了好几年,这次借着 OpenClaw 的热度再推一把,但如果连手握海量用户数据的 Google 都搞不定,那整个行业吹...

推荐理由:H 和 R 都很强,因为文章把 Google 的 agent 当成整个行业能不能成的风向标,而且直接踩中从业者对实用性、平台权力和成本的焦虑。K 给了新信息,但只限于后台运行这一点,正文没披露上线时间、定价和实际评测结果,所以整体还是落在 featured 偏下位置。

TechCrunch · AI

Figma 在协作画布里塞了个 AI 助手,能直接用对话生成和修改设计

Figma 在它的多人协作画布上直接加了一个 AI 助手。你可以用大白话让它生成新设计、改现有设计,或者自动跑一些重复活儿,比如批量出不同版本的设计稿。你还能同时开好几个助手,让它们各干各的。Figma 说这个助手能理解设计语境和元素,因为它背后用的模型是专门针对设计场景调过的。不过正文没披露这个助手具体是用自家模型还是接了别家的 API,也没提生成结...

推荐理由:Figma 把 AI agent 塞进了协作画布,你打字就能让它生成或改设计。我会先打个折:正文只说了能力范围,没提用的是什么模型、成本多少、什么时候上线,所以别太激动。但这件事本身值得关注,因为它意味着设计师的工作流可能要被 agent 插一脚了。

阿里技术 · 公众号

阿里平头哥发布真武 M890 AI 芯片,128 卡超节点服务器已在百炼平台上线

阿里平头哥的真武 M890 AI 芯片首次公开,主打 Agent 场景的算力底座。配套的 128 卡超节点服务器,卡间直连延迟低于 150 纳秒,机架带宽达到 Pb/s 级别。这套硬件已经在阿里云百炼平台跑起来了,支持通义千问、DeepSeek 和 Kimi 等模型。不过正文因为环境验证问题没加载出来,具体的芯片架构、制程、显存规格和实测性能数据暂时看...

推荐理由:HKR三项都踩中了,但得先打个折——消息源是阿里自己的技术文章,没有第三方实测、没提定价、也没说量产规模。所以分数就卡在featured门槛上,当个基础设施产品更新看比较合适。

新智元 · 公众号

摩尔线程 MUSA 生态更新:SDK 对齐 CUDA 12.8,SGLang 主线已合并

摩尔线程放出了自家 GPU 生态 MUSA 的最新进展。SDK 5.1.0 把兼容目标拉到了 CUDA 12.8,覆盖了 761 个驱动和运行时接口,意思是跑 CUDA 代码时能认的指令更多了。推理框架 SGLang 的主线代码已经合并了 MUSA 的支持,硬件支持排期在 2026 年第二季度。另外还提了一个叫 MUSACODE 的工具,能自动把库迁移...

推荐理由:我会先打个折:这还是一家厂商的生态更新,不是整个国产 GPU 阵营的集体突破。但文章把兼容 API 数量、SDK 版本对标和 SGLang 主线合入这几个点都摆出来了,比空谈“替代 CUDA”实在。老黄喝豆汁的梗让标题有了传播力,内文也没写成公关稿,对关注推理部署和算力自主的读者来说值得一看。

新智元 · 公众号

驭势科技在港交所上市,成为全场景L4自动驾驶第一股,市值超百亿港元

驭势科技今天在港交所挂牌,发行价每股60.30港元,公开发售部分超额认购6777倍。公司主要做机场、厂区这类封闭场景的L4级无人驾驶物流车和接驳车,2025年在大中华区机场L4商用车市场占了90.5%的份额。不过原文因为微信环境验证拦截,正文内容没抓到,具体的财务数据、技术路线和募资用途都没披露,这些关键信息得去翻招股书才能确认。

推荐理由:驭势科技港股上市,机场 L4 商用车市占率做到九成,公开发售被抢了六千多倍,说明市场对自动驾驶商业化这条路的买单意愿很强。不过正文没披露营收和盈利情况,光看市占率还判断不了生意本身赚不赚钱,这点先别太激动。

机器之心 · 公众号

谷歌 I/O 大会后,搜索框直接变成了 AI 智能体入口

谷歌在 I/O 大会上发布了 Gemini 3.5 Flash,并把 AI 模式直接嵌进了搜索框。公司说现在它的 AI 服务每月要处理超过 3200 万亿个 token,已经有超过 850 万开发者在使用 Gemini。不过这篇文章因为微信平台的环境验证问题,正文内容没能加载出来,所以具体的模型参数、性能对比和实际体验细节都没法确认。

推荐理由:谷歌 I/O 这次把模型更新和搜索入口绑在一起推,AI Mode 直接嵌进搜索框,比普通功能发布重得多。Gemini 3.5 Flash 是新的轻量模型,月 token 消耗 3.2 千万亿说明用量已经很大,850 万开发者这个数字也够扎实。我会先打个折:正文没披露 3.5 Flash 的具体 benchmark 对比和定价,实际性价比还得等实测。但就凭搜索框变智能体这一条,当天必须写。

Latent Space

Google I/O 2026:Gemini 3.5 Flash 发布,百万 token 上下文、四种思考模式,主打编程和干活快

Google 在 I/O 大会上把 Gemini 重新定位成消费级 AI 入口和开发者代理平台。最核心的发布是 Gemini 3.5 Flash,今天就能用,上下文窗口 100 万 token,单次最多输出 6.5 万 token,提供“极简/低/中/高”四档思考深度,并且能在多轮对话里保留思考过程。官方说它比 3.1 Pro 更强,尤其在终端操作、编...

推荐理由:Google I/O 这次不是单点发布,是把模型、视频、agent 和开发工具打包一起推。Gemini 3.5 Flash 的定价和上下文窗口摆在那,对做应用的人有直接参考价值;Omni 的视频理解和 Spark 的后台 agent 思路,跟现在行业里追的 agent 落地、多模态成本是同一根神经。我会先打个折——现场 demo 和实际 API 稳定性之间通常有差距,但信息量够、时间点敏感,放 P1 没问题。

AI HOT 精选

微软内部警告:AI 编程工具让 GitHub 的代码托管生意面临生存危机

微软内部认为,Cursor、Claude Code 这类 AI 编程助手正在改变开发者写代码和协作的方式,大家不再需要频繁把代码传到 GitHub 仓库,这让 GitHub 的托管业务受到根本性冲击。微软已经要求部分团队在 2026 年 6 月底前停用 Claude Code,统一改用自家的 GitHub Copilot CLI,表面理由是统一工具链和...

推荐理由:这条消息的杀伤力在于“内部示警”和“生存级风险”这两个词,把 AI 编程工具对 GitHub 托管业务的威胁摆到了台面上。我会先打个折:目前只有一家媒体爆料,微软和 GitHub 都没公开回应,所以不能当定论看。但信息量够硬——微软一边推 Copilot CLI,一边给 Claude Code 设了停用 deadline,说明内部已经在用行政手段抢开发者入口了。对从业者来说,这比单纯的产品更新更有嚼头:如果 AI 编程工具真的让代码托管变得可有可无,GitHub 的护城河就塌了一大块。正文没披露这个决策覆盖多大规模、是否全球执行,这点先别太激动。整...

AI HOT 精选

通义千问发布 Qwen3.7-Max,主打长时间自主干活和跨平台编程

Qwen 团队推出了 Qwen3.7-Max,一个专为智能体场景设计的闭源模型。它最显眼的能力是能长时间自主执行任务,官方演示了一个连续跑 35 小时、调用上千次工具的内核优化任务。在编程方面,它在 Terminal Bench 2.0 上拿了 69.7 分,超过了 DeepSeek-V4-Pro Max 的 67.9 分;在 SWE-Pro 这类复杂...

推荐理由:Qwen Studio 发了 Qwen3.7,一口气覆盖聊天、图像视频理解、图像生成、文档处理、网页搜索、工具调用和工件生成,摆明要往智能体方向走。我会先打个折:正文没给任何 benchmark、定价、上下文窗口或延迟数据,所以没法判断实际可用性和成本。亮点是工具调用和工件生成这两项,说明模型不只是聊天,而是被设计成能进业务流程干活。这点先别太激动,等看到具体评测和接入方式再说。

AI HOT 精选

Gemini 推出个人 AI 代理 Spark 和每日简报,能跨 Gmail、文档、幻灯片自动干活

Gemini 这次加了两个功能。一个是 Gemini Spark,相当于一个常驻的个人 AI 代理,你授权后它可以自己在 Gmail、Google Docs 和 Slides 之间跑流程,官方说笔记本合上也能继续运行——这点先别太激动,正文没披露具体怎么实现、延迟和资源消耗也没提。另一个是 Daily Brief,根据你设定的个人目标,每天给你推定制摘...

推荐理由:Gemini 应用这次加了两个东西:Gemini Spark 可以在你授权后跨 Gmail、Docs、Slides 自动操作,Daily Brief 则给美国 18 岁以上订阅用户推送每日简报。等于从聊天助手往个人代理迈了一步,让模型直接进你的文档和邮件里干活。正文没提延迟、错误率和权限撤回细节,实际稳不稳还得看上线后的反馈。

The Verge · AI

Google I/O 画了一堆 AI 大饼,但前提是你得把个人数据交出来

Google 在 I/O 2026 上发布了 Gemini Spark(常驻 AI 助手,能帮你张罗活动)、Daily Brief(每日简报)和 Gmail AI 收件箱(根据邮件自动生成待办和回信草稿)。这些功能听起来都挺实用,但核心都是靠大量个人数据喂出来的。文章点出了这个信任问题,不过正文没披露具体的数据处理条款,所以先别急着说它安全还是不安全。

推荐理由:Google 在 I/O 2026 亮出的几个新工具,核心卖点是替你读邮件、替你整理信息,但前提是你得把大量个人数据交出去。正文只说了这些功能依赖个人信息,没写数据怎么处理、存多久、会不会拿去训练模型。我会先打个折:产品方向很明确,就是让 AI 住进你的邮箱和日程里,但隐私和信任那部分目前只有表态,没有细节。这点先别太激动,等 Google 把数据处理规则说清楚再判断值不值得跟进。

FT · 科技

Google 要出智能眼镜,还会在搜索引擎里塞进 AI 代理

Google 准备发布智能眼镜,同时给搜索引擎加上 AI 代理功能。CEO Sundar Pichai 说这些功能靠新的 Gemini 模型驱动,目标是缩小跟 Anthropic 和 OpenAI 的差距。不过这篇付费墙后面的正文没披露具体规格、上市时间和价格,所以眼镜长什么样、卖多少钱、什么时候能买到,现在都还不知道。

推荐理由:我会先打个折:正文没披露参数、时间表和价格,所以没法判断落地有多快。但 Google 把 Gemini agent 塞进搜索,再配上智能眼镜,等于在用户每天用的入口上同时推两个 AI 触点。Pichai 自己说新功能要缩小跟 Anthropic、OpenAI 的差距,这话本身就说明他们承认落后,也在用产品动作追。对从业者来说,看点不是技术多新,而是 Google 怎么用分发优势把 agent 推到普通人面前。这点先别太激动,等具体上线和实测再说。

AI HOT 精选

Claude 操控真实界面的生产实践指南:点击更准、长任务不跑偏、操作可回放

Claude 现在能直接操作真实软件界面了,这篇博客讲的是怎么把它用到生产环境里,而不是只跑个 demo。文章给了四个具体机制:一是提高点击准确率,减少点错按钮的概率;二是可以选“思考努力级别”,在速度和效果之间做取舍;三是在长会话里保持上下文,避免任务跑到一半忘了前面在干嘛;四是把 Claude 的操作录成可重放的演示日志,方便排查和复现。正文没给出...

推荐理由:我会先打个折:这不是官方模型或产品发布,更像一份实战经验总结,所以放在质量教程档位。但它把 Claude 操控真实界面的四个关键机制讲得很清楚——怎么提高点击准头、怎么控制模型思考深度、怎么处理长会话不丢上下文、怎么把操作录下来复现。对正在把 agent 塞进业务流程的团队来说,这些点比 benchmark 数字更有用。

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。

TechCrunch · AI

Google 学 Meta 做音频眼镜,在 I/O 2026 上发了款靠语音交互的智能眼镜

Google 在 I/O 大会上宣布和 Warby Parker、Gentle Monster 合作,推出新的“音频眼镜”。这副眼镜没有屏幕,主要靠语音指令来操作 Google 自家的应用和服务,包括调用 Gemini 助手。它会同时支持 Android 和 iOS,设计上有三星参与,预计今年晚些时候上市。正文没披露具体价格、硬件参数和确切发售日期,所...

推荐理由:我会先打个折:正文没给价格、上市时间和硬件参数,所以只能当个信号看,别太激动。但 Google 在 I/O 上亮出这副音频眼镜,摆明了要跟 Meta 抢 AI 穿戴入口,语音调用 Gemini 这条信息本身是实的。对从业者来说,这比单纯发个模型更能说明大厂在把 AI 往硬件里塞的节奏。

AI HOT 精选

Google I/O 发了几个 Gemini 新东西:新设计、智能体功能、Omni 和 3.5 Flash 模型

Google 在 I/O 大会上扔了一串 Gemini 更新。设计上用了“神经表达技术”,听起来像是让交互更自然,但正文没解释具体怎么实现。智能体功能提到了每日简报和 Gemini Spark,还没说什么时候能用。模型这边出了 Gemini Omni 和 3.5 Flash,参数规模、跑分、价格和发布时间一概没提,我会先打个折,等有实测再判断。

推荐理由:HKR 三项都成立:Google I/O 把 Gemini 的 Omni、3.5 Flash 和智能体打包发布,信息量够硬,也踩在开发者关心的竞品节奏上。我会先打个折——正文没给发布时间、参数和价格,所以重要性停在 84 分,featured 没问题。

AI HOT 精选

Google 发了 Gemini 3.5,说模型不光能想还能动手干活

Google AI 开发者账号宣布了 Gemini 3.5 模型家族,强调它把推理和执行能力合在一起,目标是让模型直接进业务流程干活。但正文没披露参数量、跑分、价格、上下文窗口和具体上线时间,也没说跟上一代比到底强在哪。这点先别太激动,等有实测数据再看。

推荐理由:H 和 R 都站得住:官方发新模型家族,关注度够高,也会刺激大家去比参数、比价格。但 K 确实不行,整篇公告除了名字什么都没给,没法做技术判断,所以总分拉不到 85 以上。

AI HOT 精选

Google 把 Gemini 科研助手 ERA 发在 Nature 上,并开放早期测试

Google Research 在《自然》杂志上发表了他们基于 Gemini 的“经验研究助手”(ERA),同时通过 Google Labs 的可信测试者计划开放了早期访问。这个工具想帮研究人员自动完成文献综述、提出假设和设计实验这些耗时的工作。文章主要讲了 ERA 从一篇 Nature 论文走向实际计算发现工具的过程,但正文没披露它在真实科研场景里的...

推荐理由:Google Research 把基于 Gemini 的 ERA 发在了 Nature 上,同时通过 Google Labs 的可信赖测试者计划开放初步试用。我会先打个折:正文没给出具体指标、基准测试设置,也没讲可复现的工作流细节,所以没法判断它到底有多能打。但这件事本身值得关注——它不是在秀一个 demo,而是试图把论文里的研究助手推到真实科研场景里去验证。这点先别太激动,等看到实际使用反馈和量化结果再说。

AI HOT 精选

谷歌发布 Gemini 3.5 系列,先上 Flash 版,主攻智能体和编程

谷歌 AI 在 X 上宣布推出 Gemini 3.5 系列,首发的是 Gemini 3.5 Flash。官方说这个版本重点强化了智能体(让模型进业务流程干活)和编程能力。正文没披露参数量、价格、跑分成绩和上下文窗口大小,所以实际提升有多大、成本划不划算,现在还没法判断。

推荐理由:Gemini 3.5 系列是 Google 的正代更新,Flash 版先出,定位在智能体和编程,这两个方向现在很热。但正文没披露价格、上下文长度和参数量,我会先打个折——信息不全,实际落地成本不好判断。这点先别太激动,等补上关键数字再重新评估。

AI HOT 精选

谷歌搜索 25 年来最大改版:用 Gemini 3.5 Flash 把搜索框变成聊天框

谷歌在 I/O 大会上宣布搜索业务改版,核心是把搜索入口从“敲关键词”改成“直接说完整需求”。底层用新发布的 Gemini 3.5 Flash 模型跑响应,官方说速度是 GPT-5.5 的四倍,但没给具体延迟数据。AI Mode 上线一年后月活过了 10 亿,查询量每季度翻倍,说明用户确实在用。交互上,搜索框会动态变大,支持文字、图片、视频、文件甚至当...

推荐理由:谷歌搜索这次改版不是换个皮肤,而是把 AI 直接塞进搜索框和结果页,交互逻辑都变了。10 亿月活和每季度翻倍的查询量说明用户已经在用脚投票,不是实验室里的 demo。对做搜索、做内容、做 SEO 的人来说,这波改动会直接冲击流量分配和产品设计,所以优先级给到 p1。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,智商分涨到 55,速度超 280 tokens/秒,但运行成本贵了 5.5 倍

谷歌把 Gemini Flash 系列更新到了 3.5 版,智商评分从上一代的 46 分提到 55 分,直接超过了 Grok 4.3 和 Claude Sonnet 4.6。进步主要在两方面:一是让模型进业务流程干活(代理任务)更靠谱了,二是知识真实性提升,幻觉明显减少。输出速度超过每秒 280 个 token,在速度和智商之间卡了个好位置。多模态评测...

推荐理由:谷歌发Gemini 3.5 Flash,属于头部实验室的模型迭代,而且有Artificial Analysis的第三方数据撑腰,速度、智能、成本都摆出来了。HKR三项全中,尤其是5.5倍的成本跳涨让这条消息不止于常规发布,值得从业者看一眼。

TechCrunch · AI

谷歌发布 Gemini 3.5 Flash,把下一波 AI 押注在能自己干活的智能体上,而不是聊天机器人

谷歌在 I/O 开发者大会上推出了 Gemini 3.5 Flash,官方说这是他们目前写代码和驱动 AI 智能体(让模型进业务流程干活)最强的模型。它能独立跑通编程流程、管理研究项目,内部测试里甚至从零搭建了一个操作系统。这标志着谷歌的重心从聊天转向了能自主执行复杂任务的智能体。不过,正文没披露这个模型的参数量、上下文窗口和具体定价,所以实际成本和规...

推荐理由:我会先打个折:正文没披露参数量、价格和上下文窗口,所以性能上限和实际成本都还看不清。但 Google 这次把 Gemini 3.5 Flash 直接押在 agent 和从零写软件上,等于说“别只把我当聊天工具,我能进业务流程干活”。对做 agent 和代码生成的人来说,这个方向比单纯刷榜更有看头。不过没给技术细节和定价,现在只能当信号看,别太激动。

The Verge · AI

Google 想用 CodeMender 跟 Anthropic 的 Claude Mythos 抢安全赛道

Google 在 I/O 上把去年 10 月亮相的代码安全工具 CodeMender 的 API 开放给一批专家测试,定位是“能自己发现漏洞并修好”的 AI agent。DeepMind CTO 说目标是帮全球代码库做安全加固。文章拿它跟 Anthropic 突然发布的 Claude Mythos Preview 对比,但正文没披露 CodeMende...

推荐理由:HKR 三项都踩中了,但正文只确认了封闭内测和标记修复机制,开放时间、价格、评测结果全都没披露,所以先放在 featured 这一档。

TechCrunch · AI

谷歌搜索不再是那个链接列表了

谷歌在 I/O 大会上把搜索框彻底重做了。以后你输入问题,它不再只给你一排蓝色链接,而是直接展开成对话式回答,甚至能派“信息代理人”去帮你跑腿查资料、生成一个临时小工具。文章没给出具体上线时间,也没提这次改动对网站流量的影响有多大,但可以确定的是,那个靠排序链接来呈现信息的搜索时代结束了。

推荐理由:我会先打个折:正文没给上线时间、流量影响数据,也没说清楚代理具体能干什么,更像一篇观点评论。但 Google 把搜索从链接列表改成对话回答加自主代理,这个方向如果落地,对依赖搜索流量的产品和内容生态是实打实的冲击。标题虽然夸张,但抓住了搜索产品逻辑在转向这个点,所以给了 88 分、p1 级别。

AI HOT 精选

谷歌发布 Gemini 3.5 Flash,专治复杂、跑得久的自动化流程

谷歌在 I/O 大会上掏出了 Gemini 3.5 系列的第一个模型 Flash,定位很明确:让模型进业务流程干活,处理那种步骤多、周期长的任务。在 Terminal-Bench 和 MCP Atlas 这两个考编程和代理能力的测试里,它的分数压过了自家上一代的 3.1 Pro。速度方面,比别家顶尖模型快 4 倍,如果放在谷歌自己的 Antigravi...

推荐理由:谷歌在 I/O 大会上扔了个 Gemini 3.5 Flash,专门给那种要跑很久、步骤很复杂的 agent 工作流用的。我会先打个折:跑分是谷歌自己给的,第三方还没复现,但 Terminal-Bench 上超 3.1 Pro、速度是其他前沿模型 4 倍这些数字,如果属实确实省钱省时间。Antigravity 环境里飙到 12 倍,这点先别太激动,正文没披露那是啥场景、跟谁比。整体看,这是个同日发布的重要模型更新,对做 agent 落地的人有直接参考价值,但还没到改写行业规则的程度。