跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 221–240 条 · 共 760 条

5月20日星期三

AI HOT 精选

Claude 操控真实界面的生产实践指南:点击更准、长任务不跑偏、操作可回放

Claude 现在能直接操作真实软件界面了,这篇博客讲的是怎么把它用到生产环境里,而不是只跑个 demo。文章给了四个具体机制:一是提高点击准确率,减少点错按钮的概率;二是可以选“思考努力级别”,在速度和效果之间做取舍;三是在长会话里保持上下文,避免任务跑到一半忘了前面在干嘛;四是把 Claude 的操作录成可重放的演示日志,方便排查和复现。正文没给出...

推荐理由:我会先打个折:这不是官方模型或产品发布,更像一份实战经验总结,所以放在质量教程档位。但它把 Claude 操控真实界面的四个关键机制讲得很清楚——怎么提高点击准头、怎么控制模型思考深度、怎么处理长会话不丢上下文、怎么把操作录下来复现。对正在把 agent 塞进业务流程的团队来说,这些点比 benchmark 数字更有用。

AI HOT 精选

Google AI Edge Gallery 更新:手机端模型能调外部工具、设提醒、记住聊天了

Google 给 AI Edge Gallery 这个手机端模型体验应用加了三个新能力。一是安卓版开始实验性支持 MCP(模型上下文协议),你可以给手机上的 Gemma 4 模型配一个外部工具服务器地址,比如连上 Google Workspace 查日历邮件,或者接 Google Maps 问路、接网页抓取工具读链接内容。模型在本地决定调哪个工具,请求...

推荐理由:Google 在安卓 AI Edge Gallery 里塞了实验性 MCP 支持,Gemma 4 能直接调 Workspace、Maps 这些外部工具,还补了通知和会话记忆。我会先打个折——正文没披露延迟、耗电和实际可用工具数量,目前更像开发者尝鲜版。但方向很明确:让手机端模型从聊天框跳出来,进到系统里干活。这点先别太激动,等看实际跑起来的稳定性。

AI HOT 精选

Google 把 Tensor 芯片的 AI 能力开放给开发者,Pixel 10 手机上的 TPU 现在可以直接跑模型了

Google 发布了 Tensor ML SDK 的公开测试版,开发者现在能把 PyTorch 或 TFLite 模型转换、编译后,直接调用 Pixel 10 系列手机里的 TPU 芯片来跑推理。整个流程通过 LiteRT 这个统一框架完成,不用再分别对接底层硬件驱动。官方还提供了一个模型库,里面有超过 100 个现成的经典模型和生成式 AI 模型,包...

推荐理由:HKR-K 很扎实:文章给出了 Pixel 10 TPU 上的具体工作流和一个 100+ 模型库。H 和 R 也够得上 featured,但这是个测试版开发者 SDK,不是旗舰模型或面向大众的产品发布,所以我会先打个折。

TechCrunch · AI

Google 学 Meta 做音频眼镜,在 I/O 2026 上发了款靠语音交互的智能眼镜

Google 在 I/O 大会上宣布和 Warby Parker、Gentle Monster 合作,推出新的“音频眼镜”。这副眼镜没有屏幕,主要靠语音指令来操作 Google 自家的应用和服务,包括调用 Gemini 助手。它会同时支持 Android 和 iOS,设计上有三星参与,预计今年晚些时候上市。正文没披露具体价格、硬件参数和确切发售日期,所...

推荐理由:我会先打个折:正文没给价格、上市时间和硬件参数,所以只能当个信号看,别太激动。但 Google 在 I/O 上亮出这副音频眼镜,摆明了要跟 Meta 抢 AI 穿戴入口,语音调用 Gemini 这条信息本身是实的。对从业者来说,这比单纯发个模型更能说明大厂在把 AI 往硬件里塞的节奏。

AI HOT 精选

Google 把 Gemini 科研助手 ERA 发在 Nature 上,并开放早期测试

Google Research 在《自然》杂志上发表了他们基于 Gemini 的“经验研究助手”(ERA),同时通过 Google Labs 的可信测试者计划开放了早期访问。这个工具想帮研究人员自动完成文献综述、提出假设和设计实验这些耗时的工作。文章主要讲了 ERA 从一篇 Nature 论文走向实际计算发现工具的过程,但正文没披露它在真实科研场景里的...

推荐理由:Google Research 把基于 Gemini 的 ERA 发在了 Nature 上,同时通过 Google Labs 的可信赖测试者计划开放初步试用。我会先打个折:正文没给出具体指标、基准测试设置,也没讲可复现的工作流细节,所以没法判断它到底有多能打。但这件事本身值得关注——它不是在秀一个 demo,而是试图把论文里的研究助手推到真实科研场景里去验证。这点先别太激动,等看到实际使用反馈和量化结果再说。

Hacker News 首页

Gemini CLI 将于 2026 年 6 月 18 日停服,全面转向 Antigravity CLI

Google 宣布 Gemini CLI 将在 2026 年 6 月 18 日停止服务,个人免费用户和 Pro/Ultra 订阅用户届时都无法再使用。这个命令行工具去年发布后攒了超过 10 万 GitHub 星标和 6000 个合并请求,但 Google 认为用户现在需要的是多个 AI 代理互相配合干活,而不是单打独斗,所以决定把精力集中到新的 Ant...

推荐理由:Google 开发者博客扔出一个 Gemini CLI 的停用日期,并指向 Antigravity CLI 作为替代。标题本身就是一个硬截止日,对依赖这条命令行的开发者冲击不小,所以 HKR 三项都站得住。不过正文除了日期和迁移目标外,没解释怎么迁、兼容性如何、旧项目会不会断,信息量其实很薄。我会先打个折,把它放在 featured 的低位,因为截止日本身就有新闻性,但细节缺口太大,不值得给更高分。

AI HOT 精选

谷歌搜索 25 年来最大改版:用 Gemini 3.5 Flash 把搜索框变成聊天框

谷歌在 I/O 大会上宣布搜索业务改版,核心是把搜索入口从“敲关键词”改成“直接说完整需求”。底层用新发布的 Gemini 3.5 Flash 模型跑响应,官方说速度是 GPT-5.5 的四倍,但没给具体延迟数据。AI Mode 上线一年后月活过了 10 亿,查询量每季度翻倍,说明用户确实在用。交互上,搜索框会动态变大,支持文字、图片、视频、文件甚至当...

推荐理由:谷歌搜索这次改版不是换个皮肤,而是把 AI 直接塞进搜索框和结果页,交互逻辑都变了。10 亿月活和每季度翻倍的查询量说明用户已经在用脚投票,不是实验室里的 demo。对做搜索、做内容、做 SEO 的人来说,这波改动会直接冲击流量分配和产品设计,所以优先级给到 p1。

TechCrunch · AI

谷歌搜索不再是那个链接列表了

谷歌在 I/O 大会上把搜索框彻底重做了。以后你输入问题,它不再只给你一排蓝色链接,而是直接展开成对话式回答,甚至能派“信息代理人”去帮你跑腿查资料、生成一个临时小工具。文章没给出具体上线时间,也没提这次改动对网站流量的影响有多大,但可以确定的是,那个靠排序链接来呈现信息的搜索时代结束了。

推荐理由:我会先打个折:正文没给上线时间、流量影响数据,也没说清楚代理具体能干什么,更像一篇观点评论。但 Google 把搜索从链接列表改成对话回答加自主代理,这个方向如果落地,对依赖搜索流量的产品和内容生态是实打实的冲击。标题虽然夸张,但抓住了搜索产品逻辑在转向这个点,所以给了 88 分、p1 级别。

The Verge · AI

Gmail 要能语音对话了:对着收件箱直接问,它帮你翻邮件找答案

Google 给 Gmail 加了一个叫 Gmail Live 的语音功能,点搜索栏图标就能直接开口问收件箱里的内容。发布会上员工现场演示,问了孩子学校的活动和自己去底特律的行程,Gmail 直接从邮件里抓出了学校展示活动的日期地点和行程信息。正文没披露这个功能什么时候上线、支持哪些语言,也没说离线能不能用。

推荐理由:我会先打个折:正文只给了两个演示例子,没写什么时候上线、要不要付费、背后用的什么模型。所以判断停在 featured 低段。但这件事本身挺直观——Gmail 搜索栏加了个语音入口,你对着它问“底特律的酒店订单”或者“孩子学校活动日期”,它直接回话,不用翻邮件。对每天被邮件淹没的人来说,省事是真的。这点先别太激动,等正式推送再看实际识别率和隐私处理。

The Verge · AI

Google I/O 推出 AI 购物通用购物车,让 Gemini 帮你跨店下单

Google 在 I/O 大会上发布了一个“通用购物车”,用户在搜索或跟 Gemini 聊天时就能把不同零售商的商品加进去,最后通过 Google 统一结账。这个购物车还会追踪价格、提示补货、推荐折扣,并提醒你选的商品可能有什么问题。未来会接入 YouTube 和 Gmail,但正文没披露定价、具体上线时间和首批覆盖哪些零售商。

推荐理由:Google 在 I/O 上放了个挺大胆的购物功能:你在 Search 或 Gemini 里看到想买的东西,AI 直接帮你加进购物车,最后通过 Google 结账。正文说未来还会接入 YouTube 和 Gmail,等于把购物触点铺到更多地方。我会先打个折——目前只说了发布,没给上线时间、覆盖商家和退款纠纷怎么处理,这些才是决定它能不能用的关键。但方向很明确,Google 想把 AI 从“帮你搜”推到“帮你花”,信任门槛比普通搜索高得多。

The Verge · AI

Google AI Studio 现在能靠一句话生成安卓原生 App

Google 给 AI Studio 加了个新功能:你输入想法,它直接生成一个能在安卓手机上跑的 App。平台里内嵌了安卓模拟器,写完可以先预览;想真机体验的话,把手机连上电脑就能安装。Google 说后续还会开放测试邀请功能,但目前还没上线。这次首发主要面向个人小工具类应用,不是啥都能做。

推荐理由:Google AI Studio 现在能靠提示词直接吐出可安装的 Android 原生应用,还带模拟器预览和真机安装。初版只覆盖个人工具类应用,不是完整开发环境,所以算中等分量的产品更新,不是 P1。

TechCrunch · AI

Google 发布 Android CLI 1.0,让 Claude Code、OpenAI Codex 这类 AI 编程工具也能直接命令行开发安卓应用

Google 在 I/O 大会上把 Android CLI 推到了 1.0 稳定版。这东西是个命令行工具,主要作用是让各种 AI 编程助手(比如 Claude Code、OpenAI Codex,或者 Google 自家的 Antigravity)能直接通过命令行来构建安卓应用,不用非得打开 Android Studio 的图形界面。它内置了一个“an...

推荐理由:我会先打个折:正文没给版本号、发布时间,也没性能数据,所以只能当个信号看。但 Google 加 Android 加 agentic coding 这个组合,本身就够上 featured 线。它不是在秀技术指标,而是在开一扇门——让 agent 从命令行直接插手 Android 构建,这对移动端开发者的工作方式冲击不小。

TechCrunch · AI

Google AI Studio 现在能让任何人几分钟内生成原生安卓应用

Google 在 I/O 2026 上给自家的网页版 AI Studio 加了个新功能:直接用自然语言描述需求,几分钟就能生成一个原生的安卓应用。以前搭环境、写代码可能要几周,现在把门槛压到了“会打字就行”。不过正文没披露背后用的是哪款模型、生成的应用能复杂到什么程度、有没有代码审查机制,也没提收费方式。另外 Google 还提到会用 Gemini 帮...

推荐理由:Google AI Studio 这次更新把代码生成直接落到安卓原生应用上,速度卖点很明确。正文没披露模型、价格和发布范围,所以只能算中等体量的产品更新,先放在 featured 档。

TechCrunch · AI

Google 在 I/O 2026 发布 Antigravity 2.0,更新了桌面应用和命令行工具

Google 在 I/O 大会上推出了编程助手 Antigravity 的 2.0 版本,主要更新了桌面应用、命令行工具和一个用来搭自定义流程的 SDK。同时,他们新加了一个每月 100 美元的 AI Ultra 套餐,使用额度是 AI Pro 套餐的 5 倍。不过,这篇报道没具体说桌面应用和命令行工具到底更新了哪些功能,也没提 SDK 能接入哪些外部系统。

推荐理由:HKR 三项都踩中了,但正文没写桌面应用和 CLI 具体能干什么,功能细节是空的,所以分数压一压,不上 78。Google I/O 的发布节点加上 100 美元套餐和 5 倍额度,够上 featured。

TechCrunch · AI

Google 在 I/O 2026 发布 Gemini Spark,一个能全天候帮你干活的 AI 助手,还接入了 Gmail

Google 在 I/O 大会上掏出了 Gemini Spark,一个基于 Gemini 模型和 Antigravity 智能体框架(让模型进业务流程干活)搭起来的个人助手,主打 24 小时在线。它最大的卖点是直接连你的 Gmail,能读邮件、替你处理任务。不过文章没细说它能具体操作 Gmail 里的哪些事,也没提价格和什么时候能用上。这点先别太激动,...

推荐理由:Google 在 I/O 上扔了个新东西:Gemini Spark,一个号称全天候在线、能直接进你 Gmail 干活的助手。我会先打个折——正文没写定价、没写具体开放范围,也没提安全护栏做到什么程度,所以别急着把它当成已经落地的产品。但信息量是够的:它基于 Gemini 模型,跑在 Antigravity 智能体框架上,等于把模型塞进业务流程里当常驻工人,而不是一问一答的工具。标题里“24/7”和“Gmail 接入”这两个点,直接拉高了从业者对隐私和权限控制的疑问,也让它和 OpenAI 的助手路线形成对标。整体看,产品更新本身够硬,但缺落地细节,...

AI HOT 精选

Google I/O 2026:Gemini 开始自己动手干活了

Sundar Pichai 在 I/O 大会上宣布 Gemini 进入“自主代理”阶段,能自动处理邮件、安排日历和生成报告。但整篇博客没提模型参数、具体上线时间,也没说收费方式。我会先打个折——这更像一个产品方向预告,离真正稳定可用还有距离。

推荐理由:这条消息我会先打个折:Google 画了个自主代理的饼,能自动处理邮件、日历和报告,听着挺省人力,但正文没披露模型参数、上线时间或价格,所以别太激动。对从业者来说,办公 agent 的落地节奏和成本才是关键,现在只能当方向信号看。

AI HOT 精选

Google AI Ultra 套餐降价,新增 100 美元档位

Google 把顶配 AI Ultra 套餐从每月 250 美元降到 200 美元,同时加了一个每月 100 美元的新档位。新档位把 Gemini 应用的使用上限提到 Pro 套餐的 5 倍,主要面向编程和创作场景,还附带新功能抢先体验、20TB 存储和 YouTube Premium。正文没说明 5 倍限额具体对应多少调用次数,也没提新功能抢先体验的...

推荐理由:这是订阅价格和配额打包调整,不是模型或能力发布,但官方来源、价格数字都实在,对用 Google 生态干活的人有直接影响。降价幅度和新增档位让信息够硬,放在 featured 没问题。

r/LocalLLaMA

开源项目 Codegraph 声称能把 Claude、Cursor 等编程助手的工具调用次数砍掉 94%

Codegraph 的做法是提前给代码建好一张知识图谱,把符号关系、调用链和代码结构都索引好。在 VS Code 的测试里,工具调用从 52 次降到了 3 次,运行时间从 1 分 37 秒缩短到 17 秒。不过正文没披露具体测试的代码规模和任务复杂度,这个 94% 的降幅能不能在别的项目里复现还不好说。

推荐理由:HKR 三条都过了,但证据目前只有 Reddit 帖子和公开仓库的自测结果,没有独立复现或第三方验证。94% 的降幅和 52→3 的调用次数足够上 featured,但还不到 p1 的确定性。我会先打个折:数字好看,但别太激动,等有人复现再说。

r/LocalLLaMA

6GB 显卡跑本地会议纪要的下限测试:Qwen3.5 0.8B 用 57 秒出结果,Granite 4 350M 快但会瞎编

一位用户在 RTX 3060 笔记本(6GB 显存)上拿 VoiceFlow 1.6.0 测了两款小模型,看谁能在本地把一段 4 分钟的会议转成纪要。Qwen3.5 0.8B 在 16K 上下文窗口下花了 57 秒完成总结,结果可用。Granite 4 350M 速度很快,0.6 到 2.8 秒就出稿,但会凭空捏造内容,比如编出币安和《星际迷航》的情节...

推荐理由:一个 Reddit 用户拿笔记本 3060 6GB 跑 VoiceFlow 1.6.0 做会议总结,Qwen3.5 0.8B 用 57 秒处理 4 分钟录音,Granite 4 350M 虽然快到 0.6-2.8 秒但会凭空编造内容。我会先打个折,这是单人单卡的一次性测试,不是系统评测,但 6GB 这个门槛和幻觉案例对想本地跑会议总结的人有直接参考价值,所以给 73 分 featured。

r/LocalLLaMA

Cursor 和 Claude Code 没变笨,是它们的 agent 循环在盲目翻文件,把上下文窗口撑爆了

有 Reddit 用户扒了 API 日志,发现 Cursor 和 Claude Code 的 agent 干活时,会在上万行的代码库里反复用 grep 搜大约 40 个文件,有时为了改 5 行代码就把整个 2000 行的文件塞进上下文。更夸张的是,在真正开始写代码前,光工具定义和操作日志就先吃掉大约 3 万个 token。帖子认为工具本身没降智,是这种...

推荐理由:这篇 Reddit 帖子没走“模型降智”的老路,而是从 API 日志里挖出一个更扎心的解释:agent 在工作时自己把上下文窗口塞满了。我会先打个折——这只是单帖爆料,没附原始日志,也没第三方复现,所以不能当定论。但它的价值在于把模糊的“变慢变蠢”翻译成了可排查的结构性问题:仓库一大,递归检索就失控,工具描述和日志占掉大量 token,留给真正写代码的空间反而不多。对正在用这类工具的从业者来说,这比猜模型更新管用,因为它指向了可以动手优化的地方,比如裁剪工具定义、限制检索深度。正文没披露具体复现步骤,这点先别太激动,但作为一线信号已经够格上 fea...