跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 81–100 条 · 共 760 条

6月3日星期三

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

r/LocalLLaMA

Reddit 网友在 6GB 显存的笔记本 4050 上跑了 20 个小模型的速度对比

这篇帖子本身被 Reddit 的安全策略拦住了,正文内容没抓到,只留下一个“被网络安全屏蔽”的提示。从标题和已有的英文摘要看,作者用 LM Studio 的接口测了 20 个小模型,统一在 6GB 显存的 RTX 4050 上跑,每个模型在 1k、8k、32k 三种上下文长度下各测了 5 次速度。目前能看到的唯一具体数据是 unsloth/lfm2.5...

推荐理由:我会先打个折,来源是 Reddit 帖子,权威性一般,但内容本身很实在。作者没搞虚的,就是拿 20 个模型在 LM Studio 里用 6GB 4050 实测,把速度、显存占用都列出来。对想本地跑小模型的人来说,这比看论文里的 A100 数据有用得多。正文没披露测试用的量化精度和具体 prompt,这点信息缺口让结论不能直接照搬,但作为一张低显存显卡的参考表,已经够用了。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

The Verge · AI

我试了 Google 的 AI 管家 Gemini Spark,它规划行程的方式让我又惊又怕

过去四年所有 AI 产品演示都说能帮你规划旅行,但实际用起来只会推荐每个城市最俗套的六件事。我用 Spark 的体验完全不同——它是 Google 一个野心很大的常驻 AI 管家。不过这篇报道只放了开头,正文没披露 Spark 什么时候上线、怎么收费、有没有跑分,也没说测试条件能不能复现,所以它到底多能打,我会先打个折。

推荐理由:我会先打个折:这篇是 The Verge 的上手体验,不是产品发布稿,所以别当官方公告看。标题的情绪冲击力够强,能勾住人,但正文只披露了旅行规划这一个场景的差异,发布时间、定价、可复现的测试条件一概没提,信息密度其实不高。不过它踩中了两个从业者会关心的点:一是 agent 常驻系统带来的自主性和安全边界问题,二是 Google 在这个方向上给竞品施加的压力。综合来看,有话题性但缺硬信息,放在 featured 级别是合适的。

机器之心 · 公众号

DataMaster:让模型自己搜数据、洗数据、拼数据,MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%

这篇论文提出了 DataMaster,一个让大模型自己当数据工程师的流程。它不碰模型结构和训练算法,只做三件事:自动搜索外部数据、清洗脏数据、把多个数据集拼成一张表。在 MLE-Bench Lite 这个机器学习竞赛基准上,DataMaster 把奖牌率从 35.91% 提到了 68.18%,几乎翻倍。正文没披露具体用了哪些模型、单次任务耗时和额外算力...

推荐理由:DataMaster 做的事很直接:模型和训练代码都不动,只让系统自己去搜、洗、拼数据,结果 MLE-Bench Lite 奖牌率从 35.91% 拉到 68.18%,接近翻倍。我会先打个折——这还只是单篇研究,没有生产环境验证,benchmark 本身也不是完整 MLE-Bench,所以别急着当银弹。但“数据工程自动化”这个方向确实戳中很多团队的日常痛点,加上数字够具体,给 78 分 featured 合理。

AI HOT 精选

为了省120刀,我把电脑清理做成了开源AI工具

作者用Codex扫了自己的MacBook,发现B站缓存等一堆可删文件,激进方案能清出超140G。他干脆把清理逻辑做成一个开源skill,Mac和Windows都能用。工具会扫描文件生成可交互的HTML报告,用绿黄红三色标出哪些能放心删、哪些要人工判断、哪些千万别动,还带安全执行按钮。实测清出近120G,而CleanMyMac只扫出15.8G,信息透明度...

推荐理由:这篇东西不是平台级大新闻,但 H、K、R 三点都踩中了:120 美元的替代钩子够抓人,扫描报告和 120G 实测结果给了具体信息,开源 skill 的思路对想用 AI 省钱的开发者有直接复用价值。放在 featured 门槛附近没问题,属于那种实用开源工具类的推荐。

新智元 · 公众号

中科院开源 MobileGym:在浏览器里搭了个手机训练场,微信、原神都能跑

中科院自动化所开源了一个叫 MobileGym 的移动端智能体训练环境,直接在浏览器里模拟安卓手机。它覆盖了 28 款常用 App,包括微信、原神、淘宝这些,每个实例只占 400MB 左右,冷启动 3 秒就能跑起来。环境会把手机界面状态转成结构化的 JSON 快照,方便模型理解当前屏幕有什么、能点哪里,任务验证也是程序化自动完成的,不用人工盯着看。这套...

推荐理由:MobileGym 是一套开源的移动 agent 训练与评测基础设施,不是模型发布,但实用性强。我会先打个折:正文没披露判分准确率、任务完成率等验证数据,这点先别太激动。不过它用浏览器仿真 28 个 App,单实例约 400MB、3 秒冷启动,还支持 JSON 状态复制,意味着复现成本低、部署快,适合批量跑实验。对 agent 开发者来说,这比租真机或搭模拟器集群省钱省事。整体在 78–84 这个质量区间里算扎实的工程贡献,所以维持 featured 和现有评分。

AI HOT 精选

Anthropic 开发者公开了一套 Claude Code 工作流,核心是让 AI 当老师逼你真正搞懂代码,而不是只点“同意”

这套流程把 Claude Code 定位成“高效又聪明的老师”,目标不是替你写完代码,而是确保你能把问题、方案和影响讲清楚、辩得动。它沿着问题域、方案域和语境域三条线,拆成 8 个可执行步骤,用增量教学、用户复述、清单加测验的方式,在进入下一步前先确认你真的懂了。这么设计是为了对抗长会话里人慢慢变成“审批按钮”的问题,强制把决策上下文沉淀下来,让理解过...

推荐理由:我会先打个折:这不是产品发布,是一篇实操分享,所以放在 featured 低位。HKR 三项都踩实了——钩子把“人变按钮”这个痛点讲得很透,知识部分有 8 步工作流和验证循环,相关性直击开发者对 agent 失控的担忧。正文没披露这套流程在复杂项目里的失败率,这点先别太激动,但作为可落地的教程,信息密度够。

Computing Life · Share · 鸭哥调研

AI Agent 不用攻破,说服它就行

这篇文章讨论了一个被主流安全研究忽略的攻击面:手握密码重置等敏感权限的 AI agent,其身份验证逻辑从密码学硬边界退化成了对话层的软判断。攻击者不需要写 payload 或越狱模型,只要在聊天里说服 agent 自己是账号主人,就可能让它把重置链接发到指定邮箱。文章引用了 Hacker News 上一个声称用此法劫持上百个 Instagram 账号...

推荐理由:我会先打个折:正文没给出任何实际攻击案例、成功率数据,也没跟现有产品方案做对比,所以只能算一篇有启发的观点文章,不是验证过的解法。但它的好处是把 agent 安全从“防入侵”拽到了“防忽悠”上,这个视角本身就有提醒价值。what/who 分离的三层架构虽然细节不多,至少给了一个可讨论的起点,不是空喊口号。对正在给 agent 配权限的团队来说,这篇值得扫一眼,但别指望拿来就直接落地。

r/LocalLLaMA

我花了几个月钻进 verl 的 RL 训练框架,最后还是放弃了:内部机制、维护分支的代价,还有一个 NCCL 的坑

作者深入研究了字节跳动的 verl(一个做 RLHF 强化学习微调的开源框架),把它的核心流程拆了一遍:DataProto 数据协议怎么走,模型怎么生成回答(rollout),怎么打分(reward),怎么算优势函数(advantage),最后怎么更新模型。作者本来维护了一个自己的分支,但因为上游几乎每天都有改动,同步的成本比自己做改动还高,最后只能停...

推荐理由:这是一篇来自一线的 RL 后训练框架使用报告,不是官方发布。作者没在推销什么,而是老实交代了 fork 又放弃的原因和踩坑记录。我会先打个折:信息密度不错,但只覆盖单机场景,正文没披露多机下的 NCCL 表现。对正在选型或折腾 verl 的人有参考价值,对其他人可能就只是看个热闹。

AI HOT 精选

Google AI Studio 现在能直接搭 Gmail、Drive 应用,不用跳出去

Google AI Studio 上线了应用构建功能,可以直接在里面连接 Gmail、Drive 和 Sheets 等 Google 自家服务,不用再切到别的网站。目前支持在 AI Studio 内部添加测试人员,但正文没披露完整的公开分享功能具体什么时候上线,只说“即将推出”。

推荐理由:这是个中等体量的产品更新:Workspace 连接和测试人员支持已确认,但分享机制、权限细节和定价都没披露。我会先打个折,因为目前更像内部测试能力,离正式开放还有信息缺口。

AI HOT 精选

Meta 自家的 AI 客服被利用来劫持 Instagram 账号

攻击者直接跟 Meta 的 AI 客服聊天,让它把目标账号的绑定邮箱换成自己的,就能把号拿走。问题出在这个 AI 被赋予了直接操作账号的权限,而且它没法区分对面是号主还是骗子。报道没披露到底有多少账号受影响、漏洞现在修没修,也没给出能复现的具体步骤。

推荐理由:我会先打个折:正文没披露影响范围、修复时间和可复现步骤,所以不能往满分冲。但核心事实清楚——一个 AI 客服智能体因为能直接执行账户管理操作,被利用来接管 Instagram 账号。对做 agent 安全的人来说,这是个实打实的警钟,说明工具权限没卡死会直接变成攻击面。综合下来给 82 分,放在 featured 里提醒同行。

AI HOT 精选

Perplexity 把搜索流程写成代码,让 AI 代理直接调接口,不再绕函数循环

Perplexity 公开了一套叫 Search as Code 的搜索架构。它的做法是让 AI 代理直接写 Python 代码去调用自家的搜索栈,而不是像以前那样一步步循环调用函数。这套东西已经上线 Perplexity Agent API,并且成了 Computer 功能的默认选项。正文没披露具体性能对比数据,但思路很直接:省掉中间环节,让搜索更快...

推荐理由:我会先打个折:这篇只有 Perplexity 自己的公告,没给性能对比、定价细节和实际铺开范围,所以只能算一个低配版的产品更新。但亮点很实在——Perplexity 把搜索从“调 API 拿结果”变成了“让模型写代码操作搜索栈”,并且已经接进 Agent API,这对正在搭 agent 的团队来说是个省事的信号。正文没披露延迟和成本数据,这点先别太激动。

6月1日星期一

The Verge · AI

AI 正在搅乱音乐圈,格莱美打算怎么接招?

流媒体平台 Deezer 的数据显示,每天有超过 5 万首 AI 生成的歌曲被上传,这个数字还在涨。格莱美主办方录音学院的 CEO Harvey Mason Jr. 说,他最近参与的每一场录音 session 里都有 AI 工具的身影,AI 在音乐制作里已经“无处不在”了。不过,格莱美目前的规则仍然禁止纯 AI 音乐角逐最高奖项。Harvey 还聊了格...

推荐理由:这篇更像播客式的政策讨论,不是模型发布、产品更新或有约束力的法规。最实在的信息就两个:Deezer 每天 5 万首 AI 歌的数字,以及格莱美最高奖的资格冲突。我会先打个折,因为正文没给出具体的规则修改时间表或技术方案,更多是抛出一个行业正在吵的问题。

AI HOT 精选

美团要把自己的 AI 助手“小美”接进腾讯元宝,让用户在聊天界面就能直接点外卖、叫跑腿

王兴在美团一季度财报电话会上说,美团的 AI 智能体“小美”很快会和腾讯元宝打通。以后你在元宝里说一句本地生活相关的需求,系统会直接跳转到美团的点餐、配送等服务,不用再切 App。王兴还提了一个新说法叫“To A”(服务 AI 智能体),认为这会是美团未来的重要方向。美团一季度营收 910.39 亿元,但亏了 68.27 亿元,由盈转亏。正文没披露“小...

推荐理由:我会先打个折:合作还是“即将”状态,具体上线时间、用户从元宝哪个入口唤起小美、订单收入怎么分账,正文都没披露。所以它是个中等体量的产品合作,放在featured层级刚好,别当重磅发布看。

AI HOT 精选

用 Claude Opus 4.8 把一本书做成 AI 技能,45 分钟、不到 20 块钱

作者拿《非暴力沟通》试了一遍,用 Claude Opus 4.8 把整本书拆成可调用的 AI 技能。流程分六步:先喂全书文本,让模型分析结构,再提炼框架、原则、技法、反模式和作者语气这五类内容,接着生成技能,最后做一轮自检。技能保留了书里的原始命名,比如 OFNR 四要素和“长颈鹿语言”,但触发词换成了“怎么提意见不像在指责”这种日常说法。全程花了约 ...

推荐理由:这是一篇带编号步骤的第一人称Claude实操教程,成本和token数据都摆出来了。因为属于个人教程而非Anthropic官方发布或模型更新,所以放在featured低位。

AI HOT 精选

Apache RocketMQ 出了个 AI 专用版,专门解决多智能体协作时状态丢失和流量打崩的问题

阿里云给 RocketMQ 加了一套 AI 场景的适配,叫 RocketMQ for AI。它主要干三件事:用 Lite-Topics 减少资源开销,靠有序消息防止多智能体协作时上下文乱掉,再通过流量整形避免突发请求把系统打挂。官方说已经在阿里云大规模跑过,代码也开源了,但正文没披露具体版本号和性能对比数据,实际省多少资源还得自己测。

推荐理由:这条更新把 RocketMQ 往 AI 场景推了一步,提的几个机制——轻量级主题、有序消息、流量整形——听着像是给多 agent 协作和长任务链路做减法,减少排队打架和资源争抢。我会先打个折,因为正文没给版本号、性能对比和实际落地案例,没法判断是已经能用的东西还是路线图上的规划。但方向本身不虚,agent 之间通信乱、调度不公正是真痛点,所以分数给到 74,放在 featured 里提醒一下做 agent 架构的人可以关注。