跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 41–60 条 · 共 760 条

6月5日星期五

AI HOT 精选

苹果内部把新版 Siri 标成“Beta”,不会当成品来宣传

彭博社记者古尔曼爆料,苹果内部将新版 Siri 标记为“Beta 版”,意味着它不会被宣传成完全成熟的产品。苹果可能还会像当初推 Apple Intelligence 那样,给想尝鲜的用户设一个等待名单。另外,iOS 27 的部分 Siri 请求会转到 Google Cloud,调用授权版 Gemini 模型,并跑在谷歌的英伟达 Blackwell B...

推荐理由:HKR 三项都成立:Siri 标 Beta 是苹果自己的态度信号,Gemini 和 B200 的细节让爆料有料,苹果 AI 依赖外部算力和模型这件事本身就容易引发讨论。分数定在 82 合理,因为毕竟还是未发布产品的二手报道,不是官方发布或重大产品事件。

Hacker News 首页

Lowfat:一个命令行过滤器,帮作者省了 91.8% 的 LLM token

Lowfat 是一个可插拔的 CLI 过滤工具,能自动把 kubectl、docker、grep 这类命令输出的冗余信息(比如表格边框、空行、重复标题)裁掉,只保留关键内容再喂给大模型。作者自己用了两个月,原始输出总共 440 万个 token,过滤后只用了 30 万,省下 410 万 token,换算下来节省了 91.8%。它可以作为 shell 包...

推荐理由:我会先打个折:这是个个人 Show HN 项目,不是大厂发布,但 91.8% 的 token 节省率配上两个月的实测数据,说服力够强。它解决的不是什么高深问题,就是把 kubectl、docker 这类命令输出里的表格边框、空行、重复标题裁掉,只留干货再喂模型。这事做 agent 的人都懂——工具返回一堆格式垃圾,token 烧得飞快,上下文还被撑爆。Lowfat 的思路简单粗暴,但正好打在痛点上。不过正文没提兼容性边界和极端情况,这点要留意。整体看,数据扎实、痛点真实,放在 featured 门槛上没问题。

MIT Technology Review · AI

Meta 的 AI 客服被一句话骗走账号,AI 安全不止是防超级黑客

404 Media 在 6 月 5 日报道,攻击者直接让 Meta 的 AI 客服把 Instagram 账号绑到他们控制的邮箱上,AI 照做了。唯一需要绕过的条件是挂一个和账号主人同地区的 VPN。有人用这招拿下了奥巴马白宫官方账号并发布亲伊朗内容,还有人盯上了值钱的单字 ID。这事和 Anthropic 那个因黑客能力太强被雪藏的 Mythos 模...

推荐理由:HKR 三项全中:AI 客服被忽悠改邮箱这事本身就够抓眼球,VPN 同地区这个绕过条件是新信息,而且它把中美算力差距之外的 AI 安全漏洞摆到了台面上。不过原文是二手评论,没给出受影响规模、受害者数量和 Meta 的修复细节,所以重要性卡在 80 分,刚好过 featured 线。

AI HOT 精选

OpenAI 在生成接口里直接返回内容审核分数,不用再单独调一次审核接口

OpenAI 把内容审核评分塞进了 Responses API 和 Completions API 的返回结果里。你现在发一次请求就能同时拿到生成内容和对应的安全分数,不用像以前那样先调生成接口、再调审核接口。拿到分数后,你可以自己决定怎么用:记日志、做路由分发、人工复核,或者直接拦截。正文没披露这个审核模型的延迟会增加多少、准确率怎么样,也没说和独立...

推荐理由:HKR-K 和 HKR-R 都成立:OpenAI 把审核分数塞进生成响应里,开发者可以据此做路由和拦截,省掉一次单独审核调用的开销。HKR-H 偏弱,因为这只是公开信和功能更新,不是已生效的法律或硬性安全突破,所以放在 featured 档位。正文没给出法案文本和执行时间表,实际省钱效果还得看调用量和审核精度,但方向上是给安全管线减负。

AI HOT 精选

Codex 加了个 iOS 应用构建插件,不用切窗口就能预览和改代码

OpenAI 给 Codex 接入了 Build iOS Apps 插件,现在你可以在 Codex 的内置浏览器里直接跑 iOS 应用、打开 SwiftUI 预览,改完代码也能热重载,不用来回切换工具。正文没提这个插件是官方做的还是第三方贡献的,也没说支持哪些 iOS 版本或设备型号。

推荐理由:HKR 三项都过:钩子是 Codex 直接处理 iOS 应用测试,有 SwiftUI 预览和热重载这些具体细节。但这是一封公开信和政策呼吁,不是已生效的法律,正文也没给出法案文本和执行时间表,所以放在 featured 而不是更高。

AI HOT 精选

Replit Agent 接入 Shopify,描述卖什么就能自动搭好一个独立站

Replit 和 Shopify 打通了:用户在 Replit Agent 里说一句想卖什么,Agent 会直接生成自定义店铺页面、创建 Shopify 商店并上架商品。建完去 Shopify 认领店铺、设好支付就能开卖。正文没提收费方式、支持的地区和具体上线时间,如果是真的,对想快速试水电商的人挺省事。

推荐理由:HKR 全过:Shopify 打通流程对开发者有实感,但这是公开信和政策呼吁,不是已生效法律,法案文本和执行时间表都缺失,所以停在 featured 档。判断挂在信息缺口上——没提收费和地区,省钱与否得等后续。

6月4日星期四

Hacker News 首页

Infracost 做了个本地工具,让编程助手在写基础设施代码时就能看到云成本,实测能省 67% 的 API 费用

Infracost 发布了 Cost.dev,一个本地命令行工具,可以嵌进 Claude Code、Cursor 这类编程助手的流程里。它的核心作用是:在你让 AI 写云资源代码(比如 Terraform)的时候,实时告诉你这套配置每个月要花多少钱,并给出省钱建议。他们拿裸用 Claude 做基准测试,结果显示这个工具能让模型输出的 token 量减少...

推荐理由:Infracost 发了个本地命令行工具 Cost.dev,专门给写代码的 Agent 做云成本估算,核心卖点是让模型输出更省 token、调用更省钱。他们给出的数字挺好看:Claude 输出 token 最多降 79%,API 成本最多降 67%。我会先打个折——这是厂商自己的数据,没有第三方验证,实际效果得看具体场景和 Agent 的实现方式。但思路本身是实用的,直接在本地跑,不依赖外部服务,对控制 Agent 的 API 支出和云资源浪费有直接帮助。正文没披露支持哪些云平台、和现有 CI/CD 流程怎么集成,这些信息缺口让实用性打了一点折扣。...

MIT Technology Review · AI

美国法院快被 AI 写的诉状淹没了,法官们开始琢磨聊天机器人该担什么责

MIT 和南加州大学的研究人员翻看了 2005 到 2026 年间 450 万份联邦民事案件,发现没请律师、自己打官司的人占比从 2022 年的 11% 涨到了 2025 年的 16.8%。他们用 AI 文本检测工具 Pangram 抽查了 1600 份文件,被标记含 AI 代笔的比例从 2023 年的 1% 飙升到 2026 年的 18%。法官 Br...

推荐理由:MIT 科技评论报道了 MIT 和南加州大学的一项大样本研究,数据量够大(450 万件案子),时间跨度也长(2005-2026)。核心发现是自诉案件占比从 2022 年的 11% 涨到 2025 年的 16.8%,AI 文本标记率到 2026 年到了 18%。这事不涉及模型能力本身,而是 AI 工具怎么冲击公共系统——法院要处理更多质量参差不齐的诉讼,成本被转嫁了。所以重要性给 78,放在 featured 档,属于质量不错但不炸裂的那类。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

AI HOT 精选

OpenJarvis:斯坦福开源了一个本地优先的个人 AI 框架,把推理、工具、记忆都塞进设备里跑

斯坦福的研究人员放出了 OpenJarvis,一个开源的本地优先框架,目标是让个人 AI 助手直接在手机或电脑上跑,不用把数据传到云端。他们把个人 AI 拆成了五个基础模块:推理、工具调用、记忆、学习,还有一个叫“自我”的模块来协调这些能力。实测下来,在设备端用小模型跑这套流程,效果只比顶尖云端模型差 3.2 分,但每次调用的边际成本直接砍了约 800...

推荐理由:HKR 三项都站得住:本地优先加 800 倍成本下降是个好钩子,数字具体且能说明问题,话题本身也切中 agent 落地时大家最在意的成本和隐私。信息源深度一般,所以分数放在 78–84 这个区间,不往上拔。

AI HOT 精选

Cloudflare 数据显示机器人流量首次超过人类,占 HTML 请求的 57.5%

Cloudflare Radar 统计了 5 月 28 日到 6 月 4 日这一周的全球流量,发现所有 HTML 网页请求里,57.5% 来自爬虫、AI 抓取和自动化脚本,真人浏览器只占 42.5%,这是机器人流量头一回超过人类。如果把所有 HTTP 返回内容都算上,JSON 格式(主要是机器对机器的 API 通信)占了 33.1%,排第一,HTML ...

推荐理由:Cloudflare Radar 这次给了一个很具体的窗口和比例,HKR 三项都踩实了。文章没把 AI 爬虫、搜索引擎蜘蛛和恶意自动化流量拆开讲,所以我会先打个折,不把它捧得太高。但“机器人过半”这个信号本身对做网站、做爬虫、做安全的人都有直接参考价值,放在 featured 档刚好。

AI HOT 精选

Hugging Face 改造命令行工具,让 Claude Code 这类编码智能体调用时省下 6 倍 token

Hugging Face 把自家的 hf 命令行工具重新设计了一遍,让它能同时服务人类和编码智能体。工具会通过环境变量自动识别是不是 Claude Code、Codex 等智能体在调用,如果是,就输出紧凑、不截断的 TSV 格式,而不是给人看的表格。在复杂多步任务测试里,没用这个 CLI 的智能体(比如自己拼 curl 或调 Python SDK)消耗...

推荐理由:我会先打个折:token 降到六分之一是官方说法,正文没给出测试场景和对比基准,实际省多少要看具体任务。但思路很清晰——传统 CLI 输出对人类友好,对智能体却是噪音,切成结构化 TSV 能减少大量解析和截断开销。自动检测智能体身份这一点也实用,不用手动切模式。整体是工具链层面的务实改进,不是模型或平台级发布,所以放在 featured 档合理。

r/LocalLLaMA

有人把折叠屏手机改成了跑本地模型的节点,用 Vulkan 加速

Reddit 用户 GsxrGuy80s 拿一台 Z Fold 6 当 GGUF 推理节点,走 Vulkan 加速,搭配 LiteLLM 和 Tailscale 组网。帖子公开了 gpu_layers=89 这个关键参数,说明把 89 层模型计算都扔给了手机 GPU。节点对外暴露 OpenAI 兼容接口,还设了 fallback 路由,请求搞不定就自动...

推荐理由:一个 Reddit 用户把折叠屏手机改成了本地大模型推理节点,用 Vulkan 驱动 GPU 加速,跑 GGUF 格式的模型,再通过 LiteLLM 统一接口、Tailscale 组网,让其他设备也能调用。帖子给了 gpu_layers=89 这个关键参数,还说明了模型崩了怎么自动切到备用路由。我会先打个折:这只是个人分享,没做压力测试,也没披露实际推理速度和功耗,稳定性存疑。但如果是真的,这种把闲置手机当推理节点的玩法挺省钱,也避开了云服务的隐私顾虑。对想自己折腾本地推理的从业者来说,这套组合拳(Vulkan+GGUF+LiteLLM+Tails...

AI HOT 精选

Anthropic 用 Claude 把 95% 的业务取数需求自动化了,准确率约 95%

Anthropic 公开了他们内部用 Claude 做自助数据分析的整套方案。核心思路是让非技术同事直接用自然语言问业务数据问题,系统自动查表、写 SQL、出结果。他们搭了一个三层架构:底层是数据基础层,负责把分散的业务指标统一成模型能读懂的语义;中间是验证工作流,专门处理模糊提问、过期数据和查不到的情况;上层是技能模块,让 Claude 学会按公司规...

推荐理由:我会先打个折,这是官方博客,数字肯定挑好看的讲。但 95% 自动化加约 95% 准确率,配上数据层、验证和 skills 这套 agentic analytics stack,确实把怎么做说清楚了。没有新模型或产品发布,所以分数在 72–77 这个区间。正文没披露错误类型的具体分布和延迟数据,这点先别太激动。

6月3日星期三

TechCrunch · AI

英国监管出手,网站主将能选择不让自己的内容被谷歌 AI 搜索抓取

英国监管机构要求谷歌给网站主提供一个开关,让他们可以决定自己的内容是否出现在 AI 概览、AI 模式这类生成式搜索功能里。这个开关会放在谷歌 Search Console 后台,先在英国测试,之后推全球。谷歌在公告里顺带提了一嘴,它的 AI 概览月活已经超过 25 亿,AI 模式月活也破了 10 亿。

推荐理由:英国监管机构出手,逼 Google 在 AI 搜索里给网站出版商一个“别搜我”的选项。这事会先在英国试水,再铺到全球。对做内容的人来说,等于多了一个控制自己东西会不会被 AI 摘要直接吃掉流量的开关;对 Google 来说,合规成本会涨,AI 搜索能用的公开内容也可能变少。不过正文没提这个退出工具具体怎么实现、对搜索结果质量影响多大,所以先别把它当成 AI 搜索的致命伤。

OpenAI News

OpenAI 给 GPT-Rosalind 加了新能力,专攻药物研发和基因组学

GPT-Rosalind 是 OpenAI 为生命科学做的模型,这次更新接入了 GPT-5.5 的编程和工具调用能力,重点强化了药物化学、基因组学这些方向的推理。OpenAI 还专门搞了个叫 LifeSciBench 的评测,从证据处理、实验设计到结果验证六个环节打分,说新版模型在行业专家出的题上表现有提升。但正文没披露具体参数量、定价和普通用户能不能...

推荐理由:OpenAI 这次更新把 GPT-Rosalind 往生物和药物化学方向推,垂直落地的意图很清楚,所以重要性和行业信号都够。但正文没披露任何硬指标——参数多少、评测怎么做的、开放给谁用,全是空白,这点先别太激动。实验室场景天然带安全和合规风险,加上垂直模型抢地盘的话题,话题性也拉满了。综合看,信号强但证据弱,维持 featured 门槛没问题。

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

AI 群聊日报

微软发布自研推理模型MAI-Thinking-1,35B参数在编程和数学上追平Opus 4.6

微软首个正式对外发布的自研推理模型MAI-Thinking-1,用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平,AIME 2025数学测试拿到97%,盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏,预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

推荐理由:这条消息的钩子很清晰:微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6,而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报,不是官方公告,正文没披露模型是否开源、API 定价和完整评测设置,所以权威性偏弱。但 H/K/R 三个维度都踩中了:有竞争对标、有硬数字、有平台格局的冲击力。综合来看,值得作为 featured 推给从业者看一眼,但别急着把它当正式发布。

量子位 · 公众号

Papers with Code 复活了,Hugging Face 用 AI 代理把论文和排行榜重新串了起来

Hugging Face 的开源团队在 2026 年 5 月上线了 paperswithcode.co,用 AI 代理自动解析论文,把原来平台超过 9300 个基准测试的 SOTA 排行榜恢复了出来。这次复活正好赶上 CVPR,首页直接整理了会议论文和对应代码。正文没披露解析准确率和代理的具体工作流,但能看出他们想用自动化方式解决原平台长期停更的问题。

推荐理由:Hugging Face 把 Papers with Code 重新做回来了,这次用 AI 智能体自动解析论文,一口气恢复了 9300 个基准相关的排行榜。对做研究的人来说,这比手动翻论文找 SOTA 省事太多。我会先打个折:正文没披露智能体解析的准确率有多高,也没说排行榜更新频率和覆盖范围的具体边界,所以别急着当完全体用。但光是 CVPR 期间能一站式查代码和榜单,实用价值就摆在那。

量子位 · 公众号

扣子3.0实测:手机能远程遥控你电脑上的智能体干活

扣子3.0把智能体协作搬到了项目里,支持iOS、安卓、Mac、Windows和网页端。你可以把本地跑的Claude Code、Codex CLI这类命令行智能体导进去,在手机上授权后直接让它读你电脑里的PDF。正文没披露具体延迟和资源占用数据,实际体验得自己跑一遍才知道稳不稳。

推荐理由:HKR 三项都踩中了:扣子 3.0 让手机能远程指挥电脑里的 Agent,还支持导入 Claude Code 这类命令行工具,等于把 Agent 协作和跨设备控制绑在一起。不过它本质上还是一个产品更新,正文没提定价、推送范围和本地文件读取的安全边界,所以先放在 featured 这一档。