跳到正文

MCP 与工具调用

模型连接外部世界的协议与实践:MCP 生态、function calling、工具链集成的动态。

760 条精选相关主题Agent 智能体AI 编码开源生态

最新精选

第 381–400 条 · 共 760 条

5月8日星期五

r/LocalLLaMA

警惕:Hugging Face 上的 Open-OSS/privacy-filter 仓库实为窃密木马

Reddit 用户发帖警告,Hugging Face 上名为 Open-OSS/privacy-filter 的仓库是信息窃取器。它伪装成 OpenAI 的隐私过滤器,通过 loader.py 拉取 PowerShell 脚本,再下载一个 EXE 文件并利用 Windows 任务计划程序运行。发帖者已向微软和 Hugging Face 举报,帖子提到 ...

推荐理由:HKR 三项都成立:伪装成 OpenAI 隐私过滤器的恶意模型有明确的 Windows 执行链,对本地部署用户来说是个实在的供应链风险。信息源目前只有 Reddit 用户报告,缺少官方确认,所以重要性停在 73 分 featured 档位是合理的。

5月7日星期四

AI HOT 精选

Apify 的 mcpc 工具给 AI Agent 装了个能自动付钱的 USDC 钱包

Apify 发布了一个叫 mcpc 的通用 MCP 客户端,把 x402 支付协议塞了进去,让 AI Agent 在调用付费 API 时能自己签名付款。x402 把整套结算流程压成一次 HTTP 往返加一个签名,碰到 HTTP 402 状态码就自动完成支付,不用人插手注册绑卡。mcpc 支持 Claude Code 这类 MCP 兼容的 Agent,钱...

推荐理由:我会先打个折:这还是个集成层面的更新,正文没披露实际用量、定价或生产环境案例,所以别急着把它当成成熟方案。但它的价值在于把“机器替人付款”这件事从概念拉到了协议层——用 HTTP 402 触发、一次签名完成结算,链路很轻。对跑 Agent 工作流的人来说,付费 API 的自动结算一直是个脏活,x402 这条路径至少给出了一个可验证的起点。

量子位 · 公众号

Vidu Claw 上线:一句话加一百块预算,直接生成一条广告片

生数科技把 Vidu Claw 放出来了,主打“一句话出广告片”。你给一句提示词,它能自动走完写脚本、配旁白、加音乐、剪辑合成全流程,最后吐出一条成品视频。官方拿龙虾当例子,说百元预算就能搓出“百万级”广告片,但正文没披露这个成本具体怎么算出来的,也没给实际成片链接,我会先打个折看。配套的 Video Plan 套餐每天最多能生成 40 分钟内容,覆盖...

推荐理由:我会先打个折:正文没披露生成一支片子的实际耗时和最终成本,也没给画质、可控性的横向对比,所以“百万级”更多是噱头,别太当真。但 Vidu Claw 把脚本、配音、配乐、剪辑打包成一句话工作流,还给了每天 40 分钟的生成额度,对做短视频和广告测试的人来说,试错成本确实低。龙虾广告这个例子够具体,能让人直观感受到“输入一句话、输出成片”的完整链路,比单纯讲参数更有说服力。不过没有定价细节和商用授权说明,这点先别太激动。

Ben's Bites

Elon 把用量翻倍了

这期主要讲了几件事。ChatGPT 免费版换上了新模型 GPT-5.5 Instant,看 PDF、搜网页、调用记忆都比上一代强,在容易出错的场景下幻觉减少了 52.5%,回复也更短、更少用表情。同时 ChatGPT 现在能直接嵌进 Excel 和 Google Sheets 里写公式、分析表格。Claude 这边,所有付费套餐的调用额度翻倍,原因是 ...

推荐理由:HKR 三项都过了:SpaceX Colossus 1 的算力合作、Claude 用量翻倍、配额压力,全是实打实的信息点。正文没给出具体限额数字和定价变化,也没说清楚是哪些付费档位受益,所以重要性停在低 featured 档。标题写 Elon 但正文没展开,这点先别太激动。

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

AI HOT 精选

OpenRouter 推出统一网络搜索与抓取工具,换模型不用重写工具代码

OpenRouter 发布了两个服务端工具:`openrouter:web_search` 和 `openrouter:web_fetch`。模型在对话中需要查资料时,可以直接调用它们,由 OpenRouter 在后台执行搜索或抓取网页,再把结果喂回模型。最大的好处是换模型不用改工具定义——不管底层跑的是 GPT-5.5、Claude 还是 Kimi,...

推荐理由:我会先打个折:正文没披露具体接了哪些搜索引擎和抓取引擎,也没提价格和调用限额,所以实际能用成什么样还得等上线看。但这件事的看点不在引擎本身,而在跨模型工具接口的一致性——让 GPT、Claude 等模型用同一套搜索和抓取指令干活,对搭 agent 工作流的人来说省了不少适配成本。这点先别太激动,但如果后续把引擎选择和限额透明化,实用性会更高。

r/LocalLLaMA

在单张 RTX 3090 Ti 上跑 Qwen3.5/3.6 的 NextN MTP 投机解码指南

Reddit 用户分享了一个 llama.cpp 实操指南,用单张 RTX 3090 Ti 跑 Qwen3.5 和 3.6 的 NextN MTP(多 token 预测,一种让模型一次猜好几个词来加速生成的技术)。目前需要打两个还没合并的 PR:#22400 和 #22673。实测 Qwen3.6-35B-A3B-MTP 模型在 350W 功耗、170...

推荐理由:我会先打个折:这是 Reddit 个人指南,依赖两个没合进主线的 PR,稳定性没保证。但亮点很实在——单卡 3090 Ti 跑 35B 模型冲到 157 tok/s,还点出了 nextn=q8_0 量化覆盖这个坑,漏掉会输出乱码。对想在家用显卡上榨性能的 AI 从业者来说,这份功耗、频率、KV 缓存设置都给了,可操作性强。正文没披露模型精度损失和长文本下的速度衰减,这点先别太激动。

AI HOT 精选

全国首例 AI 短剧侵权刑事案宣判:盗录 1700 多部打包卖 66.66 元,被判缓刑

广州黄埔区法院判了一个案子,有人把某平台用户用 AI 工具生成的短剧盗录下来,打包 1700 多部在二手平台卖 66.66 元,没拿到任何授权。法院认定这些 AI 短剧不是简单点一下“一键生成”,而是创作者输入了原创剧本、人物设定和镜头要求,体现了个人构思,属于受著作权法保护的作品。最终被告人被判侵犯著作权罪,有期徒刑八个月、缓刑一年两个月,罚金六千元...

推荐理由:这是国内头一桩 AI 短剧侵权的刑事判决,信号很强。我会先打个折:案子本身规模不大,比不上模型发布或平台级动作,但它的法律指向性很明确。法院认了 AI 生成内容的独创性,版权边界更清晰了,对靠生成内容吃饭的公司来说,合规压力直接上来了。数字也实在,1700 部、66.66 元、八个月,把盗录成本和刑事后果都量化了,从业者一看就懂。

AI HOT 精选

Amp 发布 Neo CLI,编程助手开始往“长链路、少盯屏”方向走

Amp 推出了新的命令行工具 Neo,核心变化是让编程助手从“人在旁边盯着”变成“扔给它自己跑”。Neo 支持远程控制本地线程、自动压缩上下文(不用再手动清理对话历史),并开放了 Plugin API 来扩展工具和交互方式。安全策略做了个大反转:默认允许所有操作,把安全把关交给插件系统。官方说 CPU 和内存占用也降了不少,但正文没给出具体版本号、价格...

推荐理由:Neo 把本地线程交给远程控制,默认允许所有操作,安全控制转嫁到插件系统,这个权限反转比功能更新本身更值得盯。远程编排和自动上下文压缩让 agent 能跑长链路任务,Plugin API 给了扩展空间,但正文没披露版本号、价格和性能降幅,实际省不省钱、稳不稳定还得等实测。Amp 的行业存在感加上信息缺口,把这条卡在 72–77 分区间,我会先打个折,别当成熟产品看。

AI HOT 精选

Open Slide 用 React 写 PPT,让 AI 直接生成和修改幻灯片代码

Open Slide 是一个开源项目,把 PPT 当成 React 组件来写,工作流专门为 AI agent 设计。它用 React 组件库做扩展,方便接入各种图表。项目自带可视化编辑器,你可以手动改,AI 也能直接读你的批注来协同修改内容。它还集成了 SVGL 库,里面有 1500 多个品牌 Logo,做技术演示时直接拖就行。整体思路是让 AI 进到...

推荐理由:我会先打个折:正文没给出实际使用数据或上手测试,所以效果到底怎么样还不好说。但“PPT 变成可编程界面”这个思路本身值得关注,它把幻灯片从拖拽排版变成了代码生成,AI 能直接参与修改和迭代。1500+ Logo 库和评论驱动改稿这两个点让产品有了具体抓手,不只是又一个套壳工具。对经常做演示文档的人来说,省掉排版和反复调整的时间是实打实的价值。

The Verge · AI

谷歌关停网页任务实验 Project Mariner,技术已并入 Gemini Agent

谷歌在 2026 年 5 月 4 日关掉了 Project Mariner,一个能让 AI 在浏览器里自动完成多步骤网页任务的实验项目。它之前最多支持同时跑 10 个任务。关停不是因为技术失败,而是这套能力已经挪到了谷歌正式产品里,比如 Gemini Agent 和 AI Mode。正文没披露具体迁移时间点和用户数据,所以实际落地效果还得看后续产品表现。

推荐理由:HKR 三项都过,但正文能拿到的硬信息就三块:关停时间、最多 10 个并发任务、技术并入了 Gemini Agent。Google 官方信源够硬,所以给 featured 低档,不是重大发布。

r/LocalLLaMA

Atlas 推理引擎开源,在 DGX Spark 上跑 Qwen3.6-35B-FP8 能稳定跑到每秒 100 多个 token

Avarok 把 Atlas 推理引擎开源了。它用 Rust 和 CUDA 写成,镜像只有约 2.5GB,冷启动不到两分钟。在一台 DGX Spark 上跑 Qwen3.5-35B,实测持续速度约 111 tok/s,作者说比 vLLM 快 3.0 到 3.3 倍。引擎专门为 Blackwell SM120/121 写了内核,支持 NVFP4、FP8 ...

推荐理由:我会先打个折:目前只有 Reddit 单帖来源,基准测试也没被第三方复现,所以分数压在了 featured 低位。但这条确实有料——开源推理引擎 Atlas 在 DGX Spark 上跑 Qwen3.5-35B 持续 111 tok/s,镜像才 2.5GB,冷启动不到两分钟,作者说测试时是 vLLM 的 3.0–3.3 倍。真正值得盯的是 Blackwell SM120/121 手写内核、NVFP4/FP8 和 MTP 解码这些底层优化,不是简单套壳。速度、体积、启动时间三个数字都给了,信息密度够,对想本地部署大模型的人有直接参考价值。

r/LocalLLaMA

Reddit 网友扒了 922 条 agent 任务记录,发现 DeepSeek v4 省钱的关键不在标价,在缓存命中率

一位 Reddit 用户分析了 922 条 agent 任务的实际调用记录,对比了 DeepSeek v4 Flash 和 Opus 4.7 的花费。两个模型每个任务都要吃掉大约 96 万 token,但 DeepSeek 单任务成本只要 0.01 美元,Opus 4.7 却要 1.52 美元。差距不在输入输出的标价,而在缓存:DeepSeek 的缓存...

推荐理由:这篇不是比谁模型强,是比谁缓存用得聪明。Reddit用户跑了922条智能体任务轨迹,发现DeepSeek v4 Flash单任务成本0.01美元,Opus 4.7要1.52美元,差了152倍。两边平均token消耗都接近96万,但DeepSeek缓存命中率97%,Opus只有87%;更关键的是缓存读写价格比,DeepSeek是0.02,对方是0.08。也就是说,标价看着便宜不算真便宜,能把重复计算省下来才是省钱的地方。正文没披露任务类型和采样方式,这点先别太激动,但缓存机制这个观察本身值得盯。

5月6日星期三

r/LocalLLaMA

CopilotKit:一套 MIT 开源的 React 组件,帮你给 AI 应用搭聊天界面和生成式 UI

CopilotKit 是一套 MIT 协议开源的 React 组件库,专门用来给 agent 类应用搭前端。它把聊天、流式输出、工具调用、人机协同(HITL)和生成式 UI 这些常见需求都做成了现成的积木块。项目在 GitHub 上有 3 万颗星。它支持 AG-UI 协议,可以对接 LangGraph、CrewAI、LlamaIndex 等后端框架,核...

推荐理由:HKR 三项都踩中了:MIT 开源、3 万星、AG-UI 把 UI 和后端解耦,对做 Agent 产品的人是个实在的钩子。分数压在 74 没往上拉,因为正文没给新版本号、没跑分、也没点名哪个生产环境在用,信息量就到这儿。

r/LocalLLaMA

单张 RTX 5090 跑通 Qwen3.6 27B:NVFP4 量化加 MTP 投机解码,200k 上下文实测 73.6 tok/s

一位 Reddit 用户在单张 32GB 显存的 RTX 5090 上,用 vLLM 跑通了 Qwen3.6 27B 的 NVFP4 量化版,并验证了 200k 上下文长度。配置上用了 fp8_e4m3 的 KV 缓存、FlashInfer 和 3 个投机 token 的 MTP。10 次 200k 上下文跑分平均生成速度 73.6 tok/s,首 t...

推荐理由:我会先打个折:来源是 Reddit 用户自测,不是官方报告,但配置和日志都贴出来了,可复现性不低。真正值得盯的是显存边界——KV 缓存占了 8.3GiB,整卡吃到约 30478MiB,几乎榨干 32GB。这说明 NVFP4 量化确实把 27B 模型压进了消费级显卡,而且 200k 上下文不是摆设,十次都跑稳了。不过 TTFT 70 秒意味着首 token 要等一分多钟,实际用起来体验会打折扣。这点先别太激动,等更多卡型验证。

The Verge · AI

Google 的 AI 搜索摘要开始引用 Reddit 帖子了

Google 更新了 AI 搜索功能,会在摘要里直接展示来自 Reddit、社交媒体和论坛的“第一手观点”预览,把搜索词和相关的网络讨论串起来。官方说这是为了满足越来越多人在搜索时想看到真人建议的需求。不过公告没提这个功能具体什么时候、在哪些地区上线。对搜索团队来说,核心问题是 AI 摘要如何引用和排序这些用户生成内容来源。

推荐理由:我会先打个折,因为正文没写覆盖范围和上线时间,所以重要性停在 76 的产品更新档位是合理的。钩子够强——Google 把 Reddit 这种论坛内容塞进 AI 摘要,搜索的流量分配逻辑可能又要变。新事实是 perspectives 预览机制,但具体怎么触发、哪些讨论会被选中都没说。风险点很实在:UGC 来源的引用和排序机制一旦偏了,小站和原创作者会更难拿到流量。这点先别太激动,等看到实际覆盖数据再调整判断。

NVIDIA 博客

NVIDIA 给 Spectrum-X 以太网加了多路径 RDMA,让超大规模 GPU 集群的流量不再堵在一条路上

NVIDIA 在 Spectrum-X 以太网平台上新增了 MRC(多路径 RDMA)支持,允许一个 RDMA 连接把流量分散到多条网络路径上,而不是死绑一条。这项技术已经在 Blackwell 集群里跑起来了,硬件层面能做到微秒级故障绕行和重路由。MRC 走的是 OCP 开放规范,支持多平面组网,目标是把集群规模推到几十万张 GPU。不过博客没给出具...

推荐理由:我会先打个折:这是英伟达自己的产品稿,不是第三方评测。MRC 把一条 RDMA 流拆到多条物理路径上跑,微秒级检测断连并硬件重路由,正文说已经在 Blackwell 部署里用了。这点先别太激动,因为没给第三方验证数据。真正值得看的是他们把这套东西推到 OCP 开放规范,配合多平面网络,目标是撑住几十万卡级别的训练集群——如果真能落地,对大规模训练的网络成本会有实打实的影响。

机器之心 · 公众号

DeepSeek版Claude Code登顶GitHub热榜,8700星,一个叫鲸鱼哥的开发者用Rust做了个终端工具

这个叫DeepSeek TUI的工具在GitHub上拿了8700多颗星,是开发者Hunter Bown(鲸鱼哥)用Rust写的,让你在本地终端里直接调用DeepSeek V4干活。它能聊天、改文件、跑shell命令、管任务。比较特别的是RLM模式:一次可以派发最多16个V4 Flash子任务,上下文窗口有100万token,操作前还有审批关卡,等于让模...

推荐理由:我会先打个折:这是个人项目,不是 DeepSeek 官方出品,稳定性和后续维护都还是未知数。但 8700 星的热度是实打实的,RLM 的并发和审批设计也给了具体的技术细节,不是空炒概念。对想省钱又想在终端里用 DeepSeek 干活的开发者来说,这东西值得盯一下,但暂时别把它当生产工具。

新智元 · 公众号

Salesforce 为推 AI 销售代理要招 1000 名应届生,岗位从写提示词到验收结果全包

Salesforce 的 CEO Marc Benioff 放话,因为 Agentforce 这个 AI 销售代理业务增长太猛,公司打算新招 1000 名应届生或实习生。Agentforce 的年化经常性收入涨了 169%,干到了 8 亿美元。新招的人主要干四件事:写提示词、做效果评估、盯着代理干活别出岔子、以及把项目交付落地。说白了,初级岗位的活儿变...

推荐理由:这条消息我会先打个折——招 1000 人听着多,但正文没披露是净增还是含离职补缺,也没说这 1000 人里多少是销售交付、多少是技术岗。不过 Agentforce 年化收入 8 亿、同比增 169% 这两个数确实说明 Salesforce 在 agent 产品上下了重注,不是 PR 吹风。对想入行的应届生来说,真正值得盯的不是“招人”本身,而是岗位描述里提到的 prompt 流程、evals 和 agent 监督——这些才是 agent 时代的新基础技能,比传统搬砖岗更有长期价值。

TechCrunch · AI

苹果打算让 iOS 27 变成 AI 模型的自选超市

彭博社的消息说,苹果会在 iOS 27 里加一个叫“扩展”的功能,让你自己选第三方的大语言模型来驱动 Siri、写作工具、图像游乐场这些系统自带能力。iPadOS 27 和 macOS 27 也会同步支持。目前正在测试谷歌和 Anthropic 的模型,ChatGPT 大概率会保留成一个选项。具体能接管哪些任务、切换模型要不要手动操作、不同模型之间怎么...

推荐理由:HKR 三项都过了:系统级模型选择在 iOS 上是个很强的平台钩子,分发利益也大。分数留在 72–77 是因为 RSS 摘要没给模型名单、任务范围、上线时间和接口机制,正文信息缺口明显,我会先打个折。