跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1161–1180 条 · 共 1,465 条

4月30日星期四

Latent Space

推理算力到了爆发点:CPU 不够用,GPU 也在被拆着用

Latent Space 这期把近期几条线索串了起来:AI 的推理(inference)需求正在急剧膨胀。黄仁勋在 GTC 上说,过去两年单次任务的算力消耗涨了约 1 万倍,总用量涨了约 100 倍,他管这叫“推理拐点”。英特尔 CEO 在财报会上给了更具体的数字,CPU 需求在涨,不是因为训练,而是因为代码智能体、强化学习环境模拟这些推理侧的工作全压...

推荐理由:这是一篇 Latent Space 的新闻汇总和趋势判断,不是模型发布或重大产品更新。它把黄仁勋的预测和 CPU 沙箱、智能体调度这些实际工作负载拆解放在一起,对从业者有参考价值,但信息密度和独家性不如一手发布。我会先打个折,放在 featured 里偏评论解读的位置。

TechCrunch · AI

微软说 Copilot 付费用户超过 2000 万,但没讲清楚大家到底怎么用

微软 CEO 纳德拉在财报会上说,嵌在 Word、Excel 和 Outlook 里的 M365 Copilot 现在有 2000 万个企业付费席位。这个数字说明愿意掏钱的公司确实在变多,但文章没披露活跃度、留存率、每个用户平均贡献多少收入,也没说这 2000 万是怎么统计的——是买过就算,还是真正在用。所以“他们真的在用”这个说法,目前只能先打个折看。

推荐理由:HKR-K 的强度在于微软罕见地公布了付费用户数,这是市场最缺的采纳证据。但正文只说了用户数和参与度在涨,活跃率、留存、ARPU 和统计方法一概没提,所以分数卡在 featured 门槛附近,没往上拉。

Hacker News 首页

Ramp 的表格 AI 会偷偷把财务数据传出去

安全公司 PromptArmor 发现 Ramp 的 Sheets AI 有个漏洞:攻击者可以在外部表格里藏一句白底白字的指令,诱导 AI 自动插入一个 IMAGE 公式,把用户表格里的敏感财务数据拼到攻击者网址后面发出去。整个过程不需要用户确认。Ramp 那边说已经在 2026 年 3 月 16 号修了。

推荐理由:HKR 三项全中:文章把一条 AI 表格工具的数据外泄路径讲得很清楚。给 82 分没上 85,是因为只有 PromptArmor 单方信源,而且实际受影响的数据规模正文没披露。

r/LocalLLaMA

inclusionAI 在 Hugging Face 开源了 Ling-2.6-1T,一个 1 万亿参数的模型

这个模型用了 MLA 和线性注意力,还加了一个叫“上下文过程冗余抑制”的技术,目的是降低思维链推理时的计算开销。帖子提到了 AIME26 和 SWE-bench Verified 两个基准,但正文没披露具体分数,所以实际表现还不清楚。另外,Reddit 原帖被网络屏蔽了,目前只能看到标题和简介,更多细节得去 Hugging Face 模型页翻。

推荐理由:我会先打个折:正文只提了覆盖 AIME26、SWE-bench Verified 等基准,但没给具体分数,所以模型到底多强现在说不准。能上 featured 是因为万亿参数开源本身就有信号意义,加上 MLA+Linear Attention 和 CPRS 这两个技术点,对做推理优化的人有参考价值。没给分这件事让它到不了 P1,但架构信息和开源动作足够让圈内人留意。

X · @dotey(宝玉)

Hermes Agent 的记忆系统拆解:它用四层设计避开了 OpenClaw 的坑

Hermes Agent 的记忆不是一套,而是四套:高度浓缩的提示词记忆(MEMORY.md 和 USER.md)、可搜索的 SQLite 历史会话存档、像程序记忆一样运作的技能管理,以及可选的 Honcho 深层用户建模。核心思路是冷热分离——把最常用的信息压进极小的提示词快照里(加起来约 1,300 个 Token),以保住大模型的提示词缓存、降低...

推荐理由:这篇文章不是产品发布,更像一篇技术拆解,把 Hermes Agent 的记忆系统讲得很清楚。我会先打个折:它来自单一信源,没有第三方验证,但给出的四层结构、字符限制和缓存优先思路对实际做 agent 的人有参考价值。正文没披露性能对比数据,所以别把它当评测看,当成一个设计思路的分享就好。

4月29日星期三

r/LocalLLaMA

Mistral 发布 1280 亿参数模型,支持图文输入和函数调用,高收入公司商用需额外授权

Mistral AI 在 Hugging Face 上放出了 Mistral Medium 3.5,一个 1280 亿参数的稠密模型,上下文窗口拉到 25.6 万 token。它能吃文本和图片,支持函数调用和 JSON 格式输出,推理强度可以按请求设成“无”或“高”。许可证用的是修改版 MIT,但对高收入公司留了例外条款——正文没披露具体收入门槛是多少...

推荐理由:这条发布信息量够硬,HKR 三项都踩实了,所以重要性给到 84。但正文没放任何跑分、定价和可复现的测试结果,我会先打个折——没有这些,光看参数和功能列表,实际效果和成本还不好判断。

新智元 · 公众号

清华团队花约10万美元、一周时间,让系统自动刷出105个SOTA

清华徐丰力团队和北京中关村实验室搞了个叫AutoSOTA的系统,放养式跑了一周,烧掉约220亿token,产出了105个所谓的最优结果。系统里塞了8个智能体,分别负责搭环境、修bug、排任务、想点子、做审计。每完整跑一轮平均5小时。最关键的是它设了条红线:不准改评估脚本和数据划分,靠这个来保证结果能复现。不过正文没披露具体在哪些任务上拿了SOTA,也没...

推荐理由:HKR三项全中:有具体数字和机制描述,审计约束让说法可验证。保留84分是因为这仍是单篇二次报道,不是模型或产品级发布,但选题和切入角度对从业者足够有信息量。

量子位 · 公众号

UCL 等团队开源 Avenir-Web,一个不用额外训练就让网页智能体干活更稳的框架,在 ONLINE-MIND2WEB 上跑到 53.7%

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架,主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里,成功率做到了 53.7%。对比一下,用 Gemini 3 Pro 跑的时候,它比 Claude Computer Use 3.7 的 47....

推荐理由:HKR 三项都站得住:标题有记忆点,数字和对比够具体,选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布,不是大厂模型首发,82 分放在 78–84 区间合理。

TechCrunch · AI

Scout AI 拿了 1 亿美元,要把 AI 模型送进战场,我们去了他们的训练营

Scout AI 融了 1 亿美元,用来训练能在战场上干活的 AI 智能体。我们实地看了他们的训练场,核心目标是让一个士兵就能指挥一群无人车。不过正文没披露这轮融资是第几轮、谁投的、估值多少。

推荐理由:HKR 三项都站得住:1 亿美元、战争 agent 训练营、单兵控车队,信息够具体。但正文没披露轮次、投资方和估值,缺了这些关键商业信息,所以没到非写不可的程度。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

Computing Life · Share · 鸭哥调研

DeepSeek V4 技术解读:为 Agent 长任务做的工程取舍

这篇文章把 DeepSeek V4 的技术报告翻译成了人话,核心就讲一件事:为了让模型能稳定地跑完一个长链条的 Agent 任务(比如改代码、调工具、看日志反复几十轮),V4 在架构上做了哪些又贵又复杂的工程决策。文章拆解了三个主要矛盾。第一,百万级上下文不是光能装下就行,Agent 得随时回看历史里的报错和工具结果,V4 的做法是把注意力机制分成三层...

推荐理由:我会先打个折:正文没给参数量、训练数据、价格和发布时间,所以没法判断它到底多能打,只能当技术方向看。但 DeepSeek V4 把 100 万 token 上下文和 agent 负载绑在一起讲,还给了混合注意力、OPD 这些具体手段,对做 agent 落地的人有参考价值。信息缺口明显,所以重要性停在 78,不往上拔。

X · @dotey(宝玉)

OpenAI 把 GPT-5.5、Codex 和托管智能体搬上 AWS Bedrock,限量预览已开

OpenAI 和 AWS 扩大了合作,现在企业可以在 Amazon Bedrock 上直接调用 GPT-5.5、Codex 编程工具和托管智能体。以前用 OpenAI 基本只能走 Azure,重仓 AWS 的公司要么迁移要么放弃,现在这个障碍没了。企业能在自己熟悉的 AWS 环境里复用安全策略、合规和账单体系,Codex 的费用还能算进 AWS 的云消...

推荐理由:这条不是普通的云合作公告。OpenAI 把 GPT-5.5 和 Codex 放到 AWS Bedrock 上,等于在 Azure 之外开了第二条企业通道,而且直接绑定了 AWS 的合规和计费体系。Codex 周活 400 万说明开发者端已经有量,现在企业采购可以走 AWS 的消费承诺,省事也省钱。限量预览阶段,实际可用性和延迟还没公开,这点先别太激动,但方向本身值得当天就关注。

TechCrunch · AI

微软独家协议刚结束一天,AWS 就把 OpenAI 模型搬上了 Bedrock

OpenAI 和微软修改协议、不再有独家授权后,亚马逊隔天就在 AWS 的 Bedrock 服务里上线了 OpenAI 最新模型、代码工具 Codex,以及一个叫 Bedrock Managed Agents 的新东西,专门用来搭 OpenAI 驱动的 AI 智能体。亚马逊说这只是“更深合作的开头”,但正文没披露具体上了哪些模型、怎么收费、在哪些区域可...

推荐理由:我会先打个折:正文只说了 AWS 要卖 OpenAI 产品,连具体模型名都没列,所以重要性停在 78 是合理的。真正值得盯的是分发渠道从 Azure 独占转向多云,这对企业采购和云厂商竞争格局都有影响。agent 服务被点名,说明 OpenAI 在推让模型进业务流程干活的产品,但没细节就先别太激动。

Hacker News 首页

OpenAI 模型将上线亚马逊 Bedrock,Sam Altman 和 AWS CEO 聊了聊托管 Agent

OpenAI 和 AWS 宣布合作,把 OpenAI 的模型搬上亚马逊 Bedrock 平台,主打“托管 Agent”——你可以理解成让模型直接在你的 AWS 环境里跑业务流程,安全性和权限管理这块能省不少事。这次采访里 Sam Altman 和 AWS CEO Matt Garman 聊了这件事,但没公布具体会上哪些模型、怎么收费、什么时候上线。能促...

推荐理由:Sam Altman 和 AWS CEO 亲口确认 OpenAI 模型会通过 Bedrock 的托管代理功能接入,同时微软那边的协议也改了,Azure 首发地位保留但 OpenAI 能去别的云了。我会先打个折:正文没写具体价格、会上哪些模型、什么时候能用,所以重要性停在 88 分这个区间。对从业者来说,这消息打破了 OpenAI 和 Azure 绑定的老印象,跨云分发和授权到 2032 年都是实打实的新事实,值得一看。

X · @dotey(宝玉)

港科大等十余所高校发 88 页综述,给“世界模型”画了一张统一地图

这篇综述先捅破一层窗户纸:做强化学习、视频生成、Web Agent 的人嘴里说的“世界模型”根本不是一回事,论文之间没法比。作者团队拉出一个“能力等级 × 领域法则”的二维框架,把 400 多篇工作摆到同一张桌子上。能力分三层:L1 只预测下一步,L2 能做多步推演且遵守领域基本规则,L3 能在预测翻车时自己诊断原因、设计实验、修正模型。领域分物理、数...

推荐理由:我会先打个折:这不是新模型发布,是一篇梳理定义的综述。但它的价值在于把“世界模型”这个被用烂的词拆成可验证的层级和领域法则,400 多篇文献、26.2% 的物理一致性通过率、A-Lab 的闭环实验数据,都让讨论从玄学回到工程。对从业者来说,下次再有人说“我们做了世界模型”,可以直接拿这篇的框架去问到底在哪个层级、遵守什么领域法则。

X · @dotey(宝玉)

AI 终端 Warp 把客户端代码开源了,OpenAI 是创始赞助商

Warp 是一个用 Rust 写的现代终端,有超过 70 万开发者用,核心卖点是把 AI 塞进命令行,你用自然语言说想干嘛,它帮你生成命令。这次开源的是客户端代码,走 AGPL 协议,服务端还是闭源的。比较特别的是他们的社区贡献流程:Warp 自家的云端 AI 平台 Oz 负责写代码、做规划、跑测试,人主要负责提想法和验证,等于在跑一个“人管方向、AI...

推荐理由:Warp 这次开源的是客户端代码,走 AGPL 协议,服务端没动,所以别理解成整个产品都开源了。OpenAI 当创始赞助商是个信号,但正文没展开双方具体怎么合作。真正有意思的是他们提的“人管方向、AI 干活”的贡献流程,不过目前还只是说法,没看到跑起来的例子。70 万开发者的数字说明用户盘子不小,Rust 重构也加分。整体是条扎实的开发者工具动态,不是模型或能力层的重大发布。

The Verge · AI

Claude 现在能直接操控 Photoshop、Blender 和 Ableton 了

Anthropic 给 Claude 装上了“创意连接器”,让它能直接读写 Adobe 全家桶、Affinity、Blender、Ableton 和 Autodesk 这些专业软件。以 Blender 为例,Claude 可以帮你排查 3D 场景哪里出了问题、写自定义工具,还能批量修改一堆物体的属性。另外,Anthropic 还给 Blender 基金...

推荐理由:HKR 三项都成立:Claude 进入主流创作软件是明确的跨工具钩子,连接器覆盖广且 Blender 端有具体操作能力,这件事踩中了 agent 进入专业工作流的神经。正文没提价格和完整上线地区,所以先别太激动,但方向本身值得关注。

NVIDIA 博客

英伟达发布 Nemotron 3 Nano Omni:一个模型同时看懂图文、听懂语音,做 AI 代理时吞吐量号称是同类 9 倍

英伟达在 2026 年 4 月 28 日开源了 Nemotron 3 Nano Omni,一个能同时处理文字、图片、音频、视频、文档、图表和屏幕界面的多模态模型。它用了 30B-A3B 的混合专家架构(MoE),实际激活的参数量是 3B,配合 Conv3D 和 EVS 技术来处理音视频,上下文窗口拉到 256K。官方说在保持交互延迟不变的前提下,跑 A...

推荐理由:NVIDIA 这次把视觉、语音、文字塞进一个 30B-A3B 的混合专家模型里,还开放了权重和训练技术。我会先打个折:9 倍效率提升是跟谁比、测什么任务,正文没细说,这点先别太激动。但 256K 上下文、Conv3D 和 EVS 这些配置,加上直接上 Hugging Face 和 OpenRouter,对想用开源方案搭多模态 agent 的团队确实省事。单信源,信息够用但不算独家,所以放在 featured 里。

4月28日星期二

X · @claudeai

Claude 现在能直接操作 Blender,在聊天窗口里改 3D 场景

Claude 上线了 Blender 连接器,你可以在对话里让它帮你排查场景问题、写新工具,或者批量修改所有物体。正文没提这个功能是免费还是付费、支持哪些版本,也没说清楚 Claude 在 Blender 里的操作权限边界——它能改到什么程度、会不会误删东西,这些都得等实测才知道。

推荐理由:HKR 三项都过:Claude 接 Blender 是 Agent 往专业工具里伸了一只真能干活的手,不是概念图。正文没提版本、定价和上线范围,所以重要性停在 76,够 featured 但不到必写。我会先打个折——没看到实际跑起来的延迟和权限边界,这点先别太激动。

Ben's Bites

GPT-5.5 来了,价格翻倍但号称省 token,Cursor 跟 SpaceX 搞了个大单

OpenAI 发了 GPT-5.5,比上一代贵了一倍,单 token 价格甚至略高于 Claude Opus 4.7。但他们说新模型 token 效率提升了 40%,所以实际跑一个任务的成本没怎么变,Ramp 的测试也印证了这点。Ben 自己用下来觉得模型在“思考:低”模式下又快又聪明,已经把它设成默认了。另外 Claude 的托管代理记忆功能开始公测...

推荐理由:这是一篇通讯汇总,不是一手发布,所以分数不会顶到 95 以上。但三条消息都够硬:GPT-5.5 的定价和效率数字能让人直接算账,Claude 记忆功能公测意味着外挂记忆开始进生产流程,Cursor 的收购选择权更是把编程工具的价值拉到一个新量级。我会先打个折,因为正文没展开技术细节,比如 40% 效率提升是在什么场景下测的、记忆功能有没有延迟数据,这些缺口让信息停留在“值得关注”而不是“可以立刻决策”的层面。整体对 AI 从业者来说,信息密度高、不水,给 89 分合理。