跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 1021–1040 条 · 共 1,465 条

5月12日星期二

彭博科技

GitLab 宣布裁员,省下的钱要投给 AI agent 业务

GitLab 说会裁掉一部分岗位,把省出来的人力和预算转到 AI agent 方向。具体裁多少人、砍哪些部门、省出多少钱、什么时候开始执行,正文都没披露——因为 Bloomberg 原文被付费墙挡了,只拿到 RSS 摘要。我会先打个折:这更像一个资源重分配的信号,不是财务危机驱动的裁员。

推荐理由:H 和 R 都站得住:Bloomberg 报道 GitLab 把裁员和 agent 投入直接挂钩,对开发者工具圈是个强劳动力信号。K 偏弱,因为人数、预算和执行时间都没披露。维持 78 分,原因是这只是一条 Reddit 帖子,没有独立复现,也没给出论文或代码。

AI HOT 精选

OpenAI 发布 Daybreak,把自家模型和 Codex 打包成网络安全防御工具

OpenAI 宣布推出 Daybreak,一个面向安全团队的 AI 防御系统,整合了他们最强的模型、Codex 以及安全合作伙伴的能力,目标是加快漏洞发现和软件防护的速度。正文没披露具体定价、上线时间,也没给出任何防御效果的实测数据,所以实际能防住什么级别的攻击、误报率多少都还不清楚。

推荐理由:OpenAI 发了个 Daybreak 的安全产品公告,把模型、Codex 和合作伙伴绑在一起做网络防御,听着像个正经产品。但我会先打个折:全文没给一个防御指标,也没说什么时候能用、花多少钱,目前更像一个概念拼盘。它踩中了 AI 攻防和合规的焦虑点,所以值得提一嘴,但缺干货让它只能停在产品更新这个档位。

彭博科技

AI 芯片公司 Cerebras 把 IPO 规模上调三分之一,想融 48 亿美元

Cerebras 把首次公开募股的融资目标从原来的水平提高了三分之一,最高要融 48 亿美元。这条视频还提到了 Circle 的一季度收入和 Google 研究人员首次用 AI 造出的零日攻击,但正文没披露这两件事的具体细节。

推荐理由:Bloomberg 这条快讯说 Cerebras 把 IPO 盘子加大了三分之一,最高要拿 48 亿美元,对 AI 芯片赛道是个不小的资本信号。不过正文没给定价、估值和时间表,所以我会先打个折,不往 85 分以上推。另外标题里还提了 Circle 一季度收入和 Google AI 生成零日攻击,但正文没展开细节,这两点先别太激动。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Replit 上线并行代理,一次能跑 10 个代理同时干活

Replit 新出的并行代理功能,允许最多 10 个代理同时跑。每个代理拿到的都是你应用的独立副本,在各自的机器上互不干扰,最后通过一个代理工作流把结果合并回来。正文没披露合并冲突怎么处理、任务怎么拆分,也没给出具体提速数据,这点先别太激动。

推荐理由:Replit 这次把并行代理的上限拉到 10 个,每个代理独立跑应用副本再合并,相当于让多个 AI 程序员同时改代码然后合分支。正文没讲合并冲突怎么处理、代理间怎么分工,这点先别太激动。整体是个中等体量的开发者工具更新,还没到 Cursor Agent 模式那种量级,所以放在 featured 档。

AI HOT 精选

Gemini 现在能翻你的 Gmail 和相册,自动拼出一个旅行计划

Gemini App 推出了“个人智能”功能,可以把你的 Gmail、Google Photos、搜索记录和 YouTube 观看历史串起来,直接生成一份定制旅行行程。它省去了你自己翻邮件找酒店、从相册回忆地点的步骤。你随时可以选哪些 App 给它读,也能关掉个性化设置。正文没披露它具体怎么处理隐私数据、会不会把邮件内容喂给模型训练,这点先别太激动。

推荐理由:我会先打个折:正文只说了功能方向,没披露权限粒度、数据范围能不能自己勾选、行程质量怎么评估。亮点是 Google 第一次把四个核心数据源串起来给个人助手用,不再是单点功能。但这点先别太激动——没讲清楚用户能不能关掉某个数据源、数据是本地处理还是上传,也没给任何准确率或用户测试结果。对从业者的刺激在于:如果这套跑通,Google 助手的记忆深度会甩开只能读聊天记录的竞品一截;如果跑不通,就是一次隐私翻车现场。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

5月11日星期一

AI HOT 精选

Anthropic 在 GitHub 开源了一套金融 AI 模板,直接给投研、投行、风控配好了 10 个智能体和 11 家数据商的连接器

这套模板把金融行业里常见的 AI 用法打包成了开箱即用的工作流,覆盖投研、投行、风控等核心环节。里面塞了 10 个端到端智能体、7 个垂直插件,还接好了 11 家主流金融数据商的 MCP 连接器,等于把模型跟 Bloomberg 这类数据源的通路提前打通了。部署方式从个人插件到企业 API 都支持,也能塞进 Microsoft 365 和私有云。正文没...

推荐理由:我会先打个折:这不是模型发布,所以重要性到不了 85 分,但开源一套能跑的金融 agent 模板,比发篇愿景文章实在得多。Anthropic 把 10 个端到端智能体、7 个插件和 11 家数据商的 MCP 连接器打包扔上 GitHub,等于给金融行业的 AI 落地画了一条参考线,别人想跟进得先过这一关。正文没披露这些 agent 在生产环境跑到什么程度、延迟和准确率怎么样,所以别急着当成熟方案用,但作为起点,信息量和可复现性都够格进 featured。

AI HOT 精选

Cognition AI 总部首次曝光:Scott Wu 和他 18 个月做到 4.45 亿美元年化收入的 Devin

推文放出了 Cognition AI 总部“Cog House”的内部画面。创始人 Scott Wu 是顶尖竞技程序员,拿过三次国际信息学奥赛金牌。他在 2023 年 11 月母亲去世、Sam Altman 被 OpenAI 解雇的同一天创立了公司,赌的是 AI 会变成能全天干活的智能体。他们做的 AI 软件工程师 Devin 刚上线时表现一般,但 1...

推荐理由:HKR 三项都过,因为这篇既有 Cognition AI 罕见的内部揭秘,又甩出了 Devin 的营收和估值数字。没给 P1 是因为它本质上是人物+公司特写,不是融资、产品发布或模型发布那种硬消息。

AI HOT 精选

AntLingAGI 放出万亿参数模型 Ring-2.6-1T,5 月 15 日前在 OpenRouter 免费用

Ring-2.6-1T 是一个万亿参数模型,主打可调“思考强度”——你可以手动控制它多想一会儿还是少想一会儿,在回答质量、token 消耗和响应速度之间自己取舍。模型专门为智能体场景做了优化,支持多步执行和工具调用,适合高频工作流。官方说它能处理数学逻辑和科研类任务,但正文没给出具体跑分或对比数据。目前通过 OpenRouter 免费开放,截止到 5 ...

推荐理由:这条发布信息量偏薄,正文没给基准测试、定价、架构或训练细节,所以重要性我打了个折,没给更高。但万亿参数这个量级本身就有话题性,加上 OpenRouter 上的限时免费,对想快速试用的开发者很友好。可调思考强度和工具调用这两点,说明它在往智能体落地靠,不是单纯刷榜的模型。整体判断是:值得关注的一次模型发布,但别急着当里程碑,等实测数据出来再说。

Import AI

AI 监管的第三条路:先备好工具,别急着定死规矩;以及一篇关于“神经计算机”的脑洞论文

这期 Import AI 聊了两件事。第一件是法律与 AI 研究所提出的“激进可选性”监管思路:政府别急着在现在就把 AI 管死,也别完全不管,而是应该花大钱、下大力气,先把未来可能用到的监管工具和能力建起来。文章列了七类具体工具,包括强制公司公开和上报信息的透明度与报告机制、引入第三方审计、保护吹哨人、政府内部及跨国信息共享、用“如果-那么”式的条件...

推荐理由:HKR 三项全中:这不是一次硬核产品发布,而是 Import AI 的高信号周报。真正的价值在于那 7 类监管工具和 Wan 2.1 原型,所以放在 featured 档没问题,但还够不上重大发布那档。

AI HOT 精选

腾讯混元放出 Hy3 预览版,主打复杂智能体任务,不是刷榜模型

腾讯混元开放了 Hy3 预览版的早期体验,官方说这是目前混元系列里最强的模型。它不冲着跑分去,而是强调在真实场景里能把事办成。模型用了 256K 上下文窗口,一次能塞进很长的材料;架构是混合专家(MoE),还加了快慢思考机制,碰到复杂问题会自动切换深度推理模式。底层把预训练和强化学习管线重做了一遍,目标是在大规模部署时把成本压下来。具体效果和实测数据正...

推荐理由:腾讯混元 Hy3 预览版放出了 256K 上下文和快慢思维混合专家架构,定位是处理复杂智能体任务。我会先打个折——正文没披露评测分数、定价和开放范围,所以没法判断实际能力和性价比。架构上快慢思维混合专家听起来像在推理效率和深度之间做平衡,如果是真的挺省钱,但没看到具体实现细节。256K 上下文对长链条智能体任务有用,但也要看实际召回和推理稳定性。这点先别太激动,等更多技术细节和实测出来再说。

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

AI HOT 精选

OpenAI 成立部署公司 DeployCo,并收购 Tomoro,直接往企业里派驻工程师帮他们把模型用起来

OpenAI 新成立了一家叫 OpenAI Deployment Company(DeployCo)的独立公司,专门帮企业把 AI 系统真正部署到日常业务里。核心做法是派驻一种叫“前线部署工程师(FDE)”的人进到客户公司内部,跟业务、运营、一线团队一起找出 AI 最能产生价值的地方,然后重新设计流程、搭系统、做测试,直到能稳定跑在生产环境里。为了起步...

推荐理由:OpenAI 搞 DeployCo 是个实打实的企业战略信号。H 有独立公司的钩子,R 踩中了部署竞争的神经,但 K 很弱——定价、客户、时间都没披露,所以只能放在 featured 的底线分。

新智元 · 公众号

Agent 评测的下半场:为什么需要一个「活的」Benchmark?

这篇文章的正文被微信环境验证挡住了,实际内容没拿到。从标题和现有英文摘要看,它讨论的是 Claw-Eval-Live 这个基准测试,用 105 个任务测了 13 个前沿模型,表现最好的模型通过率也没超过 70%,HR 类任务平均通过率只有 6.8%。核心观点是静态评测不够用了,需要能动态更新的“活”基准来测 AI 智能体。但具体怎么个“活”法、任务怎么...

推荐理由:HKR 三项都成立:活的 benchmark 这个切入点具体,不是又一篇刷榜通稿;数据量够,105 道任务和 13 个模型的覆盖面说得过去,HR 任务 6.8% 的通过率尤其扎眼;它踩中了 Agent 从 demo 到落地之间那个“到底能不能用”的信任问题。Claw-Eval-Live 本身还没经过大规模实战检验,所以放在 featured 偏低的位置比较合适。

新智元 · 公众号

Anthropic 估值可能冲到近万亿美元,Jack Clark 预测 2028 年底前 AI 有超一半概率能自己造出更强的自己

这篇文章本身因为微信环境验证问题,正文内容没抓到,只能看到标题和外部信息。标题里提到 Anthropic 在考虑接近 1 万亿美元的估值,年化收入五个月内涨到 450 亿美元,IPO 规模可能超过 SpaceX。Jack Clark 判断,到 2028 年底,AI 系统能自主迭代出更强版本的概率超过 50%,Kalshi 预测市场上这个 IPO 在 1...

推荐理由:我会先打个折,因为来源是二手媒体,IPO和ARR数字都没看到官方确认。但文章把几个高关注点串在了一起:估值、收入增速、自主迭代的时间预测。对从业者来说,这些数字即使有水分,也反映了市场对头部AI公司定价的疯狂程度,以及内部对技术奇点临近的判断。信息量够,争议性也够,值得推。

新智元 · 公众号

Claude Mythos 在 METR 长任务评测里拿到 50% 成功率,对应人类 16 小时的工作量

METR 的 Time Horizons 测试里,Claude Mythos 预览版在人类需要 16 小时才能完成的任务上,成功率达到了 50%。不过整个测试集一共 228 个任务,只有 5 个任务的时间跨度超过 16 小时,所以这个成绩能说明它在长任务上有进步,但样本太少,还测不出它在更长时间尺度上的真实水平。

推荐理由:我会先打个折:50% 成功率听起来很猛,但只测了 5 个超过 16 小时的任务,样本太少,不能当定论。正文自己也说更长区间样本不足。所以 2027 奇点加速这种说法先别太激动。不过这个结果确实把 AI 评测的天花板往上顶了一截,从跑分转向了按人类耗时衡量的任务,对做智能体和安全的团队有直接参考价值。整体给 82 分,因为数据有料但外推太远,不算当天必读的头条。

Computing Life · Share · 鸭哥调研

OpenAI 和 Anthropic 同一天搞了家一样的公司,但赌的是完全相反的结局

5 月 4 日,OpenAI 和 Anthropic 先后宣布与 PE 成立合资公司(JV),专门向大企业部署 AI。结构看着一样,但条款暴露了两家对“自己是什么公司”的判断截然相反。OpenAI 的 DeployCo 给了 PE 投资人 17.5% 的保底回报,相当于高价租用 PE 的渠道和控股权,把部署当成本,核心资产还是模型。Anthropic ...

推荐理由:我会先打个折,这篇是单人评论,没有多方信源交叉验证,所以分数卡在 80 附近。但它的切入点很巧,把 OpenAI 和 Anthropic 在同一天跟私募成立合资公司这件事拎出来,用保底回报这个具体数字说清了两种商业路线的分歧。对关注 AI 公司怎么赚钱、怎么跟资本绑定的从业者来说,信息量够,读起来也不累。

Computing Life · Share · 鸭哥调研

Google 悄悄关停 Project Mariner,但三家大模型公司其实得出了同一个结论

Google 在 5 月 4 日毫无预告地关掉了去年 I/O 大会上主推的 AI 浏览器代理 Project Mariner。这件事不能简单看成 Google 掉队,因为 Anthropic 和 OpenAI 在同类产品上也撞了墙。核心问题在于,独立浏览器代理(像 Mariner、Operator)一启动就是个全新的、没有 cookie 和浏览记录的会...

推荐理由:这条消息的价值在于把三家公司对浏览器 agent 的悲观判断摆在一起,而不是只报 Google 一家关停。关停日期是新的,但正文没给出官方公告链接,也没披露失败的具体指标,比如任务成功率掉到多少、成本高到什么程度,所以信息强度有折扣。对做 agent 的人来说,知道大厂在这个方向上集体后撤,比看一篇技术方案更有参考意义,但缺少一手数据支撑,只能算一个值得注意的信号。

AI HOT 精选

本地 35B 模型扛下作者一半日常工作,响应速度是云端 Claude Opus 4.5 的两倍

作者用五周时间测了约 1400 个日常工作请求,发现本地跑的 Qwen 3.6 35B 这类模型能搞定其中一半,平均响应 2.8 秒,比云端 Claude Opus 4.5 的 5.8 秒快了 2.1 倍。像邮件草拟、日程安排、摘要和行政杂活这些任务,本地模型完全够用;市场调研和工程类任务则是对半开,简单查数据、修脚本可以本地跑,复杂的多源分析和架构决...

推荐理由:Tom Tunguz 拿本地35B模型做了五周实验,跑了约1400项日常工作任务,成功处理约一半,平均响应2.8秒,比Claude Opus 4.5快2.1倍。这个结果对从业者来说很实在:不是模型发布,也不是平台级更新,但给出了本地模型在延迟和成本上替代云端模型的一个具体参照点。我会先打个折——正文没披露任务类型分布和失败案例的具体原因,所以50%成功率不能直接当通用结论用。但速度对比和实验规模足够让关注推理成本和隐私的人认真看一眼。