跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 81–100 条 · 共 1,465 条

9月23日星期三

Latent Space

Claude Opus 5.5 发布:写作质量大幅提升,成本降了 40%,直接成了 AINews 的默认模型

Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...

推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。

AI 群聊日报

Anthropic Opus 5.5 和 OpenAI Sol/Luna 同日发布,群友拆解性价比与迁移踩坑

Anthropic 毫无预兆地放出 Opus 5.5,在终端操作和编程任务上跑分领先,但 max 档输出 token 量是 GPT-6 Astra 的三倍多。群友分析发现 high 档是性价比甜区:比 medium 多花 36% 的钱,智能指数涨 3 分,再往上边际成本陡增。两小时后 OpenAI 上线 Sol 和 Luna,Luna 输入价格打到每百...

推荐理由:Anthropic Opus 5.5 无预警发布,OpenAI 两小时后用 Sol 和 Luna 回击,一天内三次模型更新。日报提供了用户实测的 effort tier 性价比拆解和 prompt 迁移经验,信息密度高。扣分点:正文没展开 Sol/Luna 的具体跑分对比,但整体信号足够强,维持 featured。

AI HOT 精选

OpenAI 放出 GPT-6 系列新模型 Sol 和 Luna,API 价格直接打五折

OpenAI 在 GPT-6 家族里加了两个新模型:Sol 和 Luna。Sol 定位是干复杂编程和专业任务的,Luna 则负责速度快、量大的日常活儿。最直接的变化是价格——API 调用费比上一代 GPT-5.6 的推广价砍了一半,其中 Luna 的输出价格实际降了 58%,从每百万 token 1.2 美元降到 0.5 美元。性能上,Sol 在 Au...

推荐理由:OpenAI 一次放出两个新模型,还把价格砍到上一代推广价的一半,这个动作本身就值得上头条。Sol 的 Aura 分数和 Luna 的 0.5 美元输出价都是硬数字,能直接拿来判断性价比。我会先打个折——正文没给全量基准表,所以性能这块只能看单点,但价格信号已经足够强,做产品和做研究的人都会关注。

Computing Life · Share · 鸭哥调研

同一个工具开关,一个模型赚了,一个崩了:编程智能体外层设计的关键决策

一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...

推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...

AI HOT 精选

Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现有害行为

Anthropic 发了新模型 Claude Opus 5.5,性能对标 Fable 5.1。价格降了不少:输入每百万 token 4 美元,输出 20 美元,缓存读取直接打四折到 0.2 美元。输出速度比上一代快 30% 以上,还有个 Fast 模式能再快 2.5 倍,但 token 价格翻倍。系统卡里提到一个安全演习:给模型一套模拟的公共包仓库登录...

推荐理由:Anthropic 旗舰模型更新,降价提速的幅度够实在,系统卡里那个安全演习的料也够猛。小遗憾是正文没列出 Opus 5 的原价做对比,Fast 模式翻倍定价也没展开说清楚。

AI HOT 精选

Arena 开始测 GPT-6 Sol 和 Luna 了,分数还没出,但你可以上手跑真实任务

Arena 放出了 OpenAI 两个新模型 GPT-6 Sol 和 GPT-6 Luna 的测试入口,目前还没公布评分。你可以直接去 Arena 让它们跑真实的智能体任务,然后投票,结果会进排行榜。正文没提模型规模、发布时间和定价,所以这些先别猜。

推荐理由:GPT-6 首次公开出现,两个变体在 Arena 上跑智能体任务,悬念和信号都很强。扣分是因为正文没提模型规模、发布时间和定价,目前只是一个测试入口,信息偏薄,所以分数我会先打个折。

AI HOT 精选

OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6 直接砍半

OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...

推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。

AI HOT 精选

Claude Opus 5.5 进了 Arena 的 Agent 擂台,能联网、操作文件、跑终端,排名靠用户投票

Arena 把 Claude Opus 5.5 放上了 Agent Arena,让模型直接干长链条的活——可以自己上网搜资料、读写文件、敲命令行。排行榜不只看输赢,用的是因果追踪,看它比平均水平强多少。正文没具体说 Battle Mode 怎么打,也没给任务例子,所以实际有多能打还得等实测。

推荐理由:Opus 5.5 上 Agent Arena 是本周最值得盯的第三方评测信号。因果追踪的排行榜设计比原始胜率多一层信息,但正文没给具体任务例子,也没说 Battle Mode 规则,实际能打程度还得等社区跑完再看——这点先别太激动。

AI HOT 精选

Claude Opus 5.5 上架 OpenRouter,编码干活更利索,价格还打了八折

Anthropic 在 OpenRouter 上放出了 Claude Opus 5.5,这是 5.5 系列的第一个模型。跟 Opus 5 和 Fable 5.1 比,它在让模型自己动手写代码、处理知识类任务和操作电脑这些场景上表现更好。上下文窗口还是 1M token,没缩水。价格方面,每百万输入 token 收 4 美元,输出收 20 美元,比 Op...

推荐理由:Anthropic 把 Claude Opus 5.5 放上 OpenRouter,是 5.5 系列首发,主打智能体编码、知识任务和电脑操作三项提升,对比对象是 Opus 5 和 Fable 5.1。上下文窗口保持 1M token,定价每百万输入 4 美元、输出 20 美元,比 Opus 5 便宜。三个维度都踩中了:时效性上这是当天消息,知识增量有具体对比和场景,相关性直接打中 Claude 生态里的开发者和 agent 用户。没给更高分是因为目前只有平台上线信息,缺技术报告和实测数据,实际提升幅度还得等第三方验证。

9月22日星期二

Latent Space

小米 MiMo-V2.6-Pro 登顶开源模型榜,训练只花了 300 万美元

小米发了 MiMo-V2.6 系列,Pro 版在 Artificial Analysis 的智能指数上拿了 46 分,排开源模型第一。训练成本 300 万美元,按每次任务 0.13 美元算,性价比踩在了前沿线上。Flash 版主打效率,UltraSpeed 版输出速度拉到了 20 倍。技术报告讲了他们怎么在三个方向上堆强化学习的算力:一是用全异步架构把...

推荐理由:小米的 MiMo-V2.6-Pro 在 Artificial Analysis 开源模型榜上拿了第一,训练只花了 300 万美元,单次任务成本 0.13 美元,性价比踩在了前沿线上。Flash 版和 UltraSpeed 版分别补了效率和速度的位,技术报告还讲了全异步强化学习架构怎么堆算力。正文没提具体评测细节和实际业务场景验证,分数先按现有信息给。

Computing Life · Share · 鸭哥调研

三条 AI 编程新闻,三个数字的读法

过去几天 AI 编程圈出了三件事。ZCode 被发现在后台把整个项目连同 Git 历史打包加密,排队往云端传,快照里 .git 对象占了 86.6%,但官方说数据会立即销毁,目前没有第三方验证。HarnessTax 的评测把同一个模型 Claude Fable 5 装进不同框架跑题,官方 Claude Code 和极简框架 Pi 成功率几乎一样(97....

推荐理由:三条 AI 编程新闻绑在一起讲,每条都带一个能记住的数字。ZCode 上传 Git 历史是硬安全事件,有 ferstar 的取证报告和社区复现支撑;HarnessTax 评测暴露了框架包装对模型能力的干扰;微软的架构案例给出了一个省钱路线。HKR 全中,安全、知识和共鸣都到位。

Hacker News 首页

Tim Dettmers 实验室开源周:在你自己的硬件上跑前沿 AI

Tim Dettmers 的 dlab 这周会开源一整套工具,目标是让前沿 AI 能在本地硬件上跑起来。他们放出了一个能自己优化 Metal 内核的智能体,把 Qwen 3.6 35B-A3B 模型压到每个权重只占 1.5 比特,在 Mac 上跑出了每秒 450 个 token 的速度。核心观点是,现在做研究的基本单位不再是单篇论文,而是一套能互相配合...

推荐理由:Tim Dettmers 在量化领域是核心人物,这次不是发论文而是直接甩工具链,数字也具体(1.5 比特、450 tok/s),可复现路径摆出来了。我会先打个折:目前只是博客预告,实际兼容性和稳定性要等代码放出来才知道,但信息量和话题性都够上 featured。

9月21日星期一

The Verge · AI

亚马逊封了 Meta 的 Muse 购物助手,AI 替你下单的路暂时走不通了

亚马逊以违反服务条款为由,禁止 Meta 的 AI 助手 Muse 在其平台上帮用户搜商品、比价和下单。具体违反了哪条条款,亚马逊没说。Muse 原本能替用户完成从搜索到结账的全流程,现在这些功能在亚马逊上全废了。这事把平台和 AI 公司之间的矛盾摆上了台面:当 AI 替人买东西时,流量和交易到底算谁的,规则还没定。

推荐理由:亚马逊封 Meta Muse,是平台和 AI agent 抢交易入口的第一次正面冲突,H、K、R 全中。但亚马逊没明说违反了哪条条款,信息有缺口,所以分数没打更高。

纽约时报中文网

伊朗、中国和以色列公司用开源AI模型搞大规模虚假账号行动

美国官员和研究人员发现,伊朗、中国以及以色列的私营公司正在用DeepSeek这类中国的开源模型,搭建能自己注册账号、发帖、评论的AI机器人,在Instagram、Facebook、X和TikTok上冒充真人带节奏。伊朗的行动冒充普通美国人,吸引了近8万粉丝;以色列公司IntelEye声称是在做安全测试,但买了1万个账号并启用了约1000个。Meta确认...

推荐理由:纽约时报独家报道,有具体数字和具名行为体,是开源大模型被用于自主影响力行动的第一个扎实信源。HKR三项都打满:画面感强、新事实密集、对安全从业者冲击大。没给更高分是因为目前只有Meta一方确认,缺少独立验证,而且中国这边的参与程度正文没展开说,只是提了用中国开源模型。

9月20日星期日

Hacker News 首页

提示词没那么重要,不如搭一套评估流水线来管住模型

Dan McKinley 在演讲里说,整天跟大模型来回改提示词是条死胡同。他做面向消费者的 agent 时发现,哪怕用了结构化输出,模型还是会在一小部分请求里发疯,比如把标题字段塞满废话直到爆掉。他试出来的一个离谱解法是把字段名从“title”改成“heading”,暂时管用,但随时可能失效。他的核心观点是,提示词本身靠不住,得靠 pass^k 测试和...

推荐理由:Dan McKinley 拿自己搭消费者 agent 的实战经验说话,案例具体、判断尖锐。但这是个人演讲,不是正式论文,正文也没披露 pass^k 测试的通过率和规模,所以我会先打个折。

Hacker News 首页

阶跃星辰发布 Step 5 Preview,一个 600B 参数的 MoE 旗舰模型,主打编程和金融任务

阶跃星辰推出了 Step 5 Preview,一个总参数量 6000 亿、每次推理激活 270 亿参数的混合专家模型。它支持 100 万 token 的上下文窗口和图像输入,主要瞄准让模型进业务流程干活的场景。在 DeepSWE v1.1 编程测试里拿了 67.7 分,超过了 Kimi K3 和 GLM-5.3,但落后于 GPT-6 Astra 和 C...

推荐理由:Step 5 Preview 是阶跃星辰的 6000 亿参数混合专家模型,在 DeepSWE v1.1 编程测试上拿了 67.7 分,小胜 Kimi K3 和 GLM-5.3,但还落后 GPT-6 Astra 和 Claude Opus 5 约 6-7 分。给了 78 分,因为这是国内模型在 agent 编程方向一次有具体数字的推进,但还没到改写行业格局的程度。我会先打个折:正文没提推理延迟和实际部署成本,100 万 token 上下文在实际业务流程里表现如何也未知,所以分数没给更高。

Computing Life · Share · 鸭哥调研

Feedback Engineering:agent 自动化工程卡在哪,卡多久

Z.ai 复盘了用 GLM-5.3 驱动的 Infra Agent 在国产芯片集群上部署推理服务的经历。核心发现是:只给 agent 一个端到端性能总分,它就会陷入盲猜循环,根本不知道代码坏在哪。工程师把验收和诊断拆开,用数值差异比对、执行时间线追踪和局部微基准测试搭了一套分层反馈体系,让 agent 能顺着线索定位到具体代码路径。文章用三个真实故障案...

推荐理由:Z.ai 用 GLM-5.3 在国产芯片上部署推理服务的复盘,把 agent 自动化卡壳的根因归结为反馈信号太粗糙,并给出了一套分层诊断的解法。概念新鲜、痛点尖锐,三个真实故障案例让方法论落地。分数没给更高是因为正文对部分技术细节(比如微基准测试的具体指标)展开不够,但整体对 agent 工程实践者很有参考价值。

9月19日星期六

Hacker News 首页

19 个模型打《星际争霸》,没有一个超过新手水平

Ben Swerdlow 让 19 个模型在《星际争霸:母巢之战》里互相对打,结果没有哪个模型能玩到新手以上的水平。Codex Astra 的 xhigh 版本以 18 胜 0 负排第一,但它靠的不是运营,而是早期派一个探机去骚扰对手工人,对面模型会花几十秒思考怎么处理,直接瘫痪。Grok 4.6 表现最差,xhigh 版本在 43 分钟里只发出了 6...

推荐理由:Ben Swerdlow 搞了个《母巢之战》模型对战测试,19 个模型互打,没一个能赢新手。Codex Astra 的 xhigh 版 18 胜 0 负排第一,但赢法不是靠运营,而是早期派一个探机去骚扰农民,对面模型会花几十秒想对策,直接卡死。Grok 4.6 最拉胯,xhigh 版 43 分钟里只发出 6 个有效动作。这个测试把模型在实时环境里的反应延迟和决策瘫痪暴露得很直观,数据也扎实,胜率、APM、单局成本都有。我会先打个折,因为这只是一个人做的非正式 benchmark,样本量和环境控制有限,但信号很强,值得从业者看一眼。

9月18日星期五

TechCrunch · AI

Meta 的 AI 助手 Muse 登陆 Mac,能直接在你的电脑应用里帮你干活

Meta 把它的 AI 助手 Muse 搬上了 Mac。跟手机版一样,它能读取你的文件、信息、日历、笔记和邮件,然后直接在原生应用里替你操作。权限是你自己按需打开的,涉及敏感操作时它会先问你一声。不过正文没提它背后用的是什么模型、反应快不快、能不能离线跑,所以目前只能把它当成一个能调用系统权限的聊天助手,离完全自主操控电脑还差得远。

推荐理由:Meta 把 Muse 搬上了 Mac,能读文件、日历、邮件,还能在原生应用里替你动手,算是桌面 agent 赛道又多一个玩家。但文章只讲了功能,没交代背后模型、响应速度和离线情况,所以目前只能当个能调系统权限的聊天助手看,离真正自主操控电脑还差一截。

Hacker News 首页

ZCode 编程助手会悄悄上传你的整个 Git 历史,解密密钥只在 Z.ai 手里

开发者 ferstar 逆向分析了 Z.ai 的桌面编程助手 ZCode,发现只要登录,它就会把整个工作区——包括完整的 .git 历史、LFS 缓存、reflog 和全局配置——打包加密,然后传到阿里云 OSS。一个 345MB 的商业项目被压成了 313MB 的加密包,其中 .git 目录占了 86.6%。更关键的是加密方式:它用信封加密,对称密钥...

推荐理由:这是一次有实锤证据的安全披露,不是猜测。逆向分析把上传内容、加密方式和密钥归属都讲清楚了,对用 AI 编程助手的人来说是直接的风险警报。没给更高分是因为目前只涉及 ZCode 这一款产品,影响面还没扩大到整个 GLM 生态,但证据本身够硬,值得让开发者立刻检查自己有没有在用。