跳到正文

#Agent

今日 36 条

4月28日星期二

X · @dotey(宝玉)

GitHub Copilot 6 月 1 日起改按用量计费,重度用户账单会变不确定

GitHub Copilot 从 6 月 1 日起取消“高级请求次数”,换成 AI 积分(AI Credits),按输入、输出和缓存的 Token 消耗来扣费。各档订阅价格没变,Pro 每月给 10 美元积分,Pro+ 给 39 美元,但积分花完就没了,不再像以前那样能降级到便宜模型继续用。代码补全和“下一步编辑建议”这类基础功能不消耗积分。企业用户 ...

推荐理由:这条消息对用 Copilot 写代码的人影响很直接:订阅价没涨,但计费逻辑从包月变成了按 Token 消耗扣积分。Pro 每月给 10 美元额度,Pro+ 给 39 美元,超出部分怎么收费正文没写,这是个信息缺口。最该盯的是 Copilot Agent 跑长任务的消耗——这类任务 Token 用量大,账单可能跳涨,但具体费率还没公布,先别急着算账。整体判断挂在成本变化和缺失的费率信息上,分数维持 80 合理。

X · @dotey(宝玉)

Cursor 3 用户反馈:别光顾着炫,先把 Agent 和 IDE 无缝焊在一起

Eric Zakariasson 的 Cursor 3 反馈帖收到 431 条回复,核心诉求不是更花哨的界面,而是一个稳定可靠的 AI 开发工作台。用户最强烈的意见是:Agent Window 不能牺牲 IDE 基本能力,进去之后 LSP、调试、终端、diff 操作经常要切回旧界面,理想状态是 Agent 推进工作,人随时能无缝接管。多 Agent 和...

推荐理由:三条都过:431 条回复量够大,需求提得具体,而且正好打在开发者对 AI 工作台的焦虑点上。放在 featured 低段是因为这是用户反馈汇总,不是 Cursor 官方发布或路线图,信息增量有但权威性打折。

4月27日星期一

Dwarkesh Patel 播客

周末杂想:算力垄断、智能与权力的混淆,以及科学验证的困境

Dwarkesh 抛出了一堆他没想明白的 AI 问题。首先是算力分配:全球超过 70% 的 AI 算力握在五家云厂商手里,其中大部分还优先供给了 OpenAI、Anthropic 和 Google DeepMind 三家。他担心普通人会被高价挤出 AI 红利,并追问全民基本算力该怎么搞。其次是模型进步的本质,他搞不清长周期编程智能体到底靠什么突破,也质...

推荐理由:Dwarkesh这期没给实验结论,就是扔了一串开放问题。我会先打个折,因为正文没披露五家厂商占七成算力的数据来源,这点先别太激动。但他把长程编码Agent、KV缓存内存取舍、训练和推理合并这些技术点揉在一起问,确实让人想接着翻答案。真正值得盯的是算力怎么分、模型能不能在线学、以及‘智能’和‘权力’的定义怎么重新划——这些比论文摘要更贴近一线焦虑。没有产品发布或政策变动,所以分数停在评论类的中上区间。

TechCrunch · AI

中国否决 Meta 收购 Manus,20 亿美元交易被要求撤销

中国发改委叫停了 Meta 对 Manus 的收购,要求双方把交易退回去。Manus 是一家做 AI 智能体的公司,创始团队是中国工程师,后来搬到新加坡,去年底被 Meta 以 20 亿美元买下。这次审查持续了几个月,但官方没给具体理由,也没说依据哪条法规。对 Meta 来说,这笔交易直接关系到它让 AI 模型进业务流程干活的布局,现在被打断,后续怎么...

推荐理由:HKR 三项全中:中国在长达数月的调查后,否决了 Meta 对 Manus 的 20 亿美元收购。正文没披露具体监管依据、时间线和 Meta 的下一步,所以重要性给 88 而不是 90 以上。

Hacker News 首页

Dirac 这个开源编程助手在 TerminalBench 上拿了第一,靠的是省 token 和并行操作

Dirac 是一个专门抠上下文效率的编程助手,刚在 TerminalBench 上跑分拿了第一,用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%,主要靠三招:用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

推荐理由:HKR 三项都站得住:一个开源编程智能体声称在 TerminalBench 上拿了第一,还给出了具体模型和成本降幅,技术细节也没藏着。不过分数我压到 78,因为目前只有仓库自述,完整榜单分数和复现日志都没放出来,先别太激动。

Mistral AI

Mistral AI 发布 Workflows 公开预览版

Mistral AI 发布企业 AI 编排层 Workflows 公开预览版,提供持久化执行、可观测性和人工介入审批能力,ASML、ABANCA、CMA-CGM 等客户已用于自动化关键流程。

推荐理由:原文给出 Workflows 的编排能力、部署模型与客户案例,可据此判断企业级 AI 流程落地的工程门槛。

新智元 · 公众号

首个时空时序推理框架 STReasoner:让大模型读懂“什么时间、在哪、发生了什么”

埃默里大学和微软等团队搞了个 STReasoner,专门教大模型做时空时序推理,比如预测交通流量、分析疫情传播趋势。他们配套出了 ST-Bench 测试集,覆盖预测、异常检测、因果分析和问答四类任务。训练上用了网络随机微分方程加多智能体协作来造数据,再走对齐、带思维链的监督微调、以及 S-GRPO 强化学习这套流程。文章说推理成本只有闭源模型的千分之四...

推荐理由:我会先打个折:标题里的“首个”要看跟谁比,正文没给出对比范围,这点先别太激动。但文章本身干货不少——Emory和微软搞了个STReasoner,专门教大模型看懂带时间和空间标签的数据,比如交通流量、天气网格。他们自己搭了个ST-Bench测试集,分四类任务来考模型。训练上用了网络随机微分方程加多智能体生成对齐数据,再分三步训,最后用S-GRPO强化学习收尾。最实在的数字是推理成本只有闭源模型的千分之四,代码也放出来了,想试的人可以直接跑。对做时空预测、智慧城市那拨人来说,这是个能上手的新工具。

量子位 · 公众号

斯坦福等团队搞了个“用大模型当验证器”的方法,在 Terminal-Bench 2.0 上跑分超过 Claude Mythos 和 GPT-5.5

斯坦福、伯克利和英伟达一起发了个叫 LLM-as-a-Verifier 的方案,简单说就是让一个大模型去检查另一个模型干活时的“解题步骤”,挑出最靠谱的那条路径。他们用了三招:打分细到 token 级别、同一件事反复查、把评判标准拆开看,最后在 Terminal-Bench 2.0 和 SWE-Bench Verified 两个榜单上都拿了第一。其中 ...

推荐理由:我会先打个折:这还是个基准测试的研究发布,不是模型或产品大更新,所以分数放在这个区间。但钩子够强——斯坦福、伯克利、英伟达联名,Transformer作者转发,验证智能体这件事本身又是当前工程落地的痛点。信息量也扎实,token级评分、重复验证、标准分解这些机制都给了具体数字,不是空泛的“新框架”。读者看完能立刻判断要不要跟进实验。

量子位 · 公众号

DeepSeek V4 永久降价,缓存命中再打一折,实测编程成本降了 83%

DeepSeek V4 两天内连续降价,输入和输出价格直接砍掉 75%,缓存命中的输入还能再打一折。量子位的编程实测里,处理 3500 万 token 的成本从 31.73 元掉到 5.34 元,降了 83%。这个价格对缓存命中率高的场景最划算,V4-Pro 的缓存命中率大概在 95% 到 96%。

推荐理由:HKR三项都站得住:降价幅度和两次调价节奏有话题性,实测数据让便宜可验证,成本敏感型从业者会立刻对标自己的用量。不过它本质还是定价更新,不是新模型发布,所以分数没往上拉。

量子位 · 公众号

Meshy 用户破千万后开始做 3D 打印实物,ARR 一年翻了 14 倍

Meshy 的注册用户超过一千万,ARR(年经常性收入)做到 4000 万美元,2025 年收入同比翻了 14 倍。他们新推的 Meshy Creative Lab 能直接生成钥匙扣、冰箱贴、键帽这类小物件的 3D 模型,但正文没披露实物下单功能是否已上线。一个值得留意的数据是:他们测了 75 个模型,在拓竹切片软件里的切片通过率达到 97%,说明模型...

推荐理由:Meshy 这次更新不是画饼,是拿钱和打印通过率说话。我会先打个折:实物订购还没上线,正文只说“进入倒计时”,这点先别太激动。但 97% 的切片通过率对 3D 打印玩家是实打实的省事信号,说明模型不是只能看,真能打。ARR 年翻 14 倍也侧面印证头部厂商已经在买单,不是靠免费用户撑场面。整体是垂直 3D AI 产品的一次公司自曝数据更新,信息量够,但没到行业地震级别,放在 featured 低位合理。

Hacker News 首页

Chrome 内置 Prompt API:在浏览器里直接跑大模型

Chrome 给开发者提供了一个 Prompt API,让网页可以直接调用浏览器内置的 AI 模型来生成文本,不用把数据发到云端。这个 API 还支持会话管理(保持多轮对话上下文)和结构化输出(让模型按固定格式返回结果,方便程序解析)。文档里没写具体用的是什么模型、上下文窗口多大、收费不收费,也没提什么时候能正式上线。目前看起来还在早期试验阶段,适合想...

推荐理由:Chrome 把 AI 塞进浏览器里,网页调个 API 就能用,这个入口变化挺大。会话管理和结构化输出两份配套文档让方案看起来不是空壳,但正文没提模型规格、上下文窗口多大、要不要付费、什么时候正式上线,所以我会先打个折,放在 featured 里偏低的位置。

机器之心 · 公众号

ACL 2026 论文:给 AI 发个波浪号,它可能把你的主目录删了

这篇被 ACL 2026 接收的论文专门研究了表情符号对 AI 的语义干扰。团队拿 6 个模型测了 3757 条样本,平均混淆率 38.6%,而且超过九成出错时模型不会吭声,直接静默执行错误指令。最要命的是在 agent 干活的环境里,你让模型“忽略表情符号”的提示词效果很有限。正文没披露具体是哪些模型,也没说测试用的 agent 框架和任务场景,所以...

推荐理由:ACL 2026 这篇安全研究 HKR 三项全中:钩子用一个波浪号删主目录,够直接;3,757 用例、6 模型、38.6% 混淆率和 90%+ 静默失败,数据不虚;真正要命的是 Agent 场景,符号混进执行链后模型一声不吭就动手。不是模型发布或平台事故,纯研究,放在 78–84 分段合理。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

Hacker News 首页

停止招新人,你的资深工程师就会反过来拿捏你

Justin Smestad 算了一笔账:如果公司从 2026 年起不招初级工程师,到 2030 年就会养出一支全是贵价老兵的团队,而且毫无还价能力。逻辑很简单——一个资深工程师可以开口要 40% 的涨薪,如果公司没有培养了两年的后备梯队,替代他可能要花六个月,还得按更高的市场价招人。初级员工不只是干杂活,他们是未来的中坚力量,是薪资谈判时的保险。文章...

推荐理由:这篇不是讲模型或产品,是一篇个人评论,但把账算得很清楚。核心逻辑是:你现在省掉初级人头,两年后高级工程师开口要 40% 涨薪,你连个能顶上来的中级都没有,外面招人还得搭进去半年。我会先打个折,因为 40% 和 6 个月这些数字正文没给出处,更像经验估算。不过它提醒了一件容易被季度报表掩盖的事——用 AI 代理替掉初级岗,省的是工资,多出来的可能是组织断层和议价权转移。对在看人效和 AI 落地的团队,这个视角值得扫一眼。

4月26日星期日

Hacker News 首页

别把 AI 代理当同事,把它嵌进你的软件里

Feldera 的联合创始人 Gerd Zellweger 认为,现在流行的 AI 代理(比如那些帮你写代码、查问题的机器人)太像人了:爱解释、爱总结、需要来回对话,用起来很累。他提出应该把代理嵌入现有软件,让它安静地在后台干活。文章给了三种已知的集成模式:命令行接口(CLI)、声明式配置(告诉系统要什么结果,别管步骤)、以及像 Kubernetes ...

推荐理由:这篇文章是 Feldera 联合创始人的工程观点,不是产品发布或一手评测,但把 Agent 嵌入软件的三种模式讲得清楚。我会先打个折,因为正文没给出实际部署数据或对比实验,更像架构主张。不过它把“Agent 解释新信息,数据库引擎持续执行逻辑”这个分工点透了,对正在纠结 Agent 交互形态的从业者有参考价值,所以放在 featured 里。

TechCrunch · AI

Anthropic 搞了个内部跳蚤市场,让 AI 替员工砍价买卖

Anthropic 在公司内部做了个叫 Project Deal 的实验:69 名员工每人领 100 美元预算,让 AI 代理替他们在二手市场里买卖真实物品。最终成了 186 笔交易,总金额超过 4000 美元。实验同时跑了四个市场,分别用不同水平的模型。用更聪明模型代理的用户,成交结果确实更好,但用户自己没感觉出来——Anthropic 管这叫“代理...

推荐理由:HKR 三项都站得住:Anthropic 搞了个内部代理交易市场,有预算、有成交笔数、有成交额,还分了四个不同模型的市场来对比。分数维持 82 分,因为这只是内部测试,不是公开产品或模型发布,我会先打个折。实验发现高级模型带来更好结果但用户没察觉差距,这点先别太激动,正文没披露交易的具体品类和失败率,验证还弱。

4月25日星期六

Hacker News 首页

AI 代理的故事里缺了什么:不是模型能力,是信任边界

Mark Nottingham 直接戳破了“AI 代理为你工作”这个说法。他列了 8 个互联网信任崩塌的真实案例,其中一个是微软新版 Outlook 会偷偷把第三方邮箱密码传到自家云端,再分给 700 多个数据伙伴。核心问题不是模型不够聪明,而是我们根本没想清楚:当软件能替你做事时,它到底在替谁做事。文章没给技术方案,但把“委托边界”这个被忽略的前提摆...

推荐理由:HKR 三项都成立,但这是署名评论而非模型或产品发布。Mark Nottingham 在 Web 协议领域的权威加上 Hacker News 上的讨论热度,让它够得上 featured 门槛,但到不了 P1。

Hacker News 首页

Stash 开源了一个 AI 记忆层,让任何智能体都能记住你是谁、聊过什么、踩过哪些坑

Stash 是一个开源的持久化记忆层,用 PostgreSQL 加 pgvector 做存储,给 AI 智能体配了 28 个 MCP 工具和一套 6 步处理流水线。它跟外挂资料库(RAG)不一样:RAG 只会翻文档,Stash 会从对话里自动提炼事实、建知识图谱、跟踪目标和失败记录,还能发现前后矛盾的地方。记忆按层级命名空间分桶,用户、项目、智能体自省...

推荐理由:我会先打个折:这是个独立开发者的开源基础设施项目,不是大厂或平台级发布,所以分数停在 featured 低段。但 HKR 三项都站得住。钩子不是“像 ChatGPT 一样记住你”的标题党,而是把记忆层做成可移植的中间件,任何 agent 都能接。正文给了足够的技术细节,28 个工具、6 个阶段、pgvector 存储和命名空间隔离,架构看得见。对 agent 开发者来说,长期记忆、上下文成本和供应商锁定是实打实的痛点,这个项目直接回应了这些需求。

Computing Life · Share · 鸭哥调研

Anthropic 让自家客户端跑别家模型,反常让步背后在赌什么

Anthropic 在 Claude Cowork 里加了个开关,让你能换成 GPT-5.5、Gemini 3.1 Pro 或 DeepSeek V4 来跑任务。这件事没开发布会,但跟它一个月前切断第三方客户端蹭自家订阅的动作连起来看,方向很明确:Anthropic 认为客户端才是粘性,模型是过路货。更反常的是,走这条路 Anthropic 既收不到订...

推荐理由:我会先打个折:来源非官方,Cowork 用户基数也小,所以没给更高分。但这条消息的钩子很强——让自家产品跑别家模型,还明确不收过路费,数据也不经手,这比单纯发个新功能更值得盯。文章把 AWS、Google、微软在 agent 运行时上的布局串起来,点出了模型层和基础设施层的博弈,对从业者判断生态走向有帮助。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 做生意的三个实验:从一台冰箱到一个市场

Anthropic 的 Frontier Red Team 在一年里做了三个实验,把真钱和真决策权交给 Claude。第一站是台迷你冰箱,Claudius 经营一个月亏了几百美元,还幻想出不存在的人、把自己当真人。第二站升级了工具和模型,加了 CEO 智能体,开始赚钱,但同模型互相监督带着同样的盲区,CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

推荐理由:这篇文章把 Anthropic 三个商业实验串成一条线,从冰箱到市场,Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据,不是空谈 agent 概念。我会先打个折:正文没披露实验是否可复现、样本量是否够大,但就现有信息看,它对正在考虑让模型进交易流程的团队有直接参考价值,所以放在 featured 档。

Hacker News 首页

数据库没为 AI 代理这波操作做过设计

Arpit Bhayani 指出,让 AI 代理直接操作数据库,会同时打破我们过去四十年默认的四条规矩:查询是写死的、写入是有人审核过的、连接是短暂的、出问题有人盯着。他给 PostgreSQL 开了几剂具体药方:给代理用的数据库角色加上 5 秒语句超时和 10 秒事务空闲超时;全面改用软删除,并记录是谁删的、为什么删;对关键数据只追加不修改,靠事件日...

推荐理由:我会先打个折,这篇文章不是模型发布或产品更新,属于工程评论,所以分数放在 72–77 这个区间合理。但它的切入角度很刁,把数据库的老规矩和智能体的新行为直接对撞,而且给了能落地的 Postgres 防护参数,对正在让智能体进业务流程的团队来说,这些坑和补丁比泛泛而谈的安全建议有用得多。正文没给出大规模压测数据,所以别指望它能证明这些配置在生产环境扛不扛得住,但作为一份“把 agent_worker 当不可信调用方”的实操清单,价值够了。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

X · @dotey(宝玉)

Cursor 3 加了 /multitask,能让多个子智能体同时干活,不用排队等

Cursor 3 新出的 /multitask 命令,可以同时跑好几个异步子智能体,不用像以前那样一个任务做完才能开始下一个。已经在排队里的任务也能随时切成并行模式。帖子没提同时能跑几个、吃多少资源、一个崩了会不会带崩其他的。

推荐理由:这次更新解决的是 Cursor 里一个挺烦人的瓶颈——以前子任务只能串行,现在能并行跑了,排队中的任务也能随时切模式。我会先打个折:正文没披露并发上限、资源占用和失败回退机制,所以实际能并行多少个、会不会吃满内存、一个子任务崩了怎么收场,都还不知道。但光是把串行改并行这一点,对日常编码吞吐的提升就够实在,所以放在 featured 低位。

Hacker News 首页

我用 Claude Code 定时任务自动盯家庭财务,每天一封邮件汇报资产和异常

作者 Matt May 用自己写的 Driggsby MCP 服务器接上 Plaid 拉银行和投资账户数据,再配合 Claude Code 刚出的 routines 功能,搭了一套每天自动跑的财务看板。他之前用 Codex CLI 写脚本抓数据,经常因为网页渲染变化或二次验证挂掉,后来干脆花了两个月、写了约 7.5 万行 Rust 代码做成 Drigg...

推荐理由:这是一篇扎实的一手实践记录:用 Claude Code routines 接 Plaid 做财务监控,因为 Gmail 接口只能写草稿,作者自己加了个受限的 email_me() 工具来发纯文本邮件,还定了近 7 天信用卡异动和单日超 500 美元告警的规则。HKR 三项都站得住,但本质还是个人产品博客,不是实验室或平台级发布,所以放在 featured 档。

X · @AnthropicAI

Anthropic 让 Claude 在旧金山办公室搞了个内部跳蚤市场,替同事买卖和砍价

Anthropic 发了个新研究叫 Project Deal。他们在旧金山办公室搭了个内部交易市场,让 Claude 替同事买东西、卖东西、谈价格。正文没披露用了哪个模型版本、市场有多大、成交了多少单,也没说最后是赚了还是亏了。这点先别太激动,目前看更像一个内部行为实验,不是产品发布。

推荐理由:这条能上 featured,靠的是 H 和 R 两项:Anthropic 自带关注度,让模型替同事谈办公室交易又天然有讨论性。我会先打个折——正文没给实验规模、模型版本和结果指标,K 项偏弱,所以分数停在中间档。

4月24日星期五

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

TechCrunch · AI

Meta 签下数百万颗亚马逊自研 CPU,这次不是 GPU,是给 AI 智能体跑业务用的

Meta 和亚马逊达成了一笔大单,要采购数百万颗亚马逊自研的 Graviton CPU,专门用来跑 AI 智能体(agentic AI)的工作负载。注意,这里说的是 CPU,不是训练大模型常用的 GPU。这信号挺有意思:以前大家抢 GPU,现在连 CPU 都开始为 AI 智能体这种新任务大量铺货了。不过正文没披露具体是 Graviton 哪款芯片、单价...

推荐理由:这条消息我会先打个折,因为正文没披露具体型号和金额,没法算性价比。但“几百万颗 AI CPU”这个量级本身就在说一件事:agent 负载开始推高非 GPU 芯片的采购。Meta 这种体量的公司用 Amazon 的 CPU 跑 agent,至少说明他们在认真找 GPU 之外的推理方案,而且敢下大单。这点先别太激动,毕竟没看到实测数据,但如果后续有部署细节和性能对比,这条线值得一直盯着。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...

Latent Space

GPT 5.5 和 OpenAI Codex 超级应用

OpenAI 发了 GPT-5.5,在 ChatGPT 和 Codex 里能用了,但 API 还要等安全加固。模型在 Terminal-Bench 2.0 上拿了 82.7%,SWE-Bench Pro 58.6%,API 支持 100 万 token 的上下文窗口。更值得看的是 Codex:内置浏览器操控,还把之前停掉的 Prism 功能并了进来,O...

推荐理由:OpenAI 发了 GPT-5.5,先在 ChatGPT 和 Codex 里上线,API 因为安全措施要等一等。跑分方面,Terminal-Bench 2.0 拿了 82.7%,SWE-Bench Pro 58.6%,API 上下文给到 1M token,算是能装下一整套代码库的水平。但真正值得盯的是 Codex 这边:浏览器控制能力和 Prism 合并,摆明了要做桌面端的超级入口,不只是聊天或写代码,而是直接操作你的电脑。这点先别太激动,正文没披露实际可用性和权限边界,但方向很明确——OpenAI 想把模型塞进业务流程里干活,而不只是当顾问。

X · @dotey(宝玉)

DeepSeek 发了 V4 预览版并开源,百万上下文直接标配,不再分版本加价

DeepSeek 放出了 V4 系列模型的预览版,代码也同步开源。这次最实在的变化是,百万 token 的上下文窗口成了所有官方服务的默认配置,Pro 和 Flash 两个型号都一样,没有高价门槛。V4-Pro 是旗舰,推理能力追平了顶尖闭源模型,世界知识得分仅次于 Gemini-Pro-3.1;V4-Flash 是轻量经济版,推理接近 Pro,但知识...

推荐理由:DeepSeek 是国内头部的模型厂商,这次 V4 预览版把百万上下文做成全服务标配并开源,属于实质性发布。HKR 三项都满足:正文有机制解释和迁移截止日期,而且这种定价策略的调整让它值得当天就作为 P1 处理。

X · @op7418(歸藏)

DeepSeek V4 发了公告:Pro 版 1.6T 总参数量但只激活 49B,Flash 版更轻量,预训练都喂了 32T 数据

DeepSeek 放出了 V4 的官方说明。这次分两个版本:Pro 版总参数量 1.6 万亿,实际干活时只激活 490 亿参数;Flash 版总参数量 2840 亿,激活 130 亿参数,两个版本预训练都用了 32 万亿 token。网页和 App 里的“专家模式”对应 Pro,“快速模式”对应 Flash。官方说多项跑分跟 Opus 4.6 打平,A...

推荐理由:这是 DeepSeek 的旗舰发布,分量跟美国头部实验室发新模型看齐。HKR 三项都站得住:公告里参数规模、训练数据量、新注意力机制这些硬信息都有,也直接拿 Opus 4.6 做对比,对从业者选模型和算成本都有参考价值。不过摘要没提评测具体怎么跑的、定价和 API 开放时间,这些缺口让我对 benchmark 那部分先打个折。

Computing Life · Share · 鸭哥调研

Skill 是天生带自杀基因的产品

作者认为 Anthropic 的 Skill 形态没法独立做成付费产品。直接卖文件会被零成本传播,PromptBase 跑了三年估算年收入才五百万美元;做成托管服务本质是卖服务器,不是卖 skill;做成 API 引流工具又只是免费营销物料。更深层的问题是,skill 把使用知识从隐性变显性,消灭了培训、咨询等原有价值链的盈利空间,自己却因为明文复制成...

推荐理由:我会先打个折:这不是 Anthropic 的新发布,是一篇评论,所以重要性停在 featured 档。但它的判断很锋利——作者不跟你绕弯子,上来就说 Skill 天生带“自杀基因”,然后一条条拆直售、托管、API 引流为什么都是死路。数字也留得有用,比如 Snyk 审计发现 13.4% 的 skill 有严重安全问题,这比空谈风险更有说服力。真正让我觉得值得推荐的是它把视线从 artifact 这种静态产出挪开,提醒你盯紧收费点正在往关系、此刻、物理责任和判断上转移。正文没给出 Skill 官方定价或分成政策,但靠公开数据和逻辑推演,已经把悲观结论...

Hugging Face 博客

DeepSeek-V4 发布:百万 token 上下文,这次是给干活用的 agent 准备的

DeepSeek 发了 V4,分 Pro 和 Flash 两个版本,都支持 100 万 token 的上下文窗口。Pro 版总参数 1.6 万亿,每次推理激活 490 亿;Flash 版总参数 2840 亿,激活 130 亿。跑分不是最顶尖的,但这不是重点。真正的改进在推理成本上:跟 V3.2 比,Pro 版处理单个 token 的算力只要 27%,K...

推荐理由:DeepSeek-V4 是国产旗舰模型更新,Pro 版 1.6T 总参、49B 激活,Flash 版 284B 总参、13B 激活,都支持 100 万 token 上下文。最值得看的是成本:Pro 单 token 计算量只有 V3.2 的 27%,KV 缓存降到 10%;Flash 更狠,分别只有 10% 和 7%。这意味着跑长上下文 agent 时显存和算力开销大幅缩水,不是光喊口号。HKR 三项全中,放在当天必读档没问题。

阮一峰的网络日志

第二次 API 开放浪潮

阮一峰在周刊里聊了一个正在发生的趋势:大模型能干活了,逼着各种平台重新开放 API。15 年前那波 API 开放没跑通,因为平台发现数据给别人用了,自己插不上广告,最后都缩回围墙花园里。但 2025 年下半年大模型达到生产可用水平后,逻辑变了——AI 要自动化执行任务,就必须能调用外部平台,没 API 就进不了 AI 工作流,用户会直接转向有接口的竞品...

推荐理由:阮一峰这篇周刊判断,2025 年下半年大模型开始真正进业务干活,会触发第二次 API 开放浪潮。核心逻辑是 Agent 不能光说不练,得调用外部服务才能完成动作,所以微信这类消费级平台的接口开放比云服务 API 更值得盯。文章给了腾讯开放微信接口、MCP 和 Skill 成为常见接入机制这些具体信号,不是空谈趋势。不过正文没给出这次“浪潮”的量化数据或开发者采用率,更像一个基于现象的预判,所以重要性我打个折,放在 76 分。

The Verge · AI

Claude 开始直连你的 Spotify、Uber Eats 和 TurboTax 了

Anthropic 给 Claude 加上了个人应用连接器,首批接入 Spotify、Uber、AllTrails、Instacart 和 TurboTax 这类日常服务。连上之后,你在聊天里提需求,Claude 会主动推荐用哪个 App 来办——比如想找徒步路线,它就直接调 AllTrails。这标志着 Claude 从办公场景正式踏进个人生活消费的...

推荐理由:这条给 Anthropic 加的是正向分:产品更新有料,但不是模型发布。HKR 三项全过——个人应用连接器本身就是强钩子,文章证实了对话内调用,而且这事直接打在助手入口的争夺上。正文没提首批覆盖多少应用、哪些地区能用、要不要付费订阅,这些缺口让判断得打个折,但方向没错。

X · @dotey(宝玉)

Anthropic 给 Claude 托管智能体加了记忆功能,用文件系统存经验,不用向量库

Anthropic 把记忆功能做进了 Claude 托管智能体,现在公测。智能体能把之前会话里学到的经验存成文件,下次干活直接读,不用每次从头教。实现方式很朴素:记忆就是文件系统上的文件,智能体用 bash 和代码能力直接读写,开发者也能通过 API 导出或回滚。权限上支持多智能体共享,可设只读或读写,并发访问不冲突,所有改动有审计日志。Rakuten...

推荐理由:Anthropic 给 Claude 托管智能体加了跨会话记忆,目前公测。亮点是没上向量数据库,直接用文件系统接 bash 和代码执行链路,权限、审计、回滚都给了。两个用户数字挺硬:Rakuten 出错率砍掉 97%,Wisedocs 提速 30%。不过范围还锁在托管智能体 beta 版,所以重要性给 83,放 featured。

X · @claudeai

Claude 托管 Agent 的记忆功能开始公测,Agent 能跨对话记住上下文了

Claude 给托管 Agent 加了个记忆层,现在你的 Agent 可以从每次对话里学东西。官方说法是“智能优化的记忆层”,在性能和灵活性之间找平衡。但正文没披露记忆容量有多大、能记多久、怎么收费、哪些账号能用。对从业者来说,关键看两点:一是持久记忆什么时候变成默认配置,二是这会让 Agent 的评测和状态管理怎么变。

推荐理由:Claude 给托管代理加了记忆,这是个实打实的产品更新,对做代理的人吸引力够强,所以 H 和 R 都站得住。但公告信息量太薄,关键参数一个没给,K 这块只能打折扣,整体够不上 p1,放在 featured 低段比较合适。

彭博科技

旧金山一家店让 AI 当 CEO,结果蜡烛订太多了

旧金山 Cow Hollow 的 Andon Market 把选品和定价交给一个叫 Luna 的 AI agent 来管,标题直接说它蜡烛订多了。正文没披露具体多订了多少、是哪个环节出错、亏了多少钱、后来怎么补救。能确认的是,这家店真的把零售运营的决策闭环交给了 agent,而不只是拿 AI 做辅助分析。

推荐理由:Bloomberg 报道了旧金山一家便利店让 AI 代理 Luna 管选品和定价,标题说它蜡烛订多了。我会先打个折,因为正文没给具体数字——超采量、触发逻辑、亏了多少钱、怎么补救,这些全没写。但真正值得盯的不是店里卖什么,而是闭环经营权限已经交出去了,代理能直接下单,这比实验室跑分更说明风险。信息缺口让这件事停在 featured 低段,但话题性够强。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。