跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 161–180 条 · 共 1,195 条

9月3日星期四

Latent Space

Meta 的 Muse Spark 1.3 性能追上 GPT-5.6-Sol,训练费打一折

Meta 发了新模型 Muse Spark 1.3,在 AAII 榜单上冲到全球第三,直接对标 OpenAI 和 Anthropic 的最强模型。扎克伯格说这是他们在写代码和让模型进业务流程干活上进步最大的一次,还承诺会开放模型权重。定价挺狠:如果你同意把自己的数据拿去训练,费用能砍掉 90% 以上。另外,斯坦福开了两门教怎么从零搭建 AI 智能体的新...

推荐理由:Muse Spark 1.3 在 AAII 上排到第三,直接对标 GPT-5.6-Sol,扎克伯格还承诺开放权重,训练费能打一折以下。这是 Meta 头一回在主流榜单挤进第一梯队,开源这边的牌桌要重新洗牌。没给满分是因为正文没披露模型参数量、推理成本和具体开放时间表,这些缺口让实际落地效果还得再观察。

Computing Life · Share · 鸭哥调研

改完代码自己定闹钟盯 CI:OpenAI 源码里的自唤醒机制

OpenAI 在 8 月底合入开源仓库的一份系统提示模板,透露了 Codex Persistent mode 的真实运作方式:它不是 24 小时常驻进程,而是一个每 1 到 3 分钟唤醒、检查、再休眠的循环。每次睡下前,模型必须记下目标、当前状态、收工条件和下次检查时间,醒来后自己判断该干什么。一条硬规矩是持续运行不扩大授权范围,超出权限必须先请示。W...

推荐理由:信息密度高,有开源仓库的源码依据,把唤醒-检查-休眠的循环和授权范围限制这两点讲清楚了。扣分是因为这是对模板的解读,不是官方发布,实际产品体验未知。

Computing Life · Share · 鸭哥调研

智能体 token 用量超人类 5 倍,但缓存打折后实际账单只多 1 倍

OpenRouter 数据显示智能体每周消耗 7.3 万亿 token,名义上是人类用量的 5.2 倍。但这 5.2 倍里 70% 到 85% 是缓存读取,模型服务商对这部分只收原价的一折左右,所以实际账单大概只多出 1 倍。这个数字只能代表 OpenRouter 一家平台,它的流量只占全球推理量的 1%,而且区分人类和智能体的算法权重没公开,没法复现...

推荐理由:三条消息打包,但核心价值在第一篇:终于有人把智能体名义 token 消耗和缓存打折后的真实成本拆开算了,结论是实际账单大概只翻了一倍。OpenAI 芯片跑分和 GitHub 文档压缩原型是附赠信息,密度稍低。跨源聚合的编辑判断清晰,没有硬吹。

Hacker News 首页

AI 编程助手不会在烂代码里迷路,所以人不再有重构的冲动

作者 Rodrigo Rosenfeld Rosas 发现一个趋势:团队里经验丰富的工程师也慢慢不推重构了。问题不出在 AI 写的代码质量,而是过去有个关键信号——人一旦在错综复杂的代码里跟丢逻辑,就会停下来喊“这摊子没法管了,得先重构”。这个信号是保持系统长期可维护的重要防线。AI 编程助手没有人类的上下文限制,它能在乱成一团的代码里继续加分支、加特...

推荐理由:这是一篇从业者的尖锐观察,不是又一篇泛泛讨论 AI 代码质量的稿子。它指出了一个被忽略的机制:AI 移除了人类在逻辑纠缠时本能喊重构的信号。角度新鲜,机制具体,共鸣感强——但毕竟是一篇个人博客,不是经过验证的研究,所以我会先打个折,不把它当成定论,但值得让同行看到这个提醒。

Hacker News 首页

Meta 发布 Muse Spark 1.3,专为让模型进业务流程干活和编程竞赛调优

Muse Spark 1.3 主要干两件事:一是处理长链条的智能体工作流,能记住上下文、自己调用工具,碰到模糊指令会主动反问;二是编程能力向顶尖模型看齐,首次生成代码的正确率更高,减少来回修改的次数。它原生支持看懂视频、图片和文档,视觉推理是在真实执行环境里跑的,不是按固定脚本走。价格分两档:标准版输入每百万 token 1.25 美元,输出 4.25...

推荐理由:Meta 发了 Muse Spark 1.3,主打长链条智能体任务和编程能力,还给了明确价格。作为大厂的主力模型更新,话题性够,但正文没放任何跑分数据,也没说清楚“向顶尖模型看齐”到底跟谁比、怎么测的,所以我会先打个折——重要,但技术细节还缺口气。

Hacker News 首页

Meta 发布 Muse Spark 1.3:更会写代码、更擅长处理长流程任务

Meta 今天在 Muse Code 和自家 API 上线了新模型 Muse Spark 1.3。它主要强化了两件事:一是写代码和当“数字员工”干活的能力,二是处理那种步骤多、容易跑偏的长任务。具体来说,这个模型现在会在指令模糊时主动问你,卡住了会求助,要执行重要操作前会先跟你确认。跑分上,它在智能体、编程、指令遵循和长文本理解这几个项目里,都超过了自...

推荐理由:Meta 发了 Muse Spark 1.3,主打写代码和当数字员工干活,跑分在几个关键项上压过了 GPT 5.6。我会先打个折——这还是个迭代版本,不是新架构,而且最高推理模式正文没细说,所以没给到 85 分以上。但三个交互机制(反问、求助、确认)让智能体部署更靠谱,对从业者来说信息量够,值得放在 featured 位置。

AI HOT 精选

GitHub Copilot 用偏好训练的小模型当“路由器”,把 AI 编码成本砍到三分之一

GitHub 发了一篇工程博客,讲他们怎么把 Copilot 的 AI 编码成本降到原来的三分之一左右,同时任务质量没明显下降。核心做法是训练了一个 18 亿参数的小模型当“路由器”:它看 1040 组偏好样本,学会判断一个请求该交给便宜的小模型,还是该叫更强的模型来救场。上线后,强模型的调用量直接少了 70%,整体延迟控制在 11 秒以内。文章里还提...

推荐理由:GitHub 这篇工程博客给出了一个带真实数字和方法的成本优化方案,对正在落地 AI 编码的团队有直接参考价值。分数没给更高是因为它属于工程优化,不是新模型发布,但 70% 的调用削减和三分之一成本下降这两个数据足够硬,值得放进精选。

Hacker News 首页

同一个模型套 9 种外壳,跑通一次的成本差了 17 倍

Runta 用 Kimi K3 模型跑了 12 套不同的编程助手配置,总共 360 次测试,每次都是从完全相同的初始环境冷启动。Codex 通过率最高,66.7%,每次任务成本 3.47 美元;Exo Harness 最省钱,每次只要 1.05 美元,但通过率掉到 53.3%;Claude Code 通过率 63.3%,但每次任务要花 18.34 美元...

推荐理由:这篇评测干净利落,控制变量做得很好:同一个 Kimi K3 模型,12 套配置,全部从零冷启动,总共 360 次测试。结论很直观——最贵的 Claude Code(18.34 美元/次,通过率 63.3%)被最省的 Codex(3.47 美元/次,通过率 66.7%)反超,成本差了 17 倍。没给更高分是因为这只是一篇博客,不是长期追踪的榜单,样本量也有限。但就单次实验来说,信息量够硬,对选工具的人很有参考价值。

9月2日星期三

AI HOT 精选

Cursor 推出自托管执行机:AI 编程助手现在能直接在你公司的服务器上干活了

Cursor 的云智能体现在可以在你公司自己的机器上执行操作了。以前,智能体从思考到动手全在 Cursor 的云端完成,现在你可以把“动手”这部分挪到内网服务器上。做法是在你的机器上装一个叫 worker 的小程序,它会主动和 Cursor 云端保持一条加密连接,等着接任务。这样智能体就能直接访问你公司内部的代码库、私有服务,或者用上 GPU、Mac ...

推荐理由:Cursor 这次把云智能体的执行层从自己机房拆出来,让企业装个 worker 就能在内网跑任务。架构上确实动了真格,不是小修小补。不过刚发布,还没有用户实际验证的数据,所以分数先不打太高,78 分合理。

Hacker News 首页

Multiverse Computing 发布 Quasar 438B,在欧洲模型里综合得分最高

Multiverse Computing 推出了他们的第一个大模型 Quasar 438B,一个面向企业级智能体和编程的推理模型,支持英语和西班牙语。在 Artificial Analysis 的智力指数上,它拿了 43 分,是目前欧洲模型里的最高分,比 Mistral Medium 3.5 的 30 分和 NVIDIA Nemotron 3 Ultr...

推荐理由:欧洲第一个 438B 推理模型,有具体跑分和对手对比,信号够强。但来源是厂商自述,还没看到独立评测,所以分数卡在 featured 门槛上。

Latent Space

Anthropic 发布 Claude Fable/Mythos 5.1:编程跑分登顶,但输出 token 多了七成

Anthropic 在 9 月 1 日推出了 Claude Fable 5.1 和 Mythos 5.1,主打编程和知识工作。Fable 5.1 在 Terminal-Bench 4.0 上拿到 55.8% 的分数,官方把它定位成能自己跑多步复杂任务的模型。价格方面,缓存读取费砍了 75%,降到每百万 token 0.25 美元,但 Artificia...

推荐理由:Anthropic 发了 Claude Fable/Mythos 5.1,Terminal-Bench 4.0 得分 55.8%,缓存读取价砍了 75% 到每百万 token 0.25 美元,输出 token 上限涨了 70%。能力升级加定价大调整,当天就该写。没给 95 是因为目前只有 Lat 的初步数据,实际表现和稳定性还得等更多反馈。

AI 群聊日报

DeepSeek V4 Flash 实战体感碾压 Sol,Anthropic 发布 Fable 5.1 但被指挤牙膏

群友用 DSH 加 DeepSeek V4 Flash 跑了两个月对比和一周 51 亿 token 的活,结论是实际干活比 GPT-5.6 Sol 舒服。Sol 想太多、输出假大空,V4 Flash 首 token 平均 2.3 秒,总花费才 ¥362.84。有人提出“订阅制健身房悖论”,认为卖月费的 harness 会悄悄限制使用强度,按量付费的才不...

推荐理由:群聊实测数据够扎实——51 亿 token 跑下来才花三百多块,首 token 2.3 秒,成功率接近百分百,对比 Sol 的啰嗦和假大空,结论很明确。但来源是匿名群聊记录,不是官方发布或可复现的基准测试,权威性要打个折。H、K、R 全中,放 featured 没问题。

AI HOT 精选

Qwen3.8-Max-0902 在 Code Arena 网页开发榜拿了第一,$5/百万 token 的价格是目前性价比最高的

通义千问刚发的 Qwen3.8-Max-0902 在 Code Arena 的 WebDev 榜单上首次亮相就拿了 1691 分,排总榜第一。这个分数说明它在网页开发任务上表现很强。更值得看的是性价比:混合价 $5/百万 token,在 Pareto 前沿(就是性能和价格的最优平衡线)上是得分最高的模型。现在 QwenCloud 上就能用。不过正文没披...

推荐理由:Qwen3.8-Max-0902 登顶 Code Arena 总榜,同时把价格压到 $5/百万 token,还占了 Pareto 前沿,属于国产旗舰模型的一次硬核更新,正面信号很强。HKR 全中:登顶制造悬念,具体分数和定价有料,性价比话题直接戳中开发者痛点。

AI HOT 精选

通义千问 Qwen3.8-Max 更新到 0902 版,参数拉到 2.4T,上下文窗口 1M token

Qwen3.8-Max 这次升级主要把参数量堆到了 2.4T,一次能读 1M token 的上下文,差不多是整本《三体》三部曲的量。后训练重点放在写代码和协作任务上,目标是让模型能跑复杂的企业流程、科研项目和长链条工作。正文没给跑分对比,也没提价格,所以实际效果和成本现在还没法判断。

推荐理由:阿里通义千问发了新旗舰 Qwen3.8-Max-0902,参数堆到 2.4T,上下文窗口拉到 1M token,差不多能塞下整部《三体》三部曲。后训练重点在写代码和协作任务上,目标是让模型能扛复杂的企业流程和长链条科研项目。按规则国产旗舰更新给 featured 档。但正文没放跑分对比,也没提价格,实际能打几分、花多少钱现在全不知道,所以分数先稳在这,等后续实测出来再调。

Hacker News 首页

Simon Willison 用 Claude Fable 5.1 跑了五档推理强度的鹈鹕画画测试,最高档花了 3.3 美元画了 14 分钟

Simon Willison 拿他经典的“画一只骑自行车的鹈鹕”提示词,把 Claude Fable 5.1 的五档推理强度全测了一遍。低和中两档几乎没区别,都没显示推理过程,23 秒左右出图,成本约 10 美分。开到 xhigh 档,模型花了 7 分 51 秒、烧了 1.83 美元,细节明显变多。最高档 max 跑了 13 分 54 秒,成本 3.3...

推荐理由:Simon Willison 做了一次很实在的对照实验,把同一句提示词在 Claude Fable 5.1 的五档推理强度下各跑一遍,给出了每档的耗时和花费。低档和中档几乎没区别,23 秒左右出图、成本约 10 美分;开到 xhigh 档细节明显变多,但花了近 8 分钟和 1.83 美元;最高档 max 跑了快 14 分钟、烧了 3.3 美元。这种带具体数字的横向对比比官方公告更有用,从业者可以直接判断自己该选哪一档。分数没给更高是因为这只是一次个人评测,不是模型能力的重大突破。

The Verge · AI

Anthropic 发布 Claude Fable 5.1,做 agent 任务最高便宜 45%

Anthropic 推出了 Fable 5.1 和 Mythos 5.1 两个新模型,主要回应客户对价格、数据保留和过度安全拦截的抱怨。Fable 5.1 性能比 Fable 5 强,但通常便宜约 25%,跑复杂 agent 任务(让模型进业务流程干活)时最多能便宜 45%,省钱的原理是降低了已缓存数据的调用单价。Every 的 CEO Dan Shi...

推荐理由:Anthropic 发 Fable 5.1 和 Mythos 5.1,核心卖点是 agent 场景降价——靠缓存调用单价下调,最多能省 45%。有具体性能对比和定价细节,信号够硬。没给 90 分以上是因为目前只有标题和摘要,缺少实测数据和客户反馈,先打个折。

Hacker News 首页

我用 Fable 把 6.5 万行 Go 代码重写成 Rust,花了 400 美元

作者用 Fable 5 把一个终端编辑器从 Go 迁到了 Rust,总共 6.5 万行代码,API 费用只花了 400 美元。方法分三步:先把代码抽成数据表示(状态机、图、公式),在这层表示上做操作,再让模型按目标语言重新生成代码。Fable 能精确追踪数据流是这套流程能跑通的关键。不过正文没披露编译通过率和测试覆盖率,所以“全自动重写”这个说法我先打...

推荐理由:6.5万行Go转Rust只花400美元,加上中间表示这个巧劲,H和K都够。但正文没披露编译通过率和测试覆盖率,'全自动重写'这个说法得打个折——定在72,刚好踩在featured门槛上。

AI HOT 精选

Claude Fable 5.1 上线,缓存读取降价 75%,长任务里更会主动喊停

Anthropic 把 Claude Fable 5.1 和 Mythos 5.1 一起发了,定价跟 Fable 5 一样,但 API 缓存读取便宜了 75%。模型在长任务里能自己多跑一会儿,卡住了会更早提醒你,写东西也更像人话。正文没给延迟、上下文窗口和跑分数据,所以它说的“最先进”我先打个折,等数字出来再说。

推荐理由:Anthropic 把 Fable 5.1 和 Mythos 5.1 一起发了,缓存读取直接砍掉四分之三的费用,对天天跑 Claude Code 的人来说是真省钱。模型在长任务里能自己多撑一会儿、卡住会更早喊停,写东西也更像人话,这些改动对实际干活有帮助。但正文没给延迟、上下文窗口和跑分数据,它说的“最先进”我先打个折,等数字出来再说。

Hacker News 首页

Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,编程和科研能力提升,价格降了 25%

Anthropic 推出了两个新模型,Fable 5.1 和 Mythos 5.1。它俩底层是同一个模型,区别在于安全护栏的松紧:Fable 5.1 对所有人开放,Mythos 5.1 则只通过受信项目提供给网络安全和生命科学领域,因为它的生物能力更强,需要和美国政府合作审核才能用。Fable 5.1 在编程、知识工作和长周期任务上全面超过了上一代 F...

推荐理由:Anthropic 这次把同一个底层模型拆成两个版本发布,Fable 5.1 给所有人用,Mythos 5.1 只走受信项目通道,原因是后者的生物能力太强,需要和美国政府合作审核。这种按安全护栏松紧来分发的做法,在行业里是头一回。Fable 5.1 在编程、知识工作和长周期任务上全面超过上一代,Mythos 5.1 的能力边界则直接触发了政府级管控。正文没披露具体评测数据和样本量,但发布机制本身就说明模型能力已经跨过了一条敏感线。

Hacker News 首页

Claude Fable 5.1 发布:价格不变,长程编程和多步研究能力更强

Anthropic 更新了平台文档,正式推出 Claude Fable 5.1。价格和 Fable 5 一样,但缓存读取成本降到四分之一。这次升级主要强化了三件事:长时间跑的编程任务、多步骤研究,以及处理文档、表格和幻灯片。有三项破坏性变更需要注意:强制工具调用现在会直接报错;旧模型读不懂它的思考块;编辑对话前面的轮次会让思考块失效。新增了五个功能,包...

推荐理由:Anthropic 这次更新文档正式推出 Claude Fable 5.1,价格没涨,但缓存读取便宜了四分之三,对重度用户是直接省钱。同时扔出三个破坏性变更,强制工具调用报错、旧模型不兼容思考块、编辑历史会弄丢思考块,这些都会直接影响线上流程。目前只是文档更新,还没有独立评测,所以分数没给更高。