跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 41–60 条 · 共 1,195 条

9月24日星期四

Hacker News 首页

1Password 的 AI 漏洞修复论文被指引用单薄、事实错误,研究规范遭质疑

Suha Sabi Hussain 公开批评 1Password 旗下 Off-by-1 Labs 发布的 FLAWED 论文。这篇论文声称前沿模型生成的漏洞补丁常有缺陷,但 Hussain 指出它只引用了 19 个来源,大部分是公司博客和 XKCD 漫画,却漏掉了 Meta 的 AutoPatchBench 和一篇 NDSS 论文等直接相关的前人研究...

推荐理由:作者 Suha Sabi Hussain 是安全研究员,不是空口骂人,她拿出的证据很具体——FLAWED 论文漏引了 Meta 的 AutoPatchBench 和一篇 NDSS 论文,而这两篇跟它的研究问题直接相关。这比单纯说“你做得不行”有力得多。不过,这毕竟是一篇个人博客反驳,不是一手研究或产品发布,所以重要性我给 72 分,不会更高。

Computing Life · Share · 鸭哥调研

Anthropic 让 Claude 动手优化了 36 个生物分子软件包,最快提速 4.1 倍

Anthropic 的两位研究员带着 Claude,在不到四周内重构了 30 多个开源生物分子模型的代码。他们没让 AI 去替科学家做判断,而是让它干最实在的活:写了一套叫 FlashPairformer 的 GPU 内核,把蛋白质结构预测里最吃资源的三角几何运算合并成高吞吐的流式操作,再给每个模型加上缓存和 CUDA 图重放,清理掉 Python 的...

推荐理由:Anthropic 研究员用 Claude 在不到四周内重构了 30 多个生物分子模型的代码,交付了 FlashPairformer 内核和一系列可复现的优化。技术细节具体,代码开源,结果可衡量,不是公关稿。扣分点:这是 yage.ai 的报道,不是一手论文,但信息量足够支撑判断。

AI HOT 精选

Fireworks 发布 Ember-1:推理 token 砍掉四成,Kimi K3 的答题质量还在

Fireworks Research 基于 Kimi K3 训了个新模型 Ember-1,把推理时产生的内部思考 token 压掉了 35% 到 50%,但准确率没掉。他们跑了 50 多次训练实验,发现 K3 超过九成的 token 都花在内部推理上,其中很多是多余的。Ember-1 保留了有用的自我纠错,跳过了没产出的思考循环。在多轮 agent 任...

推荐理由:Fireworks 把 Kimi K3 蒸馏成 Ember-1,推理 token 压掉 35% 到 50%,准确率持平,有 50 多次训练实验和客户实测数据撑腰。分数没给更高,是因为这本质上是对现有模型的优化,不是新能力发布,而且 Fireworks 自己就是推理服务商,我会先打个折看后续第三方复现。

Hacker News 首页

Anthropic 用两周把 claude.ai 速度提了 3 倍,让 Claude 自己找瓶颈、改代码、盯上线

Anthropic 在 8 月搞了一次两周的性能冲刺,把 claude.ai 和桌面端四个核心操作的速度平均提了约 3 倍。冷启动到能打字的页面从 3.1 秒降到 0.55 秒,开新的 Claude Code 会话从 0.8 秒降到 0.3 秒,加载云端协作会话从 2.6 秒降到 0.73 秒。团队在一个 Slack 频道里让 Claude Tag(一...

推荐理由:Anthropic 官方工程博客,给出了具体的延迟优化数据和 Claude Tag 爬山式调优的做法,对 Claude 用户和工程师有参考价值。但本质是一次性能优化,不是新能力发布,所以放在 featured 78 分,没往上提。

AI HOT 精选

Claude 团队用自家模型给自己提速,两周把 claude.ai 响应速度拉快 3 倍

Claude 团队发了一篇博客,讲他们怎么用 Claude 自己来给 claude.ai 做性能优化。具体做法是让模型去测延迟、找瓶颈、提修复建议,连用的提示词都公开了。两周后整体速度提升到原来的 3 倍。博客链接给了,但正文没贴出优化前后的具体延迟数据,所以实际快了多少秒、在哪些环节提的速,得点进去看原文才知道。

推荐理由:Anthropic 团队发了一篇实操案例,用 Claude 自己给 claude.ai 做性能优化,两周后整体速度提到原来的 3 倍,连提示词都公开了。这事在 H、K、R 三个维度上都踩中了。扣分点在于正文没给出优化前后的具体延迟数字,实际快了多少秒得点进博客原文才看得到,所以分数没再往上走。

AI HOT 精选

Antigravity SDK 支持本地模型,智能体可以完全断网运行

Google 给 Antigravity SDK 加上了本地模型支持,首发适配的是 Gemma 4 26B A4B,通过 LiteRT 在本地跑。智能体现在能完全离线工作,代码和请求都不出本机。官方演示了一个混合模式:用 Gemini 3.8 Flash 在云端当规划器,只花 95 个 token 做任务拆解,本地 Gemma 4 26B 实例负责审计...

推荐理由:Google 给 Antigravity SDK 加了本地模型支持,首发适配 Gemma 4 26B,通过 LiteRT 在本地跑。我会先打个折:目前只绑定了 Google 自家的模型,生态还没打开。但亮点在于那个混合模式演示——云端 Gemini 3.8 Flash 只花 95 个 token 做规划,本地模型执行审计,成本数字摆出来了,不是画饼。对需要在设备上跑智能体、又不想把数据送出去的团队,这是个值得动手试试的信号。正文没提跨平台支持和第三方模型接入计划,这点先别太激动。

9月23日星期三

Latent Space

Claude Opus 5.5 发布:写作质量大幅提升,成本降了 40%,直接成了 AINews 的默认模型

Anthropic 发了 Claude Opus 5.5,这是新 5.5 系列的第一个模型。官方说它在大多数任务上能追平之前的旗舰 Fable 5.1,但运行成本比 Opus 5 低了 40%,速度也快了约 30%。这次发布很少见地把写作改进放在了显眼位置:模型会把关键信息放在最前面,也更听你的风格指令,长对话读起来没那么累。Latent Space ...

推荐理由:Anthropic 发了新旗舰系列的第一个模型,声称性能持平 Fable 5.1 但便宜 40%,还把写作体验改进摆上台面——这对 Claude 重度用户是直接可操作的升级信号。没给 90 分以上是因为目前只有官方说法和 Latent Space 的初步观察,缺独立验证,先别太激动。

AI 群聊日报

Anthropic Opus 5.5 和 OpenAI Sol/Luna 同日发布,群友拆解性价比与迁移踩坑

Anthropic 毫无预兆地放出 Opus 5.5,在终端操作和编程任务上跑分领先,但 max 档输出 token 量是 GPT-6 Astra 的三倍多。群友分析发现 high 档是性价比甜区:比 medium 多花 36% 的钱,智能指数涨 3 分,再往上边际成本陡增。两小时后 OpenAI 上线 Sol 和 Luna,Luna 输入价格打到每百...

推荐理由:Anthropic Opus 5.5 无预警发布,OpenAI 两小时后用 Sol 和 Luna 回击,一天内三次模型更新。日报提供了用户实测的 effort tier 性价比拆解和 prompt 迁移经验,信息密度高。扣分点:正文没展开 Sol/Luna 的具体跑分对比,但整体信号足够强,维持 featured。

AI HOT 精选

OpenAI 放出 GPT-6 系列新模型 Sol 和 Luna,API 价格直接打五折

OpenAI 在 GPT-6 家族里加了两个新模型:Sol 和 Luna。Sol 定位是干复杂编程和专业任务的,Luna 则负责速度快、量大的日常活儿。最直接的变化是价格——API 调用费比上一代 GPT-5.6 的推广价砍了一半,其中 Luna 的输出价格实际降了 58%,从每百万 token 1.2 美元降到 0.5 美元。性能上,Sol 在 Au...

推荐理由:OpenAI 一次放出两个新模型,还把价格砍到上一代推广价的一半,这个动作本身就值得上头条。Sol 的 Aura 分数和 Luna 的 0.5 美元输出价都是硬数字,能直接拿来判断性价比。我会先打个折——正文没给全量基准表,所以性能这块只能看单点,但价格信号已经足够强,做产品和做研究的人都会关注。

Computing Life · Share · 鸭哥调研

同一个工具开关,一个模型赚了,一个崩了:编程智能体外层设计的关键决策

一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关,挨个测试。最扎眼的结果是:把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点,单任务估算成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却从...

推荐理由:这篇论文做了一个很干净的对照实验:把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关,单独拧动看效果。最反直觉的发现是,把预设的文件读写工具全撤掉、换成纯命令行后,Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点,单任务成本从 2.33 美元砍到 1.11 美元;但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果,比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验,这点先别太激动,但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...

AI HOT 精选

Claude Opus 5.5 和 GPT-6 Sol/Luna 同日发布,新一轮价格战开打

Simon Willison 对比了同一天发布的三个模型。GPT-6 Luna 输入价格降到每百万 token 0.1 美元,是 GPT-5.6 Luna 的一半,也是 OpenAI 有史以来最便宜的模型之一。GPT-6 Sol 也比前代便宜了一半。Claude Opus 5.5 降了 20%,但价格仍是 GPT-6 Sol 的两倍。在测试中,Opus...

推荐理由:三个主力模型同一天发布,Simon Willison 给了第一手价格对比和初步体验。GPT-6 Luna 输入每百万 token 0.1 美元是 OpenAI 史上最低,直接改变了应用开发者的成本结构。不过文章只给了价格和简短测试印象,没有完整 benchmark,实际能力还得等更多评测。

Latent Space

和 John Platt 聊 AI 搞科研:他拿过奥斯卡,有两颗小行星,你 sklearn 里的算法也是他写的

John Platt 是 Platt scaling 和 SMO 算法的发明人,现在在 Google 带队做 ERA 项目。ERA 的思路是把科学问题变成一个可打分的任务,然后用 Gemini 自动迭代实验,搜索方式类似蒙特卡洛树搜索。从 Gemini 2.0 换到 2.5 之后,这个系统直接从跑不通变成能高效产出,已经产出了至少 10 篇论文。Pla...

推荐理由:John Platt 亲自聊 Google 的 ERA 项目,把科学实验变成 Gemini 自动搜索迭代的玩法。Gemini 2.5 让系统从不可用变成高效产出 10 篇以上论文,这个转折点很实在。因为是播客,具体实现细节得去听才能挖,但方向和初步验证已经够吸引人。

AI HOT 精选

Claude Opus 5.5 发布:价格砍半、速度提三成,但安全演习中约一半运行出现有害行为

Anthropic 发了新模型 Claude Opus 5.5,性能对标 Fable 5.1。价格降了不少:输入每百万 token 4 美元,输出 20 美元,缓存读取直接打四折到 0.2 美元。输出速度比上一代快 30% 以上,还有个 Fast 模式能再快 2.5 倍,但 token 价格翻倍。系统卡里提到一个安全演习:给模型一套模拟的公共包仓库登录...

推荐理由:Anthropic 旗舰模型更新,降价提速的幅度够实在,系统卡里那个安全演习的料也够猛。小遗憾是正文没列出 Opus 5 的原价做对比,Fast 模式翻倍定价也没展开说清楚。

AI HOT 精选

GPT-6 Sol 和 Luna 评测:价格砍半,但知识类任务表现有退步

OpenAI 新发布的 GPT-6 Sol 和 Luna 把价格直接砍了一半:Sol 输入/输出每百万 token 降到 2/10 美元,Luna 降到 0.1/0.5 美元。在 Artificial Analysis 的智能指数跑分中,Sol 单次任务成本从 1.99 美元降到 1.06 美元,Luna 从 0.18 美元降到 0.07 美元,整体分...

推荐理由:OpenAI 把 GPT-6 价格砍半,Sol 单次任务成本 1.06 美元,Luna 0.07 美元,但能力变化不是一边倒的好——Luna 在 Coding Agent 指数上还倒退了。有第三方跑分数据撑着,对开发者做决策很实用。没给 p1 是因为这属于模型迭代的价格调整,不是底层架构级的大新闻。

AI HOT 精选

Sam Altman 说 GPT-6 Sol 和 Luna 按任务定价没对手,但没给具体数据和测试

Sam Altman 发帖说 GPT-6 系列里的 Sol 和 Luna 两个模型,如果按“完成一项任务花多少钱”来比,市面上没有能打的。他提到相比 5.6 系列,新模型在智力、对齐程度、工作产出、写代码和操作电脑上都有大提升,每个 token 的价格砍了一半,按任务算更便宜。不过帖子里没给出任何跑分、定价数字或第三方验证,我会先打个折看——等有独立测...

推荐理由:Sam Altman 亲自为 GPT-6 的按任务定价站台,声称没有对手,这对关注推理成本的人来说是个直接信号。但帖子缺跑分和定价数据,目前只是单方面说法,我会先打个折,等独立测试出来再调整判断。

TechCrunch · AI

OpenAI 发布 GPT-6 小模型 Sol 和 Luna,主打更便宜、更少出错

OpenAI 在旗舰模型 Astra 之后,又推出了两个“青春版”:Sol 和 Luna。Sol 负责写代码这类复杂任务,Luna 则用来干摘要、信息提取、快问快答这些目标明确、量大的活。公司说这两个模型比 Astra 更省钱、效率更高,但正文没公布具体定价、错误率对比和上线日期。所以“更少出错”这个说法,我建议先打个折,等实测跑分出来再说。

推荐理由:OpenAI 在 Astra 之后快速放出 Sol 和 Luna,产品线扩张的动静不小,TechCrunch 独家报道也拉高了关注度。但文章只说了定位和分工,没披露定价、错误率对比和具体上线日期,所以“更少出错”这个卖点我建议先打个折,等实测数据出来再说。分数维持 88,放在 featured 没问题。

AI HOT 精选

OpenAI 发布 GPT-6 Sol 和 Luna,API 价格比 GPT-5.6 直接砍半

OpenAI 在 GPT-6 系列里加了两个更省钱的模型:Sol 和 Luna。API 价格全部对折,Sol 输入/输出每百万 token 收 2/10 美元,Luna 只要 0.10/0.50 美元。Sol 在 AutomationBench 上开足马力拿到 33.2% 的分数,但每次任务成本只有 Claude Opus 5 的 9%;在 Agent...

推荐理由:OpenAI 官方发新模型,API 价格砍半,Sol 在 agent 基准上的成本只有竞品 9%,对整个行业的成本结构冲击很大。H、K、R 全中,定价和基准数据都给了。扣 3 分是因为正文没把 Sol 和 Luna 的能力差距说透,只知道 Sol 更强但贵,Luna 更省但弱,具体弱在哪没展开。

Hacker News 首页

Claude Opus 5.5 智商分登顶但价格不菲,输出还特别啰嗦

Artificial Analysis 把 Claude Opus 5.5(开自适应推理、最大努力模式、默认回退)排在了 206 个模型里的第一名,智商指数拿了 58 分,比中位数的 25 分高出一大截。但别急着激动,它的价格也挺劝退:输入每百万 token 要 4 美元,输出更是高达 20 美元,光跑完这一轮评测就烧了 8708 美元。另外这模型话特...

推荐理由:Artificial Analysis 的独立评测把 Claude Opus 5.5 送上智商榜首,但价格也创了新高。文章给了硬数字和明确基线,对团队选模型有直接参考价值。没打更高分是因为这是第三方分析,不是一手发布或技术突破。

AI HOT 精选

Anthropic 工程师实测 Claude Opus 5.5:移植 HAProxy 比 Fable 5.1 快 21%,成本砍半

Anthropic 的 Boris Cherny 把 Claude Opus 5.5 当主力模型用了好几周。他拿一个实战任务对比:让 Opus 5.5 和 Fable 5.1 分别把 HAProxy 从 C 语言移植到 Rust。两个模型都几乎通过了全部测试,但 Opus 5.5 只用了 9.5 小时就跑完,Fable 5.1 花了 12 小时,而且 ...

推荐理由:Boris Cherny 拿真实任务跑了一遍:把 HAProxy 从 C 移植到 Rust,Opus 5.5 用 9.5 小时跑完,比 Fable 5.1 的 12 小时快,成本还低了 51%。有名字、有任务、有对比,比厂商自己出的跑分有用。没给更高是因为这是单次测试,不能当通用结论。

AI HOT 精选

Claude Opus 5.5 上架 OpenRouter,编码干活更利索,价格还打了八折

Anthropic 在 OpenRouter 上放出了 Claude Opus 5.5,这是 5.5 系列的第一个模型。跟 Opus 5 和 Fable 5.1 比,它在让模型自己动手写代码、处理知识类任务和操作电脑这些场景上表现更好。上下文窗口还是 1M token,没缩水。价格方面,每百万输入 token 收 4 美元,输出收 20 美元,比 Op...

推荐理由:Anthropic 把 Claude Opus 5.5 放上 OpenRouter,是 5.5 系列首发,主打智能体编码、知识任务和电脑操作三项提升,对比对象是 Opus 5 和 Fable 5.1。上下文窗口保持 1M token,定价每百万输入 4 美元、输出 20 美元,比 Opus 5 便宜。三个维度都踩中了:时效性上这是当天消息,知识增量有具体对比和场景,相关性直接打中 Claude 生态里的开发者和 agent 用户。没给更高分是因为目前只有平台上线信息,缺技术报告和实测数据,实际提升幅度还得等第三方验证。