跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 461–480 条 · 共 1,195 条

7月9日星期四

TechCrunch · AI

SpaceXAI 发布 Grok 4.5,马斯克说它是“Opus 级别”的模型

SpaceXAI 上市几周后推出了 Grok 4.5,定位是能写代码、做文书、搞研究和写东西的通用模型。公司说它的 token 效率是其他头部模型的两倍,如果属实,用起来会便宜不少。马斯克管它叫“Opus 级别”,直接对标 Anthropic 的旗舰系列。不过正文没公布价格、参数量和第三方跑分,这个效率翻倍的宣传我建议先观望,等独立评测出来再说。

推荐理由:上市后第一款模型,马斯克又直接喊出“Opus 级别”这种对标口号,话题度和讨论度都拉满。但文章只给了效率翻倍的宣传点,没放任何参数、定价或独立评测,这个效率说法我先打个折,等实测出来再看。

Hacker News 首页

SpaceXAI 发布 Grok 4.5,主打编程和自动化任务,用更少的输出 token 解决问题

Grok 4.5 是 SpaceXAI 目前最强的模型,专门为写代码、让模型进业务流程干活和知识类工作优化。在 SWE Bench Pro 这类编程基准测试里,它的解决率是 64.7%,虽然比 Fable 和 GPT 5.5 低,但有个很实在的优点:平均每次任务只输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本更...

推荐理由:SpaceXAI 推出 Grok 4.5,定位是写代码和让模型进业务流程干活,跟 Cursor 联合训练算是个实在的差异化。SWE Bench Pro 上 64.7% 的解决率没超过 Fable 和 GPT 5.5,这点先别太激动,但它的省钱优势很具体:平均每次任务输出约 1.6 万个 token,比 Opus 4.8 少了 4.2 倍,意味着推理成本低不少。正文没披露定价和延迟,这两个才是决定它能不能打的关键。

Hacker News 首页

Cognition 发布 SWE-1.7:用 Kimi K2.7 训出的编程模型,性能逼近 GPT-5.5,成本低一大截

Cognition 推出了新的编程模型 SWE-1.7,它是在 Kimi K2.7 的基础上用强化学习(RL)做后训练得到的。在 FrontierCode 1.1 这个编程基准上,SWE-1.7 的通过率是 42.3%,很接近 GPT-5.5 的 43.0%,比自家上一代 SWE-1.6 的 9.4% 高出一大截。在 Terminal-Bench 2....

推荐理由:Cognition 发了 SWE-1.7,在 Kimi K2.7 上做 RL 后训练,FrontierCode 1.1 通过率从 9.4% 拉到 42.3%,跟 GPT-5.5 的 43.0% 几乎打平。数字很硬,叙事也清晰——开源基座加 RL 就能逼近闭源旗舰,这对成本和路线选择都有参考价值。不过正文只给了摘要,训练细节和成本对比没展开,这点先别太激动。

7月8日星期三

OpenAI News

OpenAI 审计 SWE-Bench Pro,发现约三成题目本身有毛病

OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查,估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目,再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道(34.1%)有缺陷的题目,主要毛病是测试太死板、题目描述漏要求、测试覆盖不足,以及题目描述误导模型。Op...

推荐理由:OpenAI 对 SWE-Bench Pro 做了一次质量审计,发现约 34% 的题目有缺陷,这个比例逼着行业重新审视编程评测的可靠性。文章给出了具体的缺陷分类和一套人机结合的复核流程,不是空喊评测有问题。没给更高分是因为这本质上是一份基准质量报告,不是模型能力突破或产品发布,但它的警示作用对从业者很实在。

AI HOT 精选

Claude 团队公开两种多智能体用法:一个当顾问省钱,一个当指挥冲高分

Claude 开发者分享了他们内部高频使用的两种多智能体模式。第一种叫 Advisor,让便宜的 Sonnet 5 干活,遇到难题时通过工具调用去问贵的 Fable 5。在 SWE-bench Pro 测试上,这套组合拿了 84% 的分数,花了 1.40 美元;对比纯用 Fable 5 是 91.5% 但花 2.25 美元,相当于用 92% 的性能省了...

推荐理由:Anthropic 开发者分享了两种多智能体模式,Advisor 模式有 SWE-bench Pro 跑分和成本对比,用 92% 的性能省了 38% 的钱,对做 agent 的团队直接有用。分数没给更高是因为这只是个人分享,不是官方发布,而且 Orchestrator 模式缺基准测试数字。

Hacker News 首页

三个老工程师一周收一万美元,专删 AI 生成的烂代码

Slopfix 是三个波兰工程师搞的服务:一周时间、一万美元,把 AI 胡乱堆出来的代码库重构到人能维护的状态。他们会先免费帮你分析代码,给出一个明确的瘦身目标,比如“10 万行砍到 3.5 万行,功能不变”。收费按目标完成度算,承诺砍 50% 只做到 20%,你只付 4000 美元。交付物包括精简后的代码、一份 QA 清单、一套防再次变烂的规则(CL...

推荐理由:三个波兰工程师把 AI 代码重构打包成一个固定价格、按结果付费的服务,切入点很刁钻。标题和定价本身就自带传播力,交付标准也写得清楚,不是纯营销页面。但毕竟只是一个三人小团队的服务介绍,不是行业级事件,重要性给到 78 分合理。

AI HOT 精选

Liquid AI 开源 Antidoom:用“最终 Token 偏好优化”修掉推理模型的死循环毛病

推理模型有时会卡在“死循环”里,反复输出无意义的 token 直到把上下文窗口塞满。Liquid AI 开源了 Antidoom,用最终 Token 偏好优化(FTPO,一种教模型在推理结束时学会停下来的训练方法)来解决这个问题。他们在 DeepSeek V4 Pro 上试了,用 1,040 组偏好样本训练后,死循环率从 3.2% 降到了 0.3%,而...

推荐理由:Liquid AI 开源了一个修推理模型死循环的实用方法,在 DeepSeek V4 Pro 上把死循环率从 3.2% 压到 0.3%,数字扎实。没给更高分是因为目前只有一篇博客,没有论文或第三方验证,单源信息到这个分数已经不错了。

Hacker News 首页

Liquid AI 用“末位偏好优化”把推理模型的死循环率从 10.2% 压到 1.4%

Liquid AI 针对小参数推理模型在解难题时容易陷入“死循环”(反复输出同一段话直到窗口耗尽)的问题,搞了个叫 Antidoom 的方法。它不调全局参数,而是精准定位到循环开始的第一个 token,用“末位偏好优化”(FTPO)教模型在那个位置选一个更合理的词,其他地方基本不动。在 LFM2.5-2.6B 的一个早期版本上,硬核数学和编程题的死循环...

推荐理由:Liquid AI 给 LFM2.5-2.6B 早期版本做了个轻量修复:先找出死循环的第一个 token,再用偏好样本教模型在那个位置选个更合理的词。想法聪明,改动也小,但验证只在一个 2.6B 的早期检查点上,没有跨模型或更大规模的对比,效果能泛化多少还不好说。如果是真的,对跑小模型做推理任务的人挺省钱,但这点先别太激动。

7月7日星期二

Hacker News 首页

Craig Mod 花了五天用 Claude Code 给自己写了个记账软件 TaxBot2000

作家 Craig Mod 用 Claude Code 自己动手写了个叫 TaxBot2000 的记账工具,前后只花了五天。他管自己叫“软件狂人”,过去一年里用 Claude Code 搭了一堆小工具,比如一个帖子七天自动消失的类 Twitter 社区、视频内容搜索工具,还有各种日常用的效率小脚本。TaxBot2000 是他最新的作品,用 Python、...

推荐理由:Craig Mod 用 Claude Code 五天搭出 TaxBot2000,是个有血有肉的第一人称实验,不是公关稿。H、K、R 三条都踩中了,但毕竟只是个人效率工具分享,不是行业级产品更新或研究突破,所以放在 featured 里刚好。

Hacker News 首页

用确定性工具把大模型的笨手笨脚自动化掉

作者在开发 Beagle SCM 时发现,Claude 这类大模型虽然聪明,但做事不精确、不稳定,比如会把 build/ 目录重复提交两次。这种笨拙是模型本身的特性,不会随着进步消失。解决办法是用快速、可靠的确定性工具把模型夹在中间:下层是工具层,上层是工作流层,让模型在严格的流程里干活。如果模型反复做同一组操作,就写成脚本自动化;如果总在某个地方出错...

推荐理由:一篇工程师视角的实战反思,用 Claude 的翻车案例引出“用确定性工具夹住模型”的架构思路。不是产品发布或研究突破,但问题真实、解法具体,对正在把 AI 接入开发流程的团队有直接参考价值。

AI HOT 精选

Claude Code 现在可以按任务选模型和“用力程度”了

Anthropic 给 Claude Code 加了两项控制:模型选择和努力级别。你可以把 Opus 这种大模型派去跨文件重构,Sonnet 处理日常编辑,Haiku 做快速小修。努力级别分低、中、高三档,调的是模型思考深度和工具调用次数。高努力配 Opus 会触发多步代码库搜索和测试运行,但烧的 token 也最多。正文没披露具体价格差,只说了高努力...

推荐理由:Anthropic 官方产品指南,不是水文。努力级别的行为描述很具体(多步搜索、自动跑测试),对日常使用有直接帮助。扣分点在于没给价格对比,只说高努力“烧的 token 最多”,没数字。整体落在 featured 门槛没问题。

AI HOT 精选

推理成本趋近于零,数据库系统该怎么变?

伯克利 BAIR 实验室发了一篇研究路线图,核心判断是:当模型推理便宜到几乎免费,数据库系统会面临三重变化。第一是“为 Agent 服务的系统”:一个用户请求可能让 Agent 自动发出上千条 SQL 查询,但其中 80% 到 90% 的子查询是重复的,系统可以通过复用结果或返回近似答案来提速。第二是“由 Agent 组成的系统”:当成千上万个 Age...

推荐理由:伯克利 BAIR 这篇路线图不是空谈趋势,而是带着硬数字和三层框架来的。核心洞察是推理成本趋零后,数据库系统得为 Agent 重做一遍,80% 到 90% 的重复子查询这个数据让工程师能直接估算优化空间。文章把“为 Agent 服务、由 Agent 组成、被 Agent 使用”拆得干净,读起来像一份给同行看的工程笔记,不是公关稿。

Hacker News 首页

YC 老板吹嘘 AI 一天写 3.7 万行代码,开发者一看:全是水分和低级错误

YC 的 CEO Garry Tan 在 X 上晒战绩,说自己靠 AI 编程助手每天能交付 3.7 万行代码,已经连续 72 天不断更。波兰开发者 Gregorein 不信邪,去扒了他那个 AI 主题博客的前端代码,结果发现一堆问题。用户打开这个网站,浏览器要发出 169 个请求、下载 6.42 MB 的数据;作为对比,YC 自家的 Hacker Ne...

推荐理由:Garry Tan 声称靠 AI 每天交付 3.7 万行代码,第三方开发者去看了他博客的前端,发现 169 个请求、6.42 MB 的数据量,对比 Hacker News 的 1 个请求和 0.02 MB。数字对比、身份反转、以及行数指标与实际质量的脱节,三条都打中了。扣分是因为这只是单次扒代码的发现,不是产品评测或系统分析,上限给到 85 以下。

Product Hunt · AI

美团发布 LongCat-2.0:1.6 万亿参数 MoE 模型,MIT 开源,全程用自研 AI 芯片训练

美团在 Product Hunt 上线了 LongCat-2.0,一个总参数 1.6 万亿的 MoE 模型,每次推理激活约 480 亿参数,上下文窗口 100 万 token。模型用 MIT 协议开源,训练没碰英伟达 GPU,全跑在美团自己的 AI 专用芯片集群上。技术亮点是 LongCat 稀疏注意力机制,能省计算量;后期专门针对写代码和让模型进业务...

推荐理由:我会先打个折:正文没给任何评测基准分,也没说自研芯片的具体性能和训练成本,所以“强不强”现在没法判断。但亮点很明确——1.6万亿参数、100万token窗口、纯国产芯片训练、MIT开源,这几个要素凑在一起,在国内是第一次。LongCat稀疏注意力如果能实打实省计算量,对长文本和代码场景会有用。后期训练专门针对写代码和业务部署,说明美团不是放个玩具出来,是想让模型真进生产环境干活。如果是真的,训练成本可能比用英伟达低一截,这点先别太激动,等更多数据出来再看。

Hacker News 首页

上手 GLM 5.2:第一个用起来像 Opus 和 GPT 的开源模型,推理暴利时代快到头了

作者把 GLM 5.2 当主力用了两周,发现大部分任务上跟 Claude Opus 几乎分不出区别。切换成本极低,把 API 地址指向兼容的服务商就能直接在 Claude Code 里跑。两个硬伤:不支持图像识别,内置的网页搜索又慢又差,导致依赖看图或实时查资料的自动化流程跑不起来。推理价格大约每百万 token 4.40 美元,不到 Opus 零售价...

推荐理由:作者拿 GLM 5.2 当主力用了两周,给了可复现的切换路径和价格对比,不是通稿。两个硬伤限制了分数:只测了编程场景,视觉和搜索的短板让结论的适用范围收窄。单篇博客实验,样本就一个人,我会先打个折,所以停在 78。

7月6日星期一

Import AI

Fable 写出首个 GPU 大核,AI 在线工作自动化八个月翻四倍

Fable 在 KernelBench-Mega 上提交了第一个真正意义上的 GPU 大核,单次协作式内核启动就比优化过的 PyTorch 基线快了 18.71 倍。作为对比,Claude Opus 4.8 做到 14.4 倍,GPT-5.5 只有 4.34 倍。这个基准测的是 AI 自己写底层算子的能力,是观察 AI 能不能自己改进自己的一个信号。另...

推荐理由:这条消息对 AI 从业者有直接参考价值:Fable 在 KernelBench-Mega 上提交了第一个真正意义上的大核,单次启动 18.71 倍加速,比 Claude Opus 4.8 和 GPT-5.5 都干净。我会先打个折——这只是一个基准测试,不代表生产环境能复现,但架构差异本身值得注意:Fable 理解了协作式启动,而竞品还在用多次调用凑数。正文没披露这个内核的具体应用场景和稳定性验证,所以别太激动,但它确实给出了一个观察 AI 自我改进能力的窗口。

Hacker News 首页

代码干不干净,会影响 AI 编程 agent 干活吗?

SonarSource 的研究人员用 Claude Code 跑了 660 次实验,在 33 个任务里对比了“脏代码”和“干净代码”的仓库。结论是:代码干不干净,不影响 agent 最终把任务做对的通过率。但干净代码能让 agent 少用 7% 到 8% 的 token,重复打开同一个文件的次数也少了 34%。也就是说,代码整洁度不决定成败,但能实实在...

推荐理由:实验设计用了最小对照法,把“代码整洁度”单独拎出来看,结论有点反直觉:脏代码没让 agent 更笨,只是让它更啰嗦、更费 token。对天天用 coding agent 的工程师来说,这条信息直接能用——不用为了讨好 AI 去大扫除,但顺手整理一下确实能省点成本。扣分项是样本量偏小,33 个任务覆盖面有限,正文也没说任务难度分布,所以“通过率不变”这个结论我会先打个折,别当铁律。

7月5日星期日

AI HOT 精选

美团 LongCat-2.0 完全开源,1.6T 参数的 MoE 模型,权重和推理代码都放出来了

美团把 LongCat-2.0 整个开源了,MIT 协议,权重和推理代码都能直接用。这是个 1.6 万亿参数的 MoE 模型,每次推理只激活大约 480 亿参数,上下文窗口能塞进 100 万 token。它用了三个省资源的招:LongCat Sparse Attention 专门处理长文本,Zero-Compute Experts 会根据任务动态激活 ...

推荐理由:美团把 LongCat-2.0 完整开源,MIT 协议放权重和代码,在国内大厂里算动作很大。1.6T 总参数、每次只激活 48B、100 万 token 上下文,这几个数字说明它在长文本和推理成本上都做了针对性设计,不是纯刷参数量。对从业者来说,能直接拿到权重和推理代码,比只发论文或给 API 实用得多。重要性给 82 分合理,featured 也站得住,因为这件事既有技术细节可聊,又有开源生态层面的信号意义。

Hacker News 首页

Simon Willison 用 Claude Fable 修了个丢数据的致命 bug,花了 149.25 美元把 sqlite-utils 4.0 推到稳定版

Simon Willison 在发布 sqlite-utils 4.0 稳定版前,让 Claude Fable 做了一次最终审查。模型发现了一个会丢数据的严重 bug:delete_where() 方法执行后从不提交事务,导致后续所有写入操作都会被静默回滚。整个修复过程用了 37 次提示、34 次提交,改了 30 个文件,总共花了 149.25 美元。...

推荐理由:Simon Willison 让 Claude Fable 在 sqlite-utils 4.0 发布前做最终审查,模型发现了一个会静默丢数据的严重 bug:delete_where() 执行后从不提交事务,后续写入全被回滚。整个过程用了 37 次提示、34 次提交,改了 30 个文件,总共花了 149.25 美元。这不是厂商案例,是当事人自己公开的实验记录,数字和过程都摆在那。没给更高分是因为这只是单次实验,不是系统性验证,但作为一手信号已经足够醒目。

Computing Life · Share · 鸭哥调研

AI 把造轮子变便宜了,Infra 组该去铺 agent 能跑的路

GitClear 分析了 2.11 亿行代码变更,发现 AI 辅助编程让重复代码激增、重构减少。造内部工具的边际成本被压到接近零,业务组不再需要等 Infra 组交付成品平台,自己花十分钟就能让 AI 生成一套能用的东西。Infra 组过去“别自己造轮子”的底气被掏空了。文章提出 Infra 组的新交付物是“生成内核”:把支付、认证这类不可替代的核心能...

推荐理由:这篇观点文章有 GitClear 的数据打底,又抛出了“生成内核”这个新提法,对 Infra 从业者的冲击力很直接。但它是单人博客,没有多方信源交叉验证,而且正文在论证中途截断,没把“生成内核”怎么落地讲透,所以停在 78 分的 featured 门槛上。