跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 221–240 条 · 共 1,195 条

8月23日星期日

彭博科技

一个叫 Ox Alpha 的神秘模型冲上 LMSYS 榜单,数学和编程跑分超过 GPT-5.1 和 Gemini 3.0 Pro,而且完全免费

Ox Alpha 突然出现在 LMSYS 排行榜上,在数学和编程基准测试里压过了 GPT-5.1 和 Gemini 3.0 Pro,目前完全免费。没人知道是谁做的——官网只有一张奶牛照片和一个邮箱。开发者圈子里在猜这可能是某家大厂匿名放出来的测试版,但正文没披露模型规模、训练数据来源,也没说背后到底是谁在运营。这点先别太激动,信息缺口还很大。

推荐理由:Ox Alpha 空降 LMSYS 榜单,数学和编程分数压过 GPT-5.1 和 Gemini 3.0 Pro,还免费开放,神秘感拉满。Bloomberg 的报道增加了可信度,但正文没披露模型规模、训练数据来源,也没说背后是谁在运营,信息缺口很大,所以分数卡在 featured 级别。

Hacker News 首页

Simon Willison 启动“智能体工程模式”项目,整理用编程智能体写代码的最佳实践

Simon Willison 开了个新坑,叫《智能体工程模式》,专门记录怎么用好 Claude Code、OpenAI Codex 这类能自己写代码、自己跑测试的编程工具。他先划了条线:vibe coding 是完全不看代码、让模型随便搞;智能体工程则是专业程序员用这些工具放大自己的判断力,不是撒手不管。项目前两章已经发了,一章讲“生成代码的成本几乎为...

推荐理由:Simon Willison 开了个新系列,第一件事就是给两种 AI 编程方式划清界限:vibe coding 是完全不看代码让模型瞎搞,agentic 工程则是专业程序员用这些工具放大自己的判断力,不是撒手不管。这个区分很及时,因为现在很多团队正卡在“该信模型多少”的纠结里。目前只发了两章,正文没披露具体模式细节,更像一个概念框架和项目预告,所以重要性先打个折。等后续章节把实战模式补上,值得再回来看。

Hacker News 首页

Prime Intellect 让 18 个前沿模型比赛自动优化 NanoGPT,Fable 5 把验证损失压到 2,726,追平了人类最优记录 81.7...

Prime Intellect 搞了一场“极速挑战”,把 18 个前沿模型分别配上编程助手,让它们自己动手改 NanoGPT 的训练脚本,目标是尽可能降低验证损失。Fable 5 搭配 Claude Code 跑出了 2,726 的最好成绩,把人类基线到最优记录之间的差距补上了 81.7%。第二名 Opus 5 和第三名 Kimi K3 分别补上了 5...

推荐理由:Prime Intellect 搞的这场极速挑战,让模型自己动手改 NanoGPT 训练脚本,比的是谁能把验证损失压到最低。Fable 5 加 Claude Code 跑出 2,726,把人类基线和最优记录之间的差距补上了 81.7%,第二名和第三名只补了 5% 左右,领先优势非常明显。排行榜、方法和具体数字都公开,对做 agent 和看 benchmark 的人有直接用处。

Hacker News 首页

LLM 抹平了语言切换的摩擦,开发者开始用 Rust、Zig 这类更硬核的技术

Armin Ronacher 观察到,大模型让熟悉一门语言的成本变得很低,选什么语言不再那么重要,开发者反而更看速度宣传来选型。Rust 用户明显变多,Zig 也开始出现在 Cloudflare Artifacts(一个约 100 KB 的 Wasm Git 引擎)和 Vercel fx 这类项目里,而且基本都是靠 LLM 辅助写的。更硬核的技术——D...

推荐理由:Armin Ronacher 的观察有具体项目背书,不是纯感觉。核心洞察——大模型降低语言切换成本——不算新,但他往下推了一步:开发者现在按速度宣传选语言,Rust 和 Zig 正好吃这波红利。正文没给具体用户增长数据,'明显变多'是定性判断,这点先别太激动。如果是真的,说明 LLM 在悄悄改变技术选型的底层逻辑,而不只是帮人写代码。

8月22日星期六

Hacker News 首页

Dan Luu 用 AI 几分钟就给 ripgrep 加了即时编译,长查询快 2-4 倍,还顺手做了个世界最强的 Azul 游戏 AI

Dan Luu 拿之前用 AI 花一个月跑出来的正则引擎 FRE 做实验,让 AI 花几分钟就把它的即时编译(AOT)塞进了 ripgrep。效果是长查询能快 2 到 4 倍,但在他自己真实的混合查询里只快了约 7%。他解释这主要是为了那些跑好几秒甚至几分钟的搜索,短查询变慢一点可以接受。他还提到,用 GPT-5.1/5.2 时期的模型,自己零游戏 A...

推荐理由:Dan Luu 拿自己之前用 AI 花一个月跑出来的正则引擎做实验,让 AI 花几分钟就把即时编译塞进了 ripgrep。长查询能快 2 到 4 倍,但他自己的真实混合查询只快了约 7%,短查询反而会变慢一点。他解释这主要针对跑好几秒甚至几分钟的搜索场景。标题说“软件没理由再慢了”有点夸张,但实验数据很诚实,没藏着掖着。我会先打个折:这更像一次具体场景的验证,不是通用结论。不过对做性能优化的人,这个案例值得一看,能吵起来。

8月21日星期五

AI HOT 精选

Anthropic 公开内部 AI 原生开发手册,讲他们怎么用 Claude 做软件

Anthropic 把自家用 Claude 开发软件的内部手册开源了,覆盖了从需求、设计到写代码、测试、运维的全流程。手册里给了具体的实践方法和团队结构调整建议,比如让模型参与需求评审、自动生成测试用例。但正文没披露任何量化指标,比如效率提升了多少、bug 率降了多少,所以这更像一份方法论指南,不是独立评测。如果你想知道他们内部到底省了多少时间,这篇里...

推荐理由:Anthropic 开源了内部 SDLC 实战手册,覆盖全流程且给了具体实践方法,对用 Claude Code 的团队有直接参考价值。但零量化指标,更像方法论指南而非独立评测,刚好卡在 featured 门槛上。

Hacker News 首页

别再做命令行工具了:用 AI 截图就能生成原生桌面应用

作者用 AI 写了 7 个 macOS 原生应用,包括 Markdown 阅读器、数学计算前端、音乐播放器、自动维基、食物热量估算、温度监控和 Apple TV 遥控器,一行 UI 代码都没手写。他的方法是截一张设计图扔给 Claude,让模型直接生成 SwiftUI 界面。文章没给性能或兼容性数据,但展示了真实可用的集成:SQLite 做后端、虚拟文...

推荐理由:截图扔给模型出 SwiftUI 这套流程,7 个真实应用撑着,比纯观点输出硬多了。但正文没给任何性能或兼容性数据,标题也更像宣言而不是评测,所以分数压到 72。如果是真的,省 UI 开发时间这点挺诱人,不过没数据之前先别太激动。

Hacker News 首页

OpenRouter 上架了一个匿名推理模型 Ox Alpha,目前免费

Ox Alpha 是一个没公开开发方的推理模型,主打写代码、长时间跑智能体任务和生产环境负载。现在在 OpenRouter 上可以免费用,上下文窗口有 100 万 token,P50 延迟 1 秒,生成速度每秒 69 个 token。正文没披露是谁做的、参数量多大、免费期持续多久。从使用数据看,Claude Code 和 Nous Research 的...

推荐理由:一个匿名推理模型免费上线,主打写代码和长时间智能体任务,100万token上下文、P50延迟1秒、每秒69个token,Claude Code和Nous Research已经在用。但正文没披露开发方、参数量、免费期持续多久,这些信息缺口让判断得打个折——如果是真的挺省钱,但先别太激动。

8月20日星期四

Hacker News 首页

Slack 推出 Code 频道,把 AI 写代码变成团队围观和协作的公开活动

Slack 新功能 Slack Code 给频道加了一个“代码”类型,让 Claude Code、Devin、ChatGPT 这类编程智能体直接在频道里干活。团队能看到对话、代码差异对比和实时预览,不用再切到别的工具。每个频道对应一个项目,任务做完会自动归档,留下审计记录。正文没提定价和具体上线时间。

推荐理由:Slack 把编程智能体的工作流塞进频道,解决的是“智能体干活别人看不见”这个团队协作痛点。产品思路清楚,但正文没提定价和上线时间,目前只是预告不是正式发布,所以分数压在 80 以下。

Hacker News 首页

用开源模型给 27 美元的 PineTime 手表写了个卡西欧风格的表盘

Mike Kasberg 翻出抽屉里吃灰两年的 PineTime 手表,用 OpenCode 搭配 Kimi K3、K2.6 和 DeepSeek v4 等开源模型,照着照片复刻了一个卡西欧风格的表盘。他先在 InfiniSim 模拟器里跑通编译,但模型第一版只是猜着放文字位置,元素全叠在一起没法看。于是他换成逐个元素给具体反馈、修好一个再修下一个。后...

推荐理由:这是一篇第一人称的动手实验,调试细节真实,不是教程汇总也不是软文。H 和 K 都站得住,但受众窄、缺少跨源讨论让 R 起不来,刚好卡在 featured 的门槛上。

Latent Space

Z.ai CEO 唐杰谈 GLM 5.3:别再只盯着参数量了,后训练才是新的扩规模法则

唐杰在 X 上发了一长串帖子,核心就一句话:光看参数量没意义,得把数据量、算力花在哪、模型在什么条件下跑这三件事一起看。GLM 5.3 的提升全靠强化学习在长周期环境里训出来的,有些任务模拟了工程师好几天的工作量,比如给模型一个真实的集群环境,让它自己诊断瓶颈、做优化、跑实验,最后交出可衡量的加速结果。他们搞了一套全自动的合成管线来生成这种可执行、可验...

推荐理由:唐杰亲自下场解释 GLM 5.3 的后训练缩放定律,举了模拟集群诊断和优化的实验案例,不是纯话术。但来源是付费 newsletter 的节选,正文没披露具体的加速比、任务成功率这些关键数字,所以判断先打个折——思路有料,验证还得等更多数据。

Hacker News 首页

LLM 让软件从“写死功能”变成用户开口就能扩展

Jeremy Morrell 认为现在大部分网页应用只服务需求曲线头部的大众功能,长尾需求一直被晾着。LLM 让普通用户也能“用嘴把代码说进系统”,产品可以保留一个稳定核心,靠 AI 生成的扩展去覆盖那些零散需求。他举了 Pi 和 DeepSeek Harness 的例子:用户提需求,系统当场写一段 TypeScript 扩展并热加载生效。文章后半段重...

推荐理由:这篇文章更像一个引发思考的产品观点,不是行业地震级的东西。作者用两个具体产品把“AI 写扩展”这条路走通了,但整体还停留在早期验证阶段,所以放在 72 分这一档的底部。我会先打个折:正文没给出大规模落地的数据,这点先别太激动。

8月19日星期三

Hacker News 首页

Ornith-1.5 让模型自己出题、搭脚手架、写答案,靠强化学习滚雪球式变强,三个尺寸在编程和智能体跑分上压过同级开源模型

Ornith-1.5 把上一代的自搭脚手架思路升级成完整的自改进闭环:模型自己生成新任务、搭好解题用的脚手架、产出多轮答案,再用强化学习从这些经验里提升自己。旗舰版 397B MoE 在 Terminal-Bench 2.1 上拿了 86.1 分,DeepSWE 上 56.0 分,跟 Claude Opus 4.8(85.0、59.0)基本打平,超过了...

推荐理由:Ornith-1.5 把自改进做成了一个闭环,397B 版本在 Terminal-Bench 和 DeepSWE 上基本跟 Claude Opus 4.8 打平,开源追到这个位置确实少见。没给更高分是因为 Ornith 还不是一线实验室,社区复现和真实部署效果还得再观察。

OpenAI News

Replit 推出免费模式,用 GPT-5.6 Luna 把写代码的 token 成本砍到零

Replit 上线了 Free Mode,底层跑的是 GPT-5.6 Luna,用户不用再盯着 token 消耗,可以直接在项目里规划、头脑风暴和探索想法。CEO Amjad Masad 说 OpenAI 最近的降价让面向百万用户的免费层终于跑得通。遇到复杂推理任务,系统会切到 GPT-5.6 Sol,处理完再回到 Luna,同时保留项目上下文。Sam...

推荐理由:Replit 免费层上线是个具体的产品更新,有明确的机制(双模型切换)和 CEO 对成本的原话,信息量够上 featured。但它本质上是 OpenAI 的客户故事,不是模型发布,所以分数停在 72 不往上拉。

Hacker News 首页

Bun 1.4 用 Rust 重写了三个月还没发版,社区信任快耗光了

Bun 已经三个月没出稳定版,是 2022 年以来的最长空窗期。创始人 Jarred 从 6 月就开始预告 v1.4,日期一拖再拖,最近一次说“明天发”,评论区已经公开嘲讽。这次重写把代码从 Zig 搬到 Rust,但过去一个月 1.58 万次提交来自 robobun 机器人,1600 次来自 autofix-ci 机器人,Jarred 自己只提交了 ...

推荐理由:Bun 的 Rust 重写已经让它三个月没出稳定版,是 2022 年以来的最长空窗期。创始人 Jarred 从 6 月就开始预告 v1.4,日期一拖再拖,最近一次说“明天发”也没兑现,评论区已经公开嘲讽。过去一个月 1.58 万次提交来自 robobun 机器人,1600 次来自 autofix-ci 机器人,Jarred 自己只提交了零星几次。这个提交比例说明项目维护状态很不正常,所谓的“AI 辅助开发”看起来更像是自动化脚本在空转。正文没披露具体功能完成度和阻塞原因,但就目前公开的信息,这个版本的质量和发布时间都该先打个折。

Computing Life · Share · 鸭哥调研

600 亿美元买一个数据飞轮,1000 万买一个工作记忆

AI 竞赛的胜负手从算力转向了真实工作场景里的行为数据。SpaceX 用 600 亿美元股票买下 Cursor,直接接管了 5 万多家企业客户的编码交互记录,用来训练 Grok 4.5 和 4.6。谷歌在精神航空破产拍卖中出价 1000 万美元,买下约 1 亿封邮件、5 亿条 Teams 消息和 3000 万行内部代码。Atlassian 更新了服务条...

推荐理由:SpaceX 600 亿美元全股票收购 Cursor,把开发者行为数据推成了模型竞赛的下一个筹码。文章用谷歌竞拍精神航空内部邮件和代码的出价(1000 万美元)给出了一个具体价格参照,逻辑链清楚:谁拿到真实工作流里的交互记录,谁就能训出更贴地的模型。不过文章是综合信息整理,不是一手爆料,具体交易条款和谷歌最终是否成交都没披露。

Hacker News 首页

纯 AI 生成的代码在美国法律下没有作者,也就没有版权

这个网站给创始人和工程负责人讲了一个硬核的法律事实:按美国现行版权法,完全由 AI 生成的代码没有人类作者,所以没法申请版权,也不能当成公司资产来保护。它引用了四个已经落定的判例,包括 2026 年 3 月最高法院拒绝审理 Thaler 案,以及 Thomson Reuters 诉 Ross 案中首次驳回了用版权材料训练 AI 的合理使用抗辩,说明规则...

推荐理由:这篇文章把四个美国版权判例串成了一条清晰的结论:纯 AI 生成的代码没有人类作者,所以没法申请版权。对每天大量用 AI 辅助写代码的团队来说,这是个被忽略但风险极高的事实。没给更高分是因为它只讲了美国法律,没覆盖其他司法管辖区,而且对'人类参与多少才算有版权'这个灰色地带没展开。

Hacker News 首页

Vercel 开源了 fx,一个用 Zig 写的 6.39MB 极简编程助手

fx 是一个命令行编程助手,整个程序只有 6.39MB,冷启动只要 10 微秒,运行时内存占用也只有个位数 MB。它不挑模型,可以在本地跑,也能上云,还能编译成 WebAssembly 在浏览器里用。设计上走 Unix 风格:输出极简,没有笨重的终端界面,适合嵌到更大的系统里干活。目前版本号 v0.0.3,官方标了实验阶段,提醒说会频繁改动,先别往生产...

推荐理由:Vercel Labs 开源的一个编程 agent 外壳:6.39MB 二进制、10 微秒冷启动、支持 Wasm,技术选型很干净。没给更高分是因为版本太早期,没有使用数据和讨论热度,我会先打个折。

AI HOT 精选

Mojo 语言正式开源,编译器代码全部公开

Modular 公司把 Mojo 语言的编译器、工具链全部开源了,放在 GitHub 的 modular 仓库里,用的是 Apache 2.0 协议(带 LLVM 例外条款)。Mojo 是一门想同时搞定 CPU 和 GPU 编程的新语言,上周刚发布 1.0 版本,承诺了源码稳定性。这次开源意味着开发者可以自由编译和分发用 Mojo 写的程序,不用再依赖...

推荐理由:Mojo 刚发 1.0 就全开源,协议是 Apache 2.0 带 LLVM 例外,这意味着你可以自由编译分发用 Mojo 写的程序,不用再绑在 Modular 的平台上。对想用一门语言同时搞定 CPU 和 GPU 的人来说,这个信号很明确:不再只是试用,可以真用了。没给更高分是因为目前只有官方公告,社区实际反馈和第三方验证还没出来,我会先打个折。

8月18日星期二

Hacker News 首页

Nova3D 让模型直接写 Blender 代码来生成 3D 资产,而不是输出一个死网格

这篇论文的思路很直接:现在的 3D 生成模型大多只给你一个最终表面,看着还行,但没法直接用。Nova3D 换了个做法,它输出的是一段可执行的 Blender 代码,最终那个 glTF 模型文件只是代码跑完后的副产品。因为资产本质是程序,所以生成时就自带零件命名、父子装配树、关节和尺寸约束,不用事后再靠分割或手动绑骨去猜。他们在自己建的 54 项基准上测...

推荐理由:想法新鲜:把 3D 生成从输出表面改成输出可编辑程序,对游戏和仿真管线有实际价值。但这是一篇刚挂出来的 arXiv 预印本,没有产品时间线,也没有跨源讨论簇,所以刚好卡在 featured 门槛 72 分。