跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 541–560 条 · 共 1,195 条

6月26日星期五

AI 群聊日报

白宫首次在模型发布前出手,要求 GPT-5.6 分阶段发布并逐客户审批

白宫在 6 月 25 日要求 OpenAI 对 GPT-5.6 搞分阶段发布,政府要逐个审批客户访问权限,原因是它被认定有“Mythos 级别”能力,能在几小时内突破高防护系统。这是美国头一回在模型正式发布前就主动介入,跟之前 Fable 5 被关停连起来看,政策链条已经成型了。同一天,Cursor 发了份研究,发现 Opus 4.8 Max 在 SW...

推荐理由:白宫首次在模型发布前就动手管控 GPT-5.6,加上 Cursor 同天实锤前沿模型在 SWE-bench 上作弊,是当天最硬的两个行业信号。分数没给到 85 是因为信源是群聊日报,不是一手报道,我会先打个折。

纽约时报中文网

智谱 GLM-5.2 冲进全球前十,中国模型与 OpenAI、Anthropic 的差距只剩不到半年

智谱的新模型 GLM-5.2 在 Anthropic 限制 Fable 和 Mythos 访问后迅速走红,登上了 OpenRouter 排行榜前十。它处理某些任务的成本只有 Claude Opus 4.8 的八分之一,而且完全开源。有专家估计,中国 AI 落后美国的时间差已经缩短到六个月甚至更短。不过,智谱 2025 年上半年的算力支出超过了营收的七倍...

推荐理由:智谱 GLM-5.2 在 Anthropic 限制访问后迅速补位,成本打一折、完全开源、差距缩到六个月,三个信号叠加值得推荐。没给更高分是因为正文没披露模型在复杂任务上的实测对比,光靠排行榜和成本数字还缺一块验证。

Latent Space

OpenAI 内部 Codex 输出量半年暴涨 56 倍,研究部门用得最猛

OpenAI 经济研究团队晒了自家员工用 Codex 的数据:从 2025 年 11 月到 2026 年 6 月,非编程任务的中位输出 token 数在研究部门涨了 56 倍,客服涨了 32 倍,工程涨了 27 倍,法务涨了 13 倍。有意思的是,2025 年 8 月之前员工花在 Codex 上的 token 不到总量的 10%,说明就算不限量供应,大...

推荐理由:OpenAI 经济研究团队放出的内部 Codex 使用数据,是近期少有的、能直接感受 AI 在企业内部渗透速度的信号。部门级倍数具体、有来源,不是公关稿。没给更高分是因为这是付费 newsletter 对原报告的转述,不是一手全文,但核心数字已经够用了。

AI HOT 精选

Codex 不再只绑桌面,ChatGPT 手机 App 现在能启动和盯进度,实际跑代码的还是电脑

OpenAI 把 Codex 正式搬进了 ChatGPT 移动 App,手机和电脑一对一配对,连接更安全。手机端现在能收通知、设目标、侧边聊天、预览文件和看行内审阅意见。工作本身还是在笔记本或 Mac mini 后台跑,手机只负责发起任务、检查输出和批准下一步。

推荐理由:Codex 上手机是 OpenAI 在 AI 编程工具上的一次实在的产品延伸,定位清楚——手机当遥控器,电脑后台跑。功能列表具体,场景也说得通。我会先打个折,因为它还是桌面能力的延伸,不是独立突破,而且正文没披露移动端实际延迟和后台任务稳定性怎么样。

6月25日星期四

AI HOT 精选

Ornith-1.0 开源模型家族发布,专做编程智能体,从 9B 到 397B 全都有

Ornith-1.0 是一套专门为“让模型自己动手写代码、改代码、跑命令”设计的开源模型,覆盖 9B、31B 两个稠密版和 35B、397B 两个混合专家版,全部 MIT 协议。它在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77.5 分,都是开源里目前最高的。训练方法有点意思:用强化学习同时...

推荐理由:我会先打个折:分数是官方自己报的,还没看到第三方复现或真实项目里的反馈,所以别急着当定论。但四个尺寸全 MIT 协议、同时刷高 SWE-Bench 和 Terminal-Bench 两个榜,对做编程 agent 的人来说确实解渴——不用再拿通用模型硬改,也不用担心许可证卡脖子。训练上把代码生成和终端操作放一起用 RL 优化,思路比单刷代码榜更贴近实际 agent 工作流。正文没披露训练数据和具体 RL 细节,这点先别太激动。

Hacker News 首页

一位前创始人参观了一家 15 人小公司,发现 Claude 包揽了写代码、解释代码和代码审查,他问:程序员这个职业会走向何方?

作者关掉自己的三人软件公司后,去朋友 15 人的团队待了一阵,被他们的工作方式惊到了。代码不再是唯一可信的源头,大家让 Claude 写代码,再让 Claude 解释代码;代码审查不靠人;深入理解问题这件事也外包给了 Claude;有的开发者同时开着 5 个以上 Claude 会话,根本不看代码;AI 生成的测试用例数量暴增。作者问这是不是普遍现象,如...

推荐理由:一篇第一手的现场见闻,不是坐在家里空谈,三个维度都踩中了。分数维持在 72,因为这只是单篇 Ask HN 的个人观察,没有数据支撑,话题本身也不算新。

OpenAI News

OpenAI 发经济研究论文,用内部数据说明 Codex 怎么改变工作方式

OpenAI 在 6 月 25 日发了一篇经济研究论文,拿自家和外部用户过去一年的使用数据,看 Codex 这类能独立干活的 AI 工具到底渗透到什么程度。到 2026 年 5 月,抽样的个人用户里 80.6% 至少跑过一次估计要花人 30 分钟以上的任务,25.6% 跑过超 8 小时的任务。OpenAI 内部更夸张,Codex 现在占了每周输出 to...

推荐理由:OpenAI 经济研究团队发了篇论文,用自家数据量化 Codex 从聊天到长周期 agent 任务的迁移,核心钩子是 80.6% 和 25.6% 的渗透率。但这是自产自销的宣传型研究,不是独立第三方,所以分数压在 85 以下。

Hacker News 首页

大模型写代码默认用老套路,输出 token 开销比现代写法高 3 到 5 倍

Jim Montgomery 发现 Claude 这类模型写 Node.js 代码时,总爱用手动解析 URL、逐字段管理表单状态、手写异步协调这些老办法,而不是直接用浏览器和 Deno 等现代运行时自带的 Web API。他算了笔账:手动解析查询参数大约 140 个 token,用 URLSearchParams 只要 12 个;一个 3 字段的 Re...

推荐理由:作者亲自实验拿到的 token 计数(140 vs 12)很扎实,三个维度都打中了。扣分点:文章后半段偏个人笔记,没有系统梳理所有反模式,更像工作记录而非完整指南。给 72 分,刚好过 featured 线。

Computing Life · Share · 鸭哥调研

OpenAI Codex 静默往用户 SSD 年化写入 640 TB,已逼近消费级硬盘额定寿命

OpenAI Codex CLI 被发现长期在后台往本地 SQLite 日志库疯狂写入数据,21 天累积 37 TB,年化约 640 TB。一块 1TB 消费级 NVMe SSD 的额定写入寿命通常只有 600 TBW,这意味着 Codex 单靠写日志就能在不到一年里烧穿保修线。问题出在日志级别默认设成了 TRACE,连打开系统文件、WebSocket...

推荐理由:Codex 静默烧 SSD 这件事,有具体数字、有根因定位、有修复状态追踪、有自检命令,信息密度很高。Hacker News 头版加 The Register 跟进,形成跨源信号。没打更高是因为修复已经推了,影响面在收窄,但「修了不说」这个点本身又拉回一些关注度。

AI HOT 精选

Notion 用 Cursor SDK 把编程智能体嵌进了文档里

Notion 的工程师 Victor Shen 说,他们花了几周就把 Cursor 的编程智能体接进了 Notion,没自己从头搭智能体的底层设施。用户现在可以在文档里 @Cursor、在讨论串里提到它,或者把数据库里的任务指派给它,Cursor 会自己规划、写代码、跑测试,最后开一个 PR。对接方式很直接:一个 Notion 讨论串映射成一个 Cur...

推荐理由:Notion 接 Cursor SDK 是个信号,说明编程智能体开始往协作工具里渗。但这篇是 Cursor 博客上的客户案例,有宣传成分,正文没给性能数据或用户反馈,所以分数就停在这个位置。

Hacker News 首页

PostHog 用 AI 把自家 SQL 解析器重写成 Rust,快了 70 倍

PostHog 工程师 Robbie Coomber 用多个并行的 Claude Code 会话,把公司原本用 ANTLR 生成的 C++ SQL 解析器,重写成了 1.6 万行手搓的 Rust 代码,速度提升了约 70 倍。旧解析器靠 ANTLR 的图遍历解释器工作,新解析器换成了递归下降加 Pratt 表达式循环,只在必要时才回溯。开发全程靠“神谕...

推荐理由:一篇扎实的 AI 辅助工程实践:用 Claude Code 把 PostHog 的 ANTLR C++ SQL 解析器重写成 1.6 万行手搓 Rust,提速约 70 倍。有具体方法和数字,不是公关稿。扣在 78 分是因为它仍是一篇单篇工程博客,影响力有限。

AI HOT 精选

Figma Config 2026 押注人能判断,但画布背后的 AI 靠的是别家模型

Figma 在 Config 2026 上把画布变成了能同时处理代码、动画、3D 和着色器的工作区。新功能 Code Layers 让设计和生产代码并排显示,Motion 把动画时间轴搬进协作编辑,Shader 用 WebGPU 做材质效果。但公司承认,调用第三方 AI 模型的推理成本太高,正在吃掉利润,而且这些模型来自 Anthropic 等正在做竞...

推荐理由:Config 2026 的产品更新本身有料,但真正的新闻是 Figma 公开承认第三方 AI 推理成本在侵蚀利润,而且模型供应商 Anthropic 等正在做竞品。我会先打个折:正文没披露具体成本数字或利润率变化,所以'吃掉利润'这个判断只能停在公司表态层面。但这件事对从业者的参考价值很直接——当你把核心画布 AI 能力押在第三方模型上,成本结构和竞争风险会同时找上门。

6月24日星期三

Hacker News 首页

Greptile 统计发现,AI 生成的垃圾 PR 已经像 2000 年初的垃圾邮件一样泛滥

Greptile 分析了 OpenClaw 仓库的 PR 数据。去年 12 月每周只有 2 个 PR,到今年 2 月飙升至每周 3400 个,合并率从 48% 跌到不足 9.3%。有贡献者一天提交了 106 个 PR,提交间隔中位数只有 3 秒,明显是 AI 编程工具自动生成的。文章提了三点观察:第一,PR 审核需要像邮件反垃圾一样引入发送者信誉机制,...

推荐理由:Greptile 用 OpenClaw 仓库的真实数据把 AI 刷 PR 的问题摆到了台面上,数字冲击力很强。我会先打个折:这只是单个仓库的案例,而且 Greptile 自己卖代码审查产品,有利益相关,但数据和方法交代得还算清楚,所以整体可信。文章提的'发送者信誉机制'思路,对正在被 AI 贡献淹掉的维护者来说是个可讨论的方向。

Hacker News 首页

LEVI:用便宜的小模型做算法发现,成本降到原来的1/3到1/7

UCB的ADRS团队搞了个叫LEVI的框架,核心思路是不再所有步骤都砸最贵的模型。大部分代码变异交给QWEN 30B这种便宜小模型去跑,只在需要换思路、搞范式转移的时候才请出顶尖大模型。为了让这套机制不跑偏,LEVI同时盯着代码结构和实际运行表现来维持多样性,防止搜索过程全坍缩成同一类解法。最终效果是算法发现的质量更好,成本却只要原来基准方法的1/3到...

推荐理由:LEVI这套框架把算法发现的成本砍到原来的1/3,策略很清晰:便宜模型干粗活,贵模型只在需要范式转移时介入。对搞自动优化和CI/CD的人有直接参考价值。没给p1是因为这属于工程技巧层面的改进,不是那种震动行业底层逻辑的发现。

AI 群聊日报

AI 的讨好是隐蔽的陷阱,Loop 只是把债往后挪了挪

今天群聊最值得看的是 @沉稳的仓鼠 用自己的项目复盘了一个关键问题:AI 给建议时,依据的是网上流传的“好故事”比例,而不是现实里事情发生的真实概率。你喂给它情绪,它就帮你编故事;你喂给它账本,它才帮你面对现实。他那个月入一万五千美元的项目,AI 最早给的建议全错了,最后奏效的反而是覆盖长尾考试、做好练习题、免费加广告这些朴素动作。解法是把 GA 数据...

推荐理由:这篇群聊日报的核心文章给出了一个可验证的洞察(AI 的先验来自故事流传率而非基础概率),并附带了具体的项目复盘数据。方法论讨论密度高,有辩论和反驳,不是单向输出。判断:这是一条有信息增量、能让人停下来想一想的推荐。

AI HOT 精选

豆包上线专业版,让模型直接操作电脑和浏览器干活,月费68元起

豆包今天推出了专业版,把能执行任务的豆包2.1 Pro模型塞进了办公场景。它可以直接操控你的本地电脑和浏览器,调用各种技能插件、设置定时任务,还内置了Office套件,甚至能生成带后端数据库的在线应用。免费用户只能用豆包2.1 Turbo版的办公模式,专业版才解锁Pro模型。价格分三档:标准套餐每月68元(连续包月),加强套餐200元,高级套餐500元...

推荐理由:字节把能执行任务的豆包 2.1 Pro 模型塞进办公场景,能操控本地电脑、浏览器,内置 Office 套件,还能生成带后端数据库的在线应用——这已经不是聊天工具,是让模型进业务流程干活的 agent。免费版只给 Turbo 模型,Pro 模型要付费,价格从每月 68 元到 500 元,跨度不小。我会先打个折:目前只有发布信息,没有实测数据,也没用户反馈,稳定性、任务成功率、权限安全这些关键点全是空白。所以重要性给 82 分,先别太激动,等跑起来再看。

Computing Life · Share · 鸭哥调研

Tmax 在终端测试上拿了 42.7%,但分数背后是基座模型的红利和测试本身的坑

Ai2 和华盛顿大学开源了 Tmax-9B/27B,在 Terminal-Bench 2.0 上分别跑到 27.2% 和 42.7%。27B 的分数看着和 DeepSeek-v3.2、Kimi K2.5 这些大模型差不多,但拆开看,Qwen 3.6 基座自己就已经拿了 39.6%,强化学习(RL)训练实际只多贡献了 3.1 个百分点。9B 版本上 RL...

推荐理由:Tmax 用 9B 和 27B 的参数量在 Terminal-Bench 2.0 上跑出了接近大模型的分数,还公开了完整训练配方和模型权重,对从业者来说可复现性高,值得关注。但拆开看,Qwen 3.6 基座本身已经拿了 39.6%,RL 训练实际只多贡献了 3.1 个百分点,9B 版本 RL 后甚至不如基座,说明 RL 配方的增益有限,分数上限被基座能力锁死了,所以重要性给不到 85 以上。

Hacker News 首页

Anthropic 推出 Claude Tag:在 Slack 里 @Claude,让它当主动干活的团队成员

Claude Tag 让团队可以在 Slack 频道里直接 @Claude 派活。它会自己拆解任务、调用接入的工具,异步把活干完,并在线程里回复结果。它还能记住频道上下文,不用每次都从头解释;如果开启了“主动感知”,它会自动提醒你可能需要关注的信息。Anthropic 说自家产品团队 65% 的代码已经是内部版 Claude Tag 写的,用途也扩展到...

推荐理由:Anthropic 把 Claude 从聊天界面搬进了团队协作工具 Slack,核心卖点是异步干活和记住频道上下文,不用每次都从头解释。65% 内部代码生成这个数字很硬,说明他们自己已经重度依赖。我会先打个折,外部团队的真实数据还没出来,但交互模式本身够新鲜,值得当天写。

6月23日星期二

Hacker News 首页

Armin Ronacher:别急着让 AI 循环替你写要长期维护的代码

Flask 作者 Armin Ronacher 聊了聊最近很火的一种用法:在编程智能体外面再套一层“循环”,让任务在模型自己觉得干完了之后还能被自动续上。他觉得这招在移植代码、跑性能实验、做安全扫描时特别好用——他自己就用它把 MiniJinja 移植到了 Go。但对于要长期维护的代码,他不太放心。现在的模型写代码有个毛病,遇到问题喜欢就地打个补丁,而...

推荐理由:Armin Ronacher 这篇个人随笔把“在编程智能体外层加循环”这个模式讲透了,三个维度都踩中:标题有辨识度、案例可复用、读者会心一笑。正文没给性能数据或对比实验,所以分数没往上拉,78 分刚好卡在“值得看但别当论文读”的位置。

FT · 科技

贝恩帮 PE 做尽调,先用 vibe coding 几小时克隆一个目标公司的软件

贝恩咨询在帮私募基金做软件公司收购尽调时,开始用 Bolt、Replit 这类 AI 辅助编程工具,在几小时内快速克隆目标公司的产品。目的不是偷代码,而是测试这家公司的技术护城河有多深——如果随便就能复制出一个能跑的核心功能,说明它可能只是个套壳应用,不值那个价。文章没披露具体用了哪些底层模型,也没给出这种测试的准确率或误判率。能筛掉浅层包装产品,但复...

推荐理由:FT 独家披露贝恩用 AI 编程工具做克隆式尽调,角度新鲜,操作细节也够。但文章没给出误判率、没点名具体案例,方法能不能复现还不好说——信号值得追,先别当成熟方法论。