跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,196 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1021–1040 条 · 共 1,196 条

4月27日星期一

机器之心 · 公众号

ACL 2026 论文:给 AI 发个波浪号,它可能把你的主目录删了

这篇被 ACL 2026 接收的论文专门研究了表情符号对 AI 的语义干扰。团队拿 6 个模型测了 3757 条样本,平均混淆率 38.6%,而且超过九成出错时模型不会吭声,直接静默执行错误指令。最要命的是在 agent 干活的环境里,你让模型“忽略表情符号”的提示词效果很有限。正文没披露具体是哪些模型,也没说测试用的 agent 框架和任务场景,所以...

推荐理由:ACL 2026 这篇安全研究 HKR 三项全中:钩子用一个波浪号删主目录,够直接;3,757 用例、6 模型、38.6% 混淆率和 90%+ 静默失败,数据不虚;真正要命的是 Agent 场景,符号混进执行链后模型一声不吭就动手。不是模型发布或平台事故,纯研究,放在 78–84 分段合理。

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

Hacker News 首页

停止招新人,你的资深工程师就会反过来拿捏你

Justin Smestad 算了一笔账:如果公司从 2026 年起不招初级工程师,到 2030 年就会养出一支全是贵价老兵的团队,而且毫无还价能力。逻辑很简单——一个资深工程师可以开口要 40% 的涨薪,如果公司没有培养了两年的后备梯队,替代他可能要花六个月,还得按更高的市场价招人。初级员工不只是干杂活,他们是未来的中坚力量,是薪资谈判时的保险。文章...

推荐理由:这篇不是讲模型或产品,是一篇个人评论,但把账算得很清楚。核心逻辑是:你现在省掉初级人头,两年后高级工程师开口要 40% 涨薪,你连个能顶上来的中级都没有,外面招人还得搭进去半年。我会先打个折,因为 40% 和 6 个月这些数字正文没给出处,更像经验估算。不过它提醒了一件容易被季度报表掩盖的事——用 AI 代理替掉初级岗,省的是工资,多出来的可能是组织断层和议价权转移。对在看人效和 AI 落地的团队,这个视角值得扫一眼。

4月26日星期日

Hacker News 首页

OpenAI 不再用 SWE-bench Verified 测前沿编程能力,因为题目和答案都被模型背过了

OpenAI 发了一篇文章,解释他们为什么停止用 SWE-bench Verified 这个基准来评估模型写代码的能力。他们抽查了 o3 模型跑了 64 次都没稳定通过的 138 道题,发现至少 59.4% 的题目本身有问题:要么测试用例太死板,把正确的代码也判错;要么题目描述太模糊,怎么改都通不过。更关键的是数据污染——他们测的主流前沿模型都能直接复...

推荐理由:OpenAI 用一份审计报告把 SWE-bench Verified 拉下神坛,不是单纯吐槽,而是拿出了 59.4% 题目有缺陷、所有模型都能撞到答案细节的污染证据。这对靠榜单说话的编程模型赛道是个实打实的信任危机,所以重要性给到 82。但毕竟不是新模型或产品发布,只是评测标准换代,分数没再往上拉。

Hacker News 首页

西方忘了怎么造东西,现在开始忘怎么写代码

作者拿军工复产的惨痛教训来类比 AI 写代码对软件业的冲击。2022 年下的毒刺导弹订单要到 2026 年才能交付,因为图纸是卡特时期的,懂生产的工程师早退休了,没人接班。欧盟承诺一年给乌克兰一百万发炮弹,但当时年产能只有 23 万发,最后晚了九个月才凑齐。美国核弹头里一种叫 Fogbank 的材料更离谱,停产十几年后想复产,发现老工人都走了,连原始配...

推荐理由:这篇文章不是讲技术,是讲人。它拿军工制造的案例当镜子,照的是 AI 编程正在吃掉初级岗位的入口。我会先打个折:军工和软件行业的生产逻辑不完全一样,但管线断层的类比是成立的。正文没给 AI 编程的具体数据,全靠军工案例的冲击力撑着,所以分数卡在 74 是合理的——观点强,但缺一手编程侧的证据。

Hacker News 首页

知识工作的拟像:LLM 把表面功夫做得太好,反而让质量判断失灵了

作者在 2026 年 4 月 25 日发了这篇博客,核心观点很直接:大语言模型(LLM)打破了知识工作里靠“表面质量”当质量代理的潜规则。他举了市场分析报告的例子——一份报告日期不对、有错别字、图表贴错,你直接就不看了,因为连表面功夫都没做好的人,研究大概率也不靠谱。这种“看表面”的代理判断以前很管用,成本低、相关性也高。但 LLM 太擅长模仿专业文风...

推荐理由:一篇个人视角的尖锐随笔:大模型让产出看起来专业,但审查和信任机制没跟上。用咨询报告和代码审查举例,指出团队现在只是快速扫一眼就通过,真正该盯的是模型背后的概率偏好和评估方式,而不是产出本身像不像真的。观点清晰,但没有实证支撑,我会先打个折,当一篇引发思考的评论看。

Hacker News 首页

用 Claude Code 把烂尾项目捡起来跑通,这事不丢人

作者拿自己一个搁置已久的项目做实验:写一个中间层,把 YouTube Music 伪装成 OpenSubsonic 服务,让 Feishin、Symfonium 这些播放器能直接播 YouTube 上的歌。他用 Claude Code(Opus 4.6)从零搭,技术栈是 FastAPI、Pydantic、ytmusicapi 和 yt-dlp。做法是先...

推荐理由:这是一篇第一人称的实战记录,不是行业通稿。作者用 Claude Code 加 Opus 4.6 重写 YouTube Music 到 OpenSubsonic 的连接器,技术栈交代清楚,调试过程有具体细节。最值得看的是他的工作方式:先写清楚 spec,再让模型生成,最后人工验收,比一次性全丢给模型靠谱得多。信息量够、有可复用的思路,但影响范围就停在个人开发工作流这个层面,没到行业级更新。

4月25日星期六

Latent Space

DeepSeek 发布 V4 Pro 和 Flash 模型,能在华为昇腾芯片上跑

DeepSeek 终于发了 V4 系列,一共两个型号:V4 Pro 总参数 1.6 万亿,每次激活 490 亿;V4 Flash 总参数 2840 亿,激活 130 亿。两个模型都支持 100 万 token 的上下文,用了新的压缩注意力技术,相比 V3.2,处理长文本时计算量只要 27%,显存占用只要 10%。这次比较特别的是同时发了基础版和指令版,...

推荐理由:这条必须写。DeepSeek 这次放出的不只是模型,而是把华为昇腾兼容性摆上台面,等于在 CUDA 依赖上划了一刀。技术报告说 1M token 下只用 V3.2 27% 的算力、10% 的 KV 缓存,省得挺实在。两档参数和 MIT 许可也让落地门槛更低。我会先打个折:正文没提实际推理延迟和昇腾上的吞吐数据,这点先别太激动,但硬件独立性本身已经够重。

Computing Life · Share · 鸭哥调研

TPU 与 CUDA 的攻防战:Cloud Next 2026 之后的判断

Google 在 Cloud Next 2026 上放了三招:把第八代 TPU 拆成训练用的 8t 和推理用的 8i,8i 内存带宽比 8t 还高,专门对付长上下文推理;推出 TorchTPU,让 PyTorch 代码能直接在 TPU 上跑,不再需要以前那个问题一堆的桥接层;以及给 Anthropic 投了最多 400 亿美元并配 5GW 算力。这三件...

推荐理由:这篇文章把 TPU 和 CUDA 的竞争讲得很清楚,给了 8i 的硬参数和量产时间,也提到了 TorchTPU 这个降低迁移门槛的动作。但正文自己说了缺少独立 benchmark,而且 8i 要 2027 下半年才量产,所以判断 18-24 个月内 TPU 不会取代 NVIDIA。信息有料,但验证还弱,时间也远,所以重要性给到 82,放在 featured 里。

MIT Technology Review · AI

DeepSeek V4 发布预览版:两个型号、百万 token 上下文,开源模型里跑分最强

DeepSeek 放出了 V4 的预览版,分 V4-Pro 和 V4-Flash 两个型号。Pro 版输入每百万 token 1.74 美元、输出 3.48 美元,Flash 版只要 0.14 和 0.28 美元,两个都支持一次性处理 100 万 token 的上下文,相当于能把《魔戒》三部曲加《霍比特人》全塞进去。跑分上,V4-Pro 在编程、数学、...

推荐理由:我会先打个折:这只是预览版,不是完整发布,所以冲击力比 GPT 或 Claude 大版本换代要弱一档。但它是当天消息,而且信息量够——两个型号的定价、100 万 token 上下文、开源权重对代理编码栈的成本压力,这些对从业者来说都是能直接算账的东西。标题里说的三个理由,正文其实主要落在长上下文注意力的效率提升和开源带来的成本下压上,具体技术细节没展开,但方向是明确的。

Hacker News 首页

Google 上线 Flow Music,用 Lyria 3 做歌、Veo 生成 MV

Google 悄悄上线了 Flow Music 网页版,目前有歌曲、歌单、空间、视频、项目和 Turntable 六个板块。核心功能是跟一个叫 Producer 的对话式工具聊天做歌,官方说它背后是 Lyria 3 模型,能生成带人声的完整歌曲;AI 音乐视频部分接的是 Veo 模型,可以自己控制角色和画面风格。页面还展示了一些示例曲目和可交互的迷你乐...

推荐理由:我会先打个折:正文没披露价格、地区、模型参数和版权机制,这些关键信息全缺,所以重要性停在 76 不动。但 Google 把 Lyria 3 和 Veo 打包成一个网页端音乐创作入口,6 类入口直接列出来,Producer 能出完整歌曲,这点对从业者来说信号很明确——大厂在认真推 AI 音乐工具,不是 demo。没写版权怎么处理,先别太激动,但上线本身已经够让做音乐 AI 的人盯着看了。

4月24日星期五

Hacker News 首页

Affirm 用一周时间让 800 多名工程师集体切换 AI 编程智能体

2026 年 2 月,Affirm 停掉常规开发,让全公司 800 多名工程师花一周时间,用 AI 编程智能体(agent)把真实需求从想法一路做到提交 PR。到文章发布时,超过 60% 的 PR 都有智能体参与。文章说,2025 年底已经有 80% 以上的工程师每周用 AI 开发工具,但少数人用得很深、多数人还在观望,差距在拉大,所以他们决定用集中一...

推荐理由:这条消息的看点不是 Affirm 用了什么工具,而是组织层面的一次硬切换:800 多人的工程团队停摆一周,全员跑 agentic 开发流程,之后六成以上 PR 都有 agent 参与。数字够具体,动作够极端,对正在琢磨怎么推 AI 编码的团队来说,参考价值比普通客户案例高出一截。正文没给出长期质量和速度数据,这点先别太激动,但就冲这个规模和执行速度,值得放进 featured。

The Verge · AI

DeepSeek 放出 V4 模型预览,说能跟 Google、OpenAI、Anthropic 的闭源模型正面打

DeepSeek 在 4 月 24 号发布了开源 V4 模型的预览版,声称性能可以对标美国几家头部公司的闭源系统。这次重点提了编程能力提升,并且强调跟华为的硬件兼容——这基本就是在说,模型能跑在中国自己的芯片上。不过正文没披露参数量、具体跑分和正式发布时间。我会先打个折:编程强了多少、在什么任务上强,都没给数据,这点先别太激动。

推荐理由:DeepSeek 这次放出的 V4 预览版,我会先打个折——参数、基准分数、商用时间全都没披露,所以别急着激动。但信息量还是够的:代码能力提升直接指向让模型进业务流程干活的 agent 场景,而华为兼容性把模型进展和国产芯片栈绑得更紧,这两点比单纯刷榜更有看头。正文没给具体数字,所以重要性停在 83,等有实测数据再往上调。

机器之心 · 公众号

Anthropic 承认 Claude Code 变笨了,是这三个 Bug 搞的鬼

Anthropic 出来解释了,过去一个月大家觉得 Claude Code 质量下滑,不是模型本身变弱,也不是 API 出了问题,纯粹是工程层面的三个 Bug。第一个是 3 月 4 号把默认推理强度从“高”调成了“中”,相当于让模型干活时少动脑子;第二个是 3 月 26 号会话缓存出了错,可能让模型记错上下文;第三个是 4 月 16 号给提示词加了 2...

推荐理由:Anthropic 发了一篇很实在的事后说明,把 Claude Code 近一个月体验下滑归因到三个运行框架和提示词的 Bug,模型本身没退化。我会先打个折:这不是模型能力问题,而是产品配置翻车,但对天天用 Claude Code 写代码的人来说,推理强度被偷偷从 high 降到 medium、输出被限到 25/100 词,体感就是降智。文章把 3 月 4 日、3 月 26 日、4 月 16 日三个时间点的改动和回滚日期都标出来了,信息密度够,也直接点了 Sonnet 4.6、Opus 4.6、Opus 4.7 受影响,还提到 4 月 23 日重置...

量子位 · 公众号

Claude 承认三个 bug:推理降级、记忆清空、输出被限,越聊越傻不是错觉

Anthropic 在 4 月 23 号自己抖出了 Claude 近期的三个质量问题。第一个是 Claude Code 的推理强度,3 月 4 号起默认从高被偷偷调成了中,但界面还显示高,等于你花钱买高推理,实际跑的是省流版。第二个是 3 月 26 号出的缓存 bug,每次对话轮次都会清空思考状态,持续了 15 天,模型像失忆一样没法连贯想事。第三个是...

推荐理由:这是 Anthropic 自己发的故障复盘,不是用户单方面抱怨,所以信息可信度比一般吐槽高。HKR 三项都成立:标题自带钩子,三个 bug 都有日期和具体影响数字,而且把讨论从“AI 降智”的模糊叙事拉到了透明度和计费信任上,对从业者来说比单纯的情绪输出更有价值。不过毕竟只是复盘,不是新模型发布或重大安全事件,82 分合理。

Latent Space

GPT 5.5 和 OpenAI Codex 超级应用

OpenAI 发了 GPT-5.5,在 ChatGPT 和 Codex 里能用了,但 API 还要等安全加固。模型在 Terminal-Bench 2.0 上拿了 82.7%,SWE-Bench Pro 58.6%,API 支持 100 万 token 的上下文窗口。更值得看的是 Codex:内置浏览器操控,还把之前停掉的 Prism 功能并了进来,O...

推荐理由:OpenAI 发了 GPT-5.5,先在 ChatGPT 和 Codex 里上线,API 因为安全措施要等一等。跑分方面,Terminal-Bench 2.0 拿了 82.7%,SWE-Bench Pro 58.6%,API 上下文给到 1M token,算是能装下一整套代码库的水平。但真正值得盯的是 Codex 这边:浏览器控制能力和 Prism 合并,摆明了要做桌面端的超级入口,不只是聊天或写代码,而是直接操作你的电脑。这点先别太激动,正文没披露实际可用性和权限边界,但方向很明确——OpenAI 想把模型塞进业务流程里干活,而不只是当顾问。

X · @op7418(歸藏)

DeepSeek V4 发布,Flash 和 Pro 两个版本,Flash 输入每百万 token 只要两毛钱

DeepSeek 放出了 V4 模型,分 Flash 和 Pro 两档。Flash 主打便宜,每百万 token 输入 ¥0.2、输出 ¥1;Pro 贵不少,输入 ¥1、输出 ¥12。功能上支持 JSON 输出、工具调用、对话前缀续写和 FIM 补全。注意,如果上下文开到 100 万 token,输出价格会翻倍。正文没提模型规模、训练数据、基准跑分和具...

推荐理由:这是国内一线实验室的新旗舰模型发布,重要性和美国大厂发新模型看齐。摘要把 Flash/Pro 型号、JSON 输出、工具调用、FIM 和定价都列出来了,HKR 三项都站得住。不过正文没给评测基准、上下文窗口具体长度和开放范围,我会先打个折——信息缺口摆在那,别急着把话说满。

彭博科技

AI 编程公司 Cognition 正在谈新一轮融资,估值冲到 250 亿美元

Cognition 这家做 AI 编程工具的公司,正在早期融资谈判里把估值叫到了 250 亿美元,比上一轮翻了一倍多。正文没披露具体投资人、融资金额和时间表,目前只有彭博的简短消息,而且原文因为反爬机制没抓到完整内容。估值涨得快,说明市场对 AI 写代码这个方向还在加注,但具体条款和业务数据都还没公开,这点先别太激动。

推荐理由:Bloomberg 给了一个具体的市场信号:Cognition 在谈 250 亿美元估值,对关注编程代理的人来说,热度、新事实和相关性都占全了。没给 P1 是因为这轮融资还没敲定,投资方、金额和时间正文都没披露,我会先打个折。真正该盯的是定价速度,不是“AI 编程”这个旧叙事。

X · @dotey(宝玉)

Codex 接入 GPT-5.5,新增浏览器操控、文档生成和自动审查,从写代码工具转向干活智能体

Codex 现在能用 GPT-5.5 了,一口气加了五个能力。它能直接操控浏览器,自己点击页面、填表、截图看结果,走完整个流程再告诉你哪里有问题。文档方面,可以在 Microsoft Office 和 Google Drive 里直接生成表格、幻灯片和文档,应用内还加了文件预览器,改完就能看效果。电脑操控能力跟着 GPT-5.5 增强,能看屏幕、点击、...

推荐理由:这次 Codex 更新干货不少,核心不是简单挂了个新模型,而是把定位从代码助手往能跑连续任务链的智能体上推。我会先打个折:正文是二手消息,没给定价、没讲推送范围,也没交代那个审查智能体的安全门槛到底设在哪,所以先别太激动。但五个升级里,浏览器和电脑操控、跨办公套件生成文档、自动审查这几项,确实让 Codex 的干活边界变宽了,值得从业者盯着后续落地细节。

X · @dotey(宝玉)

OpenAI 发布 GPT-5.5,跑分涨了但延迟没变,还顺手发了 Codex

GPT-5.5 现在向 ChatGPT 付费用户和 Codex 开放,API 随后到。OpenAI 说它每 token 延迟跟 GPT-5.4 一样,但完成同样任务用的 token 更少,相当于能力涨了、效率也涨了。跑分上,Terminal-Bench 2.0 从 75.1% 提到 82.7%,FrontierMath Tier 4 从 27.1% 跳...

推荐理由:这是一次核心模型发布,带了基准、定价和百万 token 上下文,HKR 三项都踩中。标题说 API“很快”跟进,摘要里却已经给了 API 定价,这个不一致让我对时效性稍微打个折,但整体还是必须写的 p1 级别。正文最值得盯的是那句“同等智能下总 token 消耗约为前沿竞品编码模型的一半”——如果属实,成本优势不小,但没给出具体对比对象和测试条件,这点先别太激动。