跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1041–1060 条 · 共 1,195 条

4月24日星期五

The Verge · AI

OpenAI 发了 GPT-5.5,说写代码更强、也更省资源

OpenAI 在 4 月 23 号公布了 GPT-5.5,主打编程和调试能力,还能跨表格、文档这些工具干活。官方说它比上个月发的 GPT-5.4 效率更高,但正文没给出具体的跑分、上下文窗口大小和定价。我会先打个折——没看到实测数据之前,这些“更强更省”的说法还不好直接当真。

推荐理由:OpenAI 发新模型是当天该追的事,而且这次把效率、编程和工具调用捆成一个升级点来讲,HKR 三项全中。正文没披露价格、上下文窗口和基准分数,所以分数停在 87 而不是 90+。我会先打个折:没跑分、没定价,光说“更强”还差点意思,但工具调用和多步骤执行这个方向本身值得盯。

Hacker News 首页

Anthropic 复盘 Claude Code 近期质量下滑:三次产品层改动惹的祸,API 没受影响

Anthropic 发了一篇事故复盘,解释了最近不少用户感觉 Claude Code 变笨、变健忘的原因。问题出在三次产品层的改动上,API 和模型本身没变。第一,3 月 4 日他们把默认的思考强度从“高”调成了“中”,想解决高思考模式下界面卡死的问题,结果用户普遍觉得模型变蠢了,4 月 7 日又改了回去。第二,3 月 26 日上线了一个缓存优化,本意...

推荐理由:Anthropic 这份事后说明给了三个具体根因、时间点和修复版本,HKR 三项都站得住。比普通产品更新更有分量,因为它暴露了默认值、记忆处理和系统提示这些非模型层的改动也能把编码体验拉下来,但本质上还是一份事故报告,不是重大突破。

4月23日星期四

量子位 · 公众号

Qwen3.6-27B 开源,参数只有前代旗舰的十五分之一,但在智能体编程上反超了 397B 模型

Qwen 放出了 Qwen3.6-27B 的权重,一个 270 亿参数的稠密模型。官方说它在四项智能体编程基准上全面超过了自家上一代 3970 亿参数的旗舰 Qwen3.5-397B。具体看,SkillsBench 从 30.0 跳到 48.2,GPQA Diamond 拿到 87.8,AIME26 达到 94.1,说明模型在需要调用工具、写代码解决问...

推荐理由:这是一次有料的 Qwen 开源发布,给出了智能体编程和推理的硬分数,HKR 三项都站得住。我维持 84 分不往上加,因为正文只给了基准数字,没提上下文窗口、推理成本或独立复现结果,这些缺口让判断先打个折。

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

新智元 · 公众号

Anthropic 在私募二级市场报价冲到 1.05 万亿到 1.15 万亿美元,首次超过 OpenAI 的约 8800 亿美元

这个数字来自私募二级平台(比如 Forge Global)上的报价,不是新一轮融资估值。三个月前 Anthropic 的融资估值还是 3800 亿美元,现在二级市场直接翻了三倍左右。市场给出的理由是流通股少、Claude Code 和收入增长势头猛。但正文没披露实际成交量、具体收入数字,也没公司官方确认,所以这个万亿身价更像少数交易撑起来的价格,先别太当真。

推荐理由:我会先打个折:这不是官方融资估值,而是私募二级平台的报价,成交量、收入规模和公司确认都没披露,所以别太激动。但信息本身有嚼头——它把 Anthropic 从三个月前 3800 亿的融资估值直接拉到万亿级别,背后是流通股少、Claude 产品势头和投资者情绪在起作用。对从业者来说,这更像一个市场温度计,而不是一张成绩单。

纽约时报中文网

Anthropic 造了个能找软件漏洞的模型 Mythos,现在只给美国用,连盟友都急了

Anthropic 发布了一个叫 Mythos 的模型,专门用来发现银行、电网和政府软件里的隐藏漏洞。公司说它太危险,不能公开,目前只跟美国 11 家科技公司和 40 多家关键基础设施机构共享,海外只有英国拿到了访问权。英国安全研究所的测试证实,Mythos 能完成以前任何 AI 都做不到的复杂网络攻击。欧盟、德国等盟友还没拿到模型,只能干着急;中国和...

推荐理由:这篇不是常规模型发布,更像一次准地缘政治的网络能力管制实验。Anthropic 把 Mythos 圈在极小范围,只给美国及英国部分机构用,还拉上 11 家合作方修漏洞,说明他们自己都怕这东西被滥用。正文没披露具体评测方法和基准分数,所以“比核弹还糟糕”这种说法先打个折,但 18 个月内类似能力扩散的预估值得盯紧。

彭博科技

SpaceX 想用 600 亿美元买下 AI 编程工具 Cursor,a16z 和 Thrive 可能大赚一笔

彭博这篇报道的正文被付费墙挡住了,只拿到了标题和摘要片段。已知信息是:SpaceX 正在考虑收购 AI 编程助手 Cursor,报价高达 600 亿美元。如果交易成了,a16z 手里大概 10% 的股份能值 60 亿美元左右。Thrive Capital 的持股比例正文没披露,具体赚多少也算不出来。另外,这笔交易到底签没签、走到哪一步了,文章里也没说清...

推荐理由:这条消息不是纯财经边角料,它把 AI 开发工具推到了一个很怪的收购场景里。SpaceX 600 亿买 Cursor 的传闻本身够新、够具体,也够让人想讨论。我会先打个折:文章没写交易有没有落定,也没说 Cursor 产品路线和商业化会不会因此转向,所以停在 featured,不上 p1。

Latent Space

Shopify 的 AI 用量在 2026 年爆发,CTO 聊了无限 Opus-4.6 预算和内部工具 Tangle、Tangent、SimGym

Shopify CTO Mikhail Parakhin 在这期播客里详细拆解了公司怎么把 AI 用进骨子里。他说 2025 年 12 月模型质量有个明显跃升,之后内部 AI 工具的使用量就炸了,而且命令行工具的增长比传统 IDE 插件还猛。现在写代码已经不是瓶颈,瓶颈变成了代码审查、CI/CD 流程和部署稳定性,所以他们自己搞了一套 AI 代码审查系...

推荐理由:这篇是 Shopify CTO 的深度访谈,信息密度高,没有公关腔。我会先打个折:正文没披露 2026 年使用激增的具体数据,所以不能当硬证据用。但真正值得盯的是他们内部把 AI 编程的瓶颈从生成代码推到了评审和部署环节,这个判断对从业者比一个孤立的增长数字更有用。三个内部项目名字和定位都给了,不是空泛的趋势发言。整体属于有料、有判断、缺一点量化验证的优质一手信源,放在 featured 没问题。

Hacker News 首页

代码模型修 bug 时总爱把整个函数重写一遍

作者用程序给 BigCodeBench 的 400 道题植入单点 bug,发现很多模型在修 bug 时会过度编辑——明明改一行就能修好,它却把半个函数重写了,甚至加一堆没必要的检查。文章用 token 级编辑距离来量化这种“改多了”的程度,并尝试通过训练让模型学会只做最小改动。正文没披露最终测试结果和模型排名,也没说训练后到底省了多少编辑量。

推荐理由:这篇文章的切入点很巧,用 400 道题的 bug 注入实验把“模型修 bug 时过度改写”这个模糊感受变成了可量化的编辑距离。对 AI 编程工具的用户来说,多改一行正确代码就是多一份审查成本和上线风险,所以相关性直接拉满。不过正文截取没给出具体结果、模型排名和效果幅度,我会先打个折——知道问题存在,但不知道严重到什么程度、哪些模型更爱乱改,这点先别太激动。

Hacker News 首页

Zed 编辑器推出并行 Agent 功能,一个窗口里能同时跑多个 AI 助手

Zed 在 4 月 22 日更新了并行 Agent 功能,核心是在一个窗口里同时跑多个 AI 助手干活。新增的线程侧边栏可以给每个线程单独设置能访问哪些文件夹和代码仓库,还能随时停止、归档或新建线程。默认界面布局也改了,线程和 Agent 面板挪到了左边,项目文件树挪到右边,老用户需要手动切换才会生效。Zed 团队说这个设计是为了让开发者既能用 AI ...

推荐理由:Zed 官方产品更新,HKR 三项都踩实了:并行 agent 加线程级权限隔离。分数停在 76 是因为正文没给性能对比、价格影响、用户量或外部验证,目前还只是单个工具自己的迭代,我会先打个折。

Hacker News 首页

有创业公司开始炫耀 AI 账单比员工工资还高,把 token 花费当成增长指标

Swan AI 的 CEO 发帖说,他们 4 个人的团队一个月给 Claude 花了 11.3 万美元,他把这笔钱看作本该用来招人的预算,目标是不到 10 个人做到 1000 万美元年收入。Fundable AI 的联合创始人也在底下附和,说 AI 能顶一个 15 人的文档处理团队。文章点出一个风向:token 花费正在被当成一种新的虚荣指标,但花得多...

推荐理由:我会先打个折:这篇不是硬核技术进展,而是一篇评论性质的趋势观察。H 分给得高,是因为它把“AI 账单超过人力成本”这个反转直接摆到台面上,容易引发讨论。K 分靠的是 Swan AI 那个 11.3 万美元/月的 Claude 账单,数字够具体,能让人直观感受小团队在模型调用上的投入有多猛。R 分确实有,它踩中了“用 token 消耗替代人头”的焦虑,但正文自己也承认这更像一种增长指标而非已验证的 ROI,Fundable AI 说能替代 15 人团队的说法也没给出验证细节,所以不能当市场级事件来推。整体判断:值得从业者看一眼,但别急着把它当成行业拐点。

4月22日星期三

Hacker News 首页

Show HN 提交量翻了三倍,现在大部分是 AI 一键生成的页面

Adrian Krebs 用脚本扫了 500 个 Show HN 落地页,发现 67% 的页面至少命中 2 个 AI 设计特征,比如 Inter 字体、紫色渐变、卡片彩色左边框、图标功能网格这些模板化痕迹。检测方法是用 Playwright 跑无头浏览器,在页面里直接检查 DOM 和计算样式,靠 15 条硬规则判断,人工抽查下来误判率大概 5% 到 1...

推荐理由:这条值得推给做 AI 工具和产品的人看。Adrian Krebs 没在评模型能力,而是用一套土办法——Playwright 跑脚本检查 DOM 和样式——发现 Show HN 现在 67% 的页面都命中至少两个 AI 设计特征。我会先打个折:这是单人实验,不是严格审计,误报他自己也认了 5% 到 10%。但信号比数字本身重要:AI 默认生成的前端模板正在让产品页面快速趋同,这对靠差异化吃饭的早期项目不是好事。正文没披露具体是哪 15 个特征,也没给误报的详细拆解,所以别当行业报告用,当个警钟看刚好。

Hacker News 首页

Qwen 开源 27B 稠密模型,编程能力超过自家 397B 的 MoE 老旗舰

Qwen 放出了 Qwen3.6-27B,一个 270 亿参数的稠密模型,主打编程,而且直接开源。它最狠的地方是跑分超过了上一代 3970 亿总参数(每次激活 170 亿)的 MoE 模型 Qwen3.5-397B-A17B。在 SWE-bench Verified 上拿了 77.2 分,比老旗舰的 76.2 高;在 Terminal-Bench 2....

推荐理由:Qwen3.6-27B 是一次有分量的开源模型发布,权重直接可下,编程基准分数明确,而且走的是稠密路线而非更大的 MoE。对 AI 从业者来说,这意味着用更低的部署成本去试一个旗舰级编程模型。HKR 三项都站得住,按规则,国内大模型的重要发布应该和同等美国实验室的发布给到同一档分数。

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

The Verge · AI

Anthropic 最危险的模型 Mythos 被一群 Discord 用户白嫖了两周

事情很简单:Anthropic 的一个承包商权限没管好,加上网上公开的搜索技巧,让一小撮 Discord 用户摸到了内部模型 Claude Mythos Preview。这个模型能找出主流操作系统和浏览器里的漏洞并利用它们,听起来确实吓人。但报道里没写清楚到底有多少人拿到了权限、用了多久、Anthropic 现在有没有把漏洞堵上。核心问题其实是访问控制...

推荐理由:标题党归标题党,但这事本身是实打实的访问控制翻车。正文没披露到底多少人摸到了模型、摸了多久、修没修好,所以我会先打个折。真正值得盯的不是“最危险的模型”这种定性,而是入侵路径太简单了:承包商权限加常规侦查工具就进去了。如果是真的,说明 Anthropic 在第三方权限管理和模型隔离上出了纰漏,这对所有做前沿模型的公司都是一记警钟。

新智元 · 公众号

马斯克给 Cursor 定了两条路:要么 600 亿美元卖给 SpaceX,要么交 100 亿合作费

SpaceX 给 AI 编程工具 Cursor 开出了硬性合作条件:今年内要么被 SpaceX 以 600 亿美元收购,要么支付 100 亿美元的合作费。这笔账背后是马斯克旗下 xAI 已经在用 Colossus 超算给 Cursor 的 Composer 功能做模型训练,而 Cursor 到 2026 年 2 月年化收入已超 20 亿美元、日活用户破...

推荐理由:这条消息的料主要在那组交易条款上:600 亿买断或 100 亿续约,数字够大,结构也够绑人。HKR 三项都站得住——钩子强、事实硬、对行业格局有直接冲击。不过正文没给原始文件,也没多方信源交叉验证,所以分数停在 featured 高位,不拉满到 p1。我会先打个折,等看到更实的证据再往上调。

FT · 科技

SpaceX 拿到了收购 AI 编程工具 Cursor 的权利,估值 600 亿美元

FT 这篇报道正文被付费墙挡住了,只能看到标题和 RSS 摘要。标题说 SpaceX 获得了收购 AI 初创公司 Cursor 的权利,作价 600 亿美元。RSS 摘要补了一句背景:马斯克的火箭和 AI 集团正在追赶 OpenAI 和 Anthropic。但正文没披露这笔交易的具体触发条件、时间表、交易结构或监管条款。关键信息是“获得权利”不等于已经...

推荐理由:FT 说 SpaceX 拿到了以 600 亿美元收购 Cursor 的权利,金额够大,信源也有分量,所以放进 featured。我会先打个折:标题里的“收购”别直接当完成交易看,正文没披露权利怎么触发、有没有绑定后续融资或控制权条款。真正值得盯的是这个权利本身是不是 Musk 在 AI 工具链上埋的一步棋,以及 600 亿这个数对代码助手赛道估值意味着什么。

X · @dotey(宝玉)

Anthropic 没发公告,悄悄把 Claude Code 从 20 美元 Pro 套餐里拿掉了

有人在 Anthropic 的功能对比表里发现,Pro 套餐对应的 Claude Code 一栏变成了叉号,多篇帮助文档也删掉了“Pro 套餐包含 Claude Code”的说法。但 Claude Code 产品页面和客服机器人还写着包含,部分 Pro 用户反馈目前仍能使用,正文没披露 Anthropic 的正式解释或生效时间。如果这个变更落地,开发者...

推荐理由:这条值得上 featured,因为门槛变化一旦落地,Claude Code 的入门价直接翻五倍,对个人开发者冲击不小。但 Anthropic 没给正式说明,生效时间和现有 Pro 用户怎么处理都不清楚,所以不往更高层级放。我会先打个折:正文没披露官方回应,现有信息都来自页面比对和用户反馈,这点先别太激动。

TechCrunch · AI

SpaceX 与 Cursor 合作开发 AI 编程工具,并手握 600 亿美元收购期权

SpaceX 宣布和 AI 编程助手 Cursor 达成合作,要一起搞下一代“写代码和知识工作”的 AI。更关键的是,协议里藏了一个收购期权:SpaceX 有权在今年晚些时候以 600 亿美元买下 Cursor。这个价格高得离谱,但正文没披露期权的触发条件、有效期、支付方式,也没说收购后 Cursor 团队和产品怎么整合。文章点出了一个更根本的软肋:C...

推荐理由:这条消息我会先打个折,因为正文没披露收购期权的期限、触发条件和钱怎么付,600 亿这个数先别太激动。但它的钩子很实在:SpaceX 和 Cursor 绑在一起,还带了个天价收购选项。更值得盯的是摘要里点出的短板逻辑——Cursor 和 xAI 都没有能跟 Anthropic、OpenAI 头部产品打平的自有模型。这意味着合作可能是用工程场景和数据换工具链深度,而不是纯技术碾压。对 AI 从业者来说,这比一个孤立的融资新闻更有嚼头,因为它直接关系到你每天写代码用的工具未来会站哪队。

Hacker News 首页

Anthropic 把 Claude Code 从 20 美元月费的 Pro 套餐里拿掉了,新用户没法用

Anthropic 悄悄改了规则,新订阅 20 美元/月 Pro 套餐的用户不再包含 Claude Code 编程工具。老 Pro 和 Max 用户暂时不受影响。官方说法是“在约 2% 的新个人用户里做测试”,但帮助文档已经从“Pro 或 Max 套餐可用”改成了“Max 套餐可用”,官网定价页也同步去掉了 Pro 的 Claude Code 入口。正...

推荐理由:这条消息在三个维度上都站得住:Pro 缩水本身就是个意外转折,文章用帮助页存档和官方回应把证据链补上了,而且开发者对定价和权益变动天然敏感。我会先打个折——目前只影响新用户测试群,正式政策时间表和回溯范围正文都没披露,所以重要性停在 76 是合理的。