跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1081–1100 条 · 共 1,195 条

4月18日星期六

X · @dotey(宝玉)

Anthropic 设计师一人扛 7 条产品线,分享了 9 条用 Claude 做设计的实操心得

Anthropic 设计师 Ryan Mather 一个人负责公司 7 个产品线,他公开了自己用 Claude Design 的工作流。核心是先花一小时让 Claude 把代码库和设计稿抽成一套 UI Kit,后续生成的设计稿会自动套用风格,省掉重复劳动。协作上,他建议设计师和工程师一起看着画布边聊边改,取代过去“出稿→丢给开发→返工”的接力模式。操作...

推荐理由:这是条扎实的实操笔记。Anthropic 自家设计师现身说法,给的 9 条建议都能直接落地,不是泛泛聊趋势。我会先打个折:正文没披露省了多少时间、任务成功率这些硬指标,所以分数停在 76。但“人做人审”变成“Claude 做、人审”这个流程转向,对从业者来说比很多产品公告更有参考价值。

彭博科技

AI 编程工具 Cursor 正在谈一轮 20 亿美元融资,估值可能超过 500 亿

彭博这条消息很短,正文因为反爬机制没抓到,只从标题和摘要里能确认:Cursor 在谈一笔 20 亿美元的融资,投后估值会超过 500 亿美元。目前没披露投资人是谁、轮次、营收和时间表。500 亿这个估值门槛比融资本身更值得看——如果谈成,说明市场对 AI 编程工具的商业化预期拉得很高。但正文没披露具体条款,这点先别太激动。

推荐理由:彭博的信源让这条消息有分量,20 亿和 500 亿这两个数字同时踩中 H、K、R 三点。我维持 84 分,不上首页,因为交易还在谈,正文没披露投资人、ARR 和交割时间,先别太激动。

4月17日星期五

Hacker News 首页

实测 Claude 4.7 新分词器:技术文档的 token 消耗涨了 47%

作者用 Anthropic 的免费 token 计数接口,拿同一批内容分别喂给 Claude Opus 4.6 和 4.7,看 token 数涨了多少。7 份真实 Claude Code 用户会发的样本(包括 CLAUDE.md 文件、终端输出、代码 diff 等)加权后从 8254 个 token 涨到 10937 个,整体多了 32.5%。其中技术...

推荐理由:这篇不是官方通稿,是第三方实测,把“同价”背后的 token 膨胀算清楚了。我会先打个折:IFEval 只抽了 20 题,样本量不大,但真实文档 1.47 倍、中文日文几乎不涨这些数字对实际用量有参考价值。对用 Claude Code 的人,窗口烧得快、缓存命中变贵、限流更容易触发,这些比 IFEval 涨 5 个点更值得盯。正文没披露样本的具体内容,但加权方法和对照设置交代得够用。

Hacker News 首页

Anthropic 实验室推出 Claude Design,用对话就能生成设计稿

Anthropic 在 4 月 17 日上线了 Claude Design,目前是研究预览版,Pro、Max、Team 和 Enterprise 用户都能用。它基于 Claude Opus 4.7,你给它文字描述、图片、文档(DOCX、PPTX、XLSX)甚至代码库,它就能生成设计稿、原型、幻灯片或单页宣传页。比较特别的是,它能直接读取你团队的代码和设...

推荐理由:这是 Anthropic 一次有分量的产品发布,不是小功能补丁。HKR 三项都站得住:形态新、部署细节够、工作流共鸣强。但研究预览的身份和没单列的价格让我把分控在 84,没给更高。真正值得盯的是它和 Claude Code 的交接链路,如果跑通,设计到代码的流转会变短。

腾讯技术工程 · 公众号

腾讯工程师用 Claude Code 跑通后台开发全流程,11 个环节在一个终端里搞定

这篇文章来自腾讯技术团队的一次实践复盘,他们用 Claude Code 搭配自定义的 Skills、Commands 和 MCP 服务器,把后台开发的 11 个步骤串成一个终端里的流水线。需求探索这一步花了 20 次工具调用、9.38 万 token、56 秒;执行阶段拆成 4 个任务,产出了 3 次代码提交。核心不是让 AI 直接写代码,而是把需求分...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是一篇来自一线的实践复盘。但它把 agentic engineering 从概念拉到了可复现的后台开发流程里,token 消耗、工具调用次数、人工卡点都给了具体数字,比市面上大多数“AI 写代码”的公关稿扎实。对正在琢磨怎么让模型进业务流程的从业者来说,这套终端内的编排思路和踩坑记录值得一看。

Hacker News 首页

Discourse 明确表态:不会因为 AI 能扫漏洞就把代码闭源

论坛软件 Discourse 发博客回应了最近 Cal.com 因害怕 AI 扫描漏洞而闭源的举动,直接说他们不会走这条路。Discourse 已经以 GPLv2 协议开源了 13 年,他们认为闭源反而会削弱防守能力。文章里提到,他们团队用 GPT-5.3 Codex、GPT-5.4 和 Claude Opus 4.6 扫自己的公开代码库,最近一次月度...

推荐理由:这不是模型发布,是一线团队对“AI 会不会逼 SaaS 公司闭源”的直接回应。HKR 三项都踩实了:Cal.com 闭源制造了冲突钩子,具体的模型名和安全修复数字给了干货,最后落到开发者最焦虑的开源护城河问题上。不过它终究是单家表态,不是行业级转折,所以留在 featured 低位合理。

Latent Space

Anthropic 发布 Claude Opus 4.7:每个推理档位都压过 4.6 一头,还新增了 xhigh 模式

Anthropic 推出了新旗舰模型 Claude Opus 4.7,价格没变,还是每百万输入/输出 token 收 5 美元和 25 美元。最直观的变化是性能档位全面上移:4.7 的低档(low)比 4.6 中档强,中档比 4.6 高档强,高档则超过了 4.6 的 max 档。此外还新增了一个叫 xhigh 的推理强度,Claude Code 现在默...

推荐理由:Anthropic 旗舰模型更新,给了一堆可验证的数字和变化点,不是空对空吹牛。HKR 三项全过:钩子清楚、信息量足、对 Claude 用户群高度相关。重要性给 90 没毛病,属于那种“先别激动但值得马上看”的更新。

X · @dotey(宝玉)

Boris Cherny 分享 Claude Opus 4.7 深度使用技巧:自动模式、回顾与 /go 工作流

Boris Cherny 根据自己几周的高强度使用,给出了几个让 Claude Opus 4.7 更顺手的实操方法。新加的“自动模式”让模型自己判断命令是否安全并自动执行,不用再频繁点确认,适合跑长时间任务。如果不想全自动,可以用 /fewer-permission-prompts 技能,把安全但总弹窗的命令加进白名单。“回顾”功能会帮你自动总结已完成...

推荐理由:这篇是实战笔记,不是产品公告。HKR 三项都踩实了:/go 把测试、清理、提 PR 串成一条线,钩子够强;Auto mode、Recaps、Focus mode 的用法具体可复现;Claude Code 用户对审批限制的焦虑被直接回应。正文没给价格、上线时间和性能跑分,所以别当评测看,重点盯工作流怎么变。

TechCrunch · AI

OpenAI 给 Codex 加了更多桌面控制权,直接对标 Anthropic

OpenAI 在 2026 年 4 月 16 日升级了它的编程工具 Codex,让这个工具能更深入地操控你的电脑桌面,比如操作文件或应用。文章把这看作是对 Anthropic 的直接反击,因为 Anthropic 的 Claude Code 目前在商业用户里更受欢迎。不过,这篇报道正文被截断了,没有披露具体新增了哪些功能、怎么收费、什么时候推送,也没说...

推荐理由:TechCrunch 这篇报道的核心就一句话:OpenAI 给 Codex 加了更多桌面权限,直接对标 Anthropic 的 Claude Code。标题火药味足,但正文能确认的只有“权限更大”这一点,动作清单、价格、开放范围全都没披露。我会先打个折:这事值得关注,因为桌面控制权是编程助手进企业干活的关键门槛,谁先拿到信任谁就占优。但别太激动,正文没给出任何能判断实际能力或安全边界的细节,目前更像一次宣示性的产品更新。

X · @dotey(宝玉)

Claude Opus 4.7 思考 token 消耗更大,Anthropic 给付费用户永久提了速率上限

Opus 4.7 比上一代更费思考 token,Anthropic 直接给所有付费订阅用户永久上调了速率限制来对冲。正文没披露具体提了多少、定价规则有没有变、什么时候全面生效。如果你还没看到额度变化,先确认自己切到了 Opus 4.7,并且 Claude Code 已升到最新版。

推荐理由:这条更新对付费用户是实打实的操作变化,三个维度都踩中了:反差感强、事实明确、直接触动用户的钱包和工作流。正文没披露具体提了多少、怎么计费、什么时候生效,所以信息有缺口,但核心事实足够清楚,放在 featured 合适。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7 在 Claude Code 里的使用指南,默认努力等级调到 xhigh

Anthropic 给了一套 Opus 4.7 搭配 Claude Code 的用法建议。核心变化是默认努力等级从 high 提到了 xhigh,官方说这个档位适合大部分写代码、设计 API、迁移和审查的活儿。模型现在会自己判断什么时候该多想、什么时候该快答,不用人手动调思考量。但这也带来一个行为变化:它默认不太爱频繁调工具和生成子智能体,如果你需要它...

推荐理由:这不是模型发布,是 Anthropic 官方给 Claude Code 配 Opus 4.7 的用法说明,但改的是日常使用习惯:默认 Effort 拉到 xhigh,模型会自适应思考,工具和 SubAgent 调用反而变少了,除非你在提示里明确要求。我会先打个折——范围比大产品发布窄,但对天天用 Claude Code 写代码、做审查和迁移的人来说,这几条能立刻省时间、省 token。HKR 三项都踩中了,所以给 featured。

X · @dotey(宝玉)

xAI 开始出租闲置 GPU,第一个客户是估值 500 亿美元的编程工具 Cursor

xAI 把数万块 GPU 租给 Cursor 训练编程模型 Composer 2.5,自己从模型公司变成了半个云服务商。总裁在内部备忘录里承认,公司 20 万块 GPU 的模型算力利用率只有 11%,远低于行业 35% 到 45% 的水平,大部分算力在空转,出租是为了回血。两家关系有点微妙:xAI 刚挖走 Cursor 两位产品工程负责人,转头又卖算力...

推荐理由:这条消息的看点不是又一家公司买卡,而是 xAI 开始把闲置算力变现。正文给出的 11% 利用率远低于行业常见的 35%–45%,说明内部训练任务根本吃不满 20 万块 GPU,出租是止损也是探路。Cursor 作为第一个客户,拿这些卡去训 Composer 2.5,同时自己还在谈 500 亿美元估值,等于用外部算力撑估值故事。我会先打个折:正文没披露租约价格、时长和具体 GPU 型号,所以省钱程度还不好判断。但这件事本身比单纯堆卡更值得盯,因为它可能把算力过剩问题直接摆上台面,也逼其他大厂重新算自己 GPU 集群的账。

4月16日星期四

X · @op7418(歸藏)

Claude Code 现在能用 Claude Opus 4.7 了,默认推理强度是 X-HIGH

Claude Code 接入了 Claude Opus 4.7,默认推理强度设为 X-HIGH。如果你觉得这个强度不够用,得自己手动切到 Max。正文没提价格、速率限制和具体上线时间。

推荐理由:这是一次有料的 Claude 产品更新,三个信号都踩中了:新模型进 Claude Code,还带了一个具体的操作细节——X-HIGH 默认、Max 要手动开。我没给更高分,因为价格、速率限制和正式发布时间正文都没提,这些缺口会让实际影响打个折。

X · @dotey(宝玉)

Anthropic 发布 Claude Opus 4.7,定价没变,但账单可能因为新分词器微涨

Claude Opus 4.7 上线了,API 名叫 claude-opus-4-7,输入每百万 token 5 美元、输出 25 美元,价格和 4.6 一样。这次主要升级了自主编程能力,能独立跑完更复杂的任务,还会自己验证结果再汇报。视觉方面,长边支持到 2576 像素,是之前的三倍多,截图不用再压缩了。不过有个背景:Anthropic 手里有个更强...

推荐理由:Anthropic 发新模型,不是改个名那种。2576 像素的视觉上限和 tokenizer 的 1.0–1.35 倍变化,直接影响到迁移测试和实际开销。标价没变但 token 消耗可能涨,这个信息对开发者比跑分重要。HKR 三项都踩实了,放 p1 没问题。

Hacker News 首页

Claude Opus 4.7 系统卡:能力没摸到自家天花板,但仍是目前公开发的最强模型

Anthropic 发了份 232 页的系统卡,把 Claude Opus 4.7 的安全评估摊开来讲。先说结论:这模型比上一代 Opus 4.6 强,但打不过他们只给少数人用的 Claude Mythos Preview,所以按 Anthropic 自己的标准,它没把能力边界往前推,灾难性风险还是低。网络攻防水平跟 4.6 差不多,英国 AI 安全研...

推荐理由:这不是一篇花哨的发布稿,但 Anthropic 这份 232 页的系统卡干货不少。我会先打个折:正文没放基准分数,也没给新的网络防护细节,所以很多判断只能靠他们自己的说法。能确认的是 Opus 4.7 比 4.6 强,但还没碰到自动化 AI 研发那条线,灾难性风险也标着低——这点先别太激动,毕竟没看到具体验证数据。对关注 Claude 公开版能力上限的人来说,这份卡值得扫一眼。

Hacker News 首页

Anthropic 发布 Claude Opus 4.7,首次在较弱模型上部署网络安全拦截

Anthropic 在 4 月 16 日上线了 Claude Opus 4.7,价格和上一代 Opus 4.6 一样,输入每百万 token 5 美元,输出每百万 token 25 美元。这次更新主要强化了复杂软件工程任务和长流程工作的稳定性,模型会自己检查输出再汇报,视觉分辨率也更高了。官方给出的基准测试分数比 Opus 4.6 好看,但正文没有把所...

推荐理由:Anthropic 把 Claude Opus 4.7 推成正式版,价格没动,上线渠道覆盖了 API 和三大云平台,对实际工作流有直接影响。我会先打个折:正文说编程、长任务和视觉有提升,但具体跑分没全放出来,这点先别太激动。真正值得盯的是网络安全防护先在这个模型落地,安全策略有变化。整体信息够用,但缺完整数据支撑。

Hacker News 首页

通义千问开源 Qwen3.6-35B-A3B:总参数 350 亿,每次推理只激活 30 亿,主打编程智能体

Qwen 放出了一个新开源模型 Qwen3.6-35B-A3B,用的是混合专家架构,总参数量 350 亿,但实际干活时只调用 30 亿参数,跑起来很省资源。它的核心卖点是编程智能体能力,在 SWE-bench Verified 上拿了 73.4 分,Terminal-Bench 2.0 上 51.5 分,直接超过了自家上一代 270 亿参数的密集模型 ...

推荐理由:这是 Qwen 正经发模型,不是套壳功能更新。HKR 三条全中:低激活参数做代理编程是钩子,基准分数给了具体数字,开源权重加 30 亿激活直接戳部署成本和竞争焦虑。没给 p1 是因为目前只有一篇博客,还没看到第三方复现和更多消融实验。

r/LocalLLaMA

Qwen 放出 Qwen3.6-35B-A3B,35B 总参数只激活 3B,开源可商用

Qwen 发了个新模型,叫 Qwen3.6-35B-A3B,用的是稀疏 MoE 架构,总参数量 35B,但每次推理只激活其中 3B 参数,跑起来会比较省资源。采用 Apache 2.0 协议,可以商用。官方说法是它在写代码、处理多模态任务上表现不错,还支持“思考”和“不思考”两种模式,能直接塞进业务流程里干活。不过这篇帖子没给出具体的跑分、上下文窗口长...

推荐理由:这条帖子是个发布通告,信息量有限但钩子够硬。35B 总量、3B 激活的稀疏 MoE 听着省算力,但正文没放基准和上下文窗口,我会先打个折。Apache 2.0 开源是实锤,对想自己部署的人有吸引力;agentic coding 和多模态推理的说法先别太激动,等实测数据出来再看。

Latent Space

GitHub 首次允许开源仓库禁用 Pull Request,AI 编程正在淘汰这套用了 21 年的协作流程

GitHub 最近悄悄上线了一个新选项:开源仓库可以彻底关掉 Pull Request 功能了。这是 PR 诞生 21 年来的头一遭。文章把这看作一个信号——AI 写代码的 workflow 已经变了,人和人之间那套基于 Git 的协作方式,可能不再适合 agent 之间打交道。Pete Steinberger 等人早就公开说过只想要 Prompt R...

推荐理由:这不是 GitHub 的官方公告,但它把一个具体改动——开源仓库可以关掉 PR——变成了对 agent 编码工作流的直接提问。我会先打个折:正文没披露有多少仓库实际用了这个设置,也没给出 agent 提交的规模数据,所以判断只能停在“信号”层面。不过它把 OpenAI Agents SDK、Cloudflare 等新 agent 栈和“提示提交”、沙箱执行串在一起,指向一个真问题:Git 工作流还能不能接住 agent 协作。这点先别太激动,但值得盯。

OpenAI News

OpenAI 发布 GPT-Rosalind:一个专为生物医药研究做的推理模型

OpenAI 在 2026 年 4 月 16 日推出了 GPT-Rosalind,一个专门面向生物学、药物发现和转化医学的前沿推理模型。它现在以研究预览版的形式在 ChatGPT、Codex 和 API 里对通过审核的客户开放。模型的核心卖点是能处理多步骤的科研流程,比如读文献、理解基因序列、设计实验和做数据分析,并且能调用超过 50 种科学工具和数据...

推荐理由:我会先打个折:正文没披露模型参数、价格和具体基准分数,所以别急着把它当成熟产品看。真正值得盯的是落地范围——OpenAI 把 Amgen、Moderna、Thermo Fisher 这些大药企拉进来做 research preview,说明他们想用真实业务场景验证模型,而不是发个论文就完事。Codex 里那个免费的生命科学插件能连 50 多个工具和数据源,对做生物信息学的人可能挺实用,但没给性能数据,这点先别太激动。整体看,这是 OpenAI 往垂直行业扎的一步,但信息缺口不小,暂时只能给 featured。