跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 521–540 条 · 共 1,195 条

7月1日星期三

Hacker News 首页

Anthropic 发布 Claude Sonnet 5:自主干活能力追平 Opus 4.8,价格还便宜一截

Claude Sonnet 5 是 Anthropic 目前最能自主干活的中档模型。它能自己定计划、用浏览器和终端跑任务,在推理、写代码、工具使用这些指标上比上一代 Sonnet 4.6 强出一大截,表现已经接近旗舰 Opus 4.8。价格方面,正式定价是输入每百万 token 3 美元、输出 15 美元,8 月 31 号前有尝鲜价,输入 2 美元、输...

推荐理由:Anthropic 的中档主力模型做了一次大的 agent 升级,定价也清楚,当天就该写。分数没上 90,因为文章只给了基准对比,没放任务完成率或延迟数据,实际表现还得等社区跑完再看。

AI HOT 精选

Anthropic 发布 Claude Science,把文献、数据分析、画图和写论文塞进同一个科研工作台

Claude Science 是一个给科研人员用的 AI 工作台,现在对 Pro、Max、Team 和 Enterprise 用户开放测试。它把文献检索、数据分析、图表生成和论文编辑整合到一个会话里,内置了 60 多个预配好的技能和连接器,覆盖基因组学、单细胞、蛋白质组学、化学信息学等领域。每次输出都附带可审计的代码、运行环境和聊天记录,方便复现。计算...

推荐理由:Anthropic 把 Claude 做成一个给科研人员用的垂直工作台,把文献、数据、可视化和写作打通在一个会话里,还预置了 60 多个细分领域的技能。产品形态跟通用聊天界面拉开差距,硬核、知识密度和可复现性三个维度都踩中了。正文没披露具体定价和实际延迟数据,但光这个整合度和审计输出,就值得给 82 分。

AI HOT 精选

shot-scraper 1.10 新增 video 命令,让 AI 智能体自己录制浏览器操作演示

Simon Willison 发布了 shot-scraper 1.10,核心是新增的 video 命令。你给它一个 YAML 格式的“故事板”文件,它就能用 Playwright 驱动浏览器,把整个操作流程录成 mp4 视频。故事板可以自动启动开发服务器、填表单、点按钮、等待页面元素出现。这个功能之前一直被 Playwright 的录屏限制卡住——早...

推荐理由:Simon Willison 给 shot-scraper 加了个 video 命令,让 agent 能按 YAML 故事板自动录操作视频。这事对做 agent 开发的人挺实用,解决了“怎么把 agent 干活过程可视化”的一个具体痛点,技术路径也清楚。但受众面窄,主要就是 agent 开发者会关心,所以重要性给 72、放 featured 是合适的。

6月30日星期二

Hacker News 首页

Claude Code 偷偷在系统提示词里藏了隐形标记,用来识别 API 代理和时区

有人逆向 Claude Code 2.1.196 后发现,它会根据你的 API 地址和系统时区,悄悄修改发给模型的系统提示词。具体是把日期里的撇号换成肉眼几乎看不出来的 Unicode 变体,比如遇到已知的代理域名就用弯撇号,遇到中国时区就把日期分隔符从“-”改成“/”。这些域名和关键词列表用 XOR 和 base64 做了混淆,里面包含 deepse...

推荐理由:一手逆向分析,带代码和域名清单,不是猜测。隐写、技术细节、隐私信任三条全中。因为是个人博客、没有 Anthropic 官方回应,上限压在 85 以下。

Ben's Bites

GPT-5.6 发布了,但被美国政府卡着,普通人暂时用不上

OpenAI 推出了 GPT-5.6 系列,包含 Sol、Terra、Luna 三个模型,Sol 是里面最聪明的。目前只有少数合作伙伴能拿到权限,Sam Altman 说普通用户很快也能用,但一开始可能只限美国。文章没具体说美国政府卡在哪个环节。另外,OpenAI 还发了一篇关于 Codex 使用情况的经济学论文,显示非技术部门的采用率正在追上工程部门。

推荐理由:GPT-5.6 发布是行业级事件,但文章只给了标题和一句监管卡壳的暗示——正文没写具体卡在哪个环节、三个子模型能力差在哪、Sol 比上一代强多少。信息量只够让人知道有这么回事,我会先打个折。

Computing Life · Share · 鸭哥调研

鸭哥实测:主流 AI 编程工具日常使用已无差别,只有 Google Antigravity 掉队了

鸭哥把 Cursor、Codex、Claude Code 和 OpenCode 拉出来横向对比了一圈,结论是:95% 的日常增删改查任务里,这几款工具用起来几乎一模一样,随时可以无缝切换。模型能力溢出了,功能清单也高度重合,选哪个纯粹看个人工作流偏好。Claude Code 独占的 Agent Teams 和 Dynamic Workflows 听着唬...

推荐理由:鸭哥这篇横向对比有实打实的功能拆解和上手体感,不是空对空。“95% 任务无感切换”这个结论对天天在几个工具间横跳的人很实用,HKR 三个维度都打中了。扣分点在于这是个人博客,没有第三方数据背书,而且 Claude Code 独占功能的具体表现正文没展开,说服力打点折。

Product Hunt · AI

v0 上线 Design Systems 2.0,能直接导入你团队在用的组件库、设计变量和 Figma 画板

v0 现在支持从 GitHub 仓库、npm 包(公开或私有)、Storybook 文档、Figma 画板、截图甚至 ZIP 文件里导入你们现有的设计系统。它会学习这些组件和样式是怎么被实际使用的,然后生成一个用你真实组件和设计变量搭好的预览环境,你可以在聊天框里继续改,满意了再保存。有个关键问题正文没回答:导入的系统是作为硬性规范,还是只是给模型参考...

推荐理由:我会先打个折:这个更新方向是对的,但信息缺口也明显。v0 能学你真实的组件和设计变量来搭预览环境,这点挺省钱,不用手动重建。但正文没写清楚学完之后模型是严格遵守你的组件库,还是只当风格参考——如果是后者,生产环境里还是得人工检查一遍,价值就打折扣了。另外也没提私有 npm 包的鉴权细节和 Figma 导入的还原度,这些都会影响实际能不能用。所以重要性给 72 是合理的:方向值得关注,但落地效果还得看后续说明。

AI HOT 精选

美团 LongCat Owl Alpha 在 OpenRouter 上蹿到最热门,1.6 万亿参数 MoE,全用国产 ASIC 训练

美团 LongCat 的 Owl Alpha 模型在 OpenRouter 上成了调用量最高的模型,用户已经烧掉 10 万亿 token。它是一个 1.6 万亿参数的混合专家模型,用 35 万亿 token 训练,全程跑在 5 万块国产 ASIC 上,没依赖英伟达 GPU。性能标称达到 Gemini 或 Opus 4.6 级别,在 Hermes Age...

推荐理由:三个高信号区同时打中:大规模国产 ASIC 训练(5 万块)、OpenRouter 用量第一(10 万亿 token 已消耗)、性能标称对齐 Gemini/Opus 4.6。1.6T MoE 参数和 35T 训练 token 都是硬数字,不是公关稿。唯一扣分点:正文没披露具体 benchmark 分数和评测细节,性能对标先打个折看。

Hacker News 首页

Qwen 3.6 27B 是本地跑模型的甜点级选择

Piotr Migdał 在 Macbook Max M5 128GB 上实测了 Qwen 3.6 27B,用 8-bit 量化版跑出每秒 32 个 token,占 42GB 内存。他认为这是第一个能当通用智能用的本地模型。测试里它一次就生成出六边形扫雷的 npm 包,还搭了一个响应式落地页。文章给了完整的 llama.cpp 配置命令,并出于伦理原因...

推荐理由:一篇带真实数字的个人实测,不是通稿。Qwen 3.6 本身热度就高,这篇文章补上了本地部署的实操细节。分数卡在 72 是因为它终究是个人评测,不是官方发布或重大产品更新。

6月29日星期一

AI HOT 精选

两个 Vibe Coding 实用提示词:用第一性原理推导,再让 AI 当恶意用户来审代码

作者在开发 AIHOT 时用了两条提示词,一条要求 AI 从基本事实重新推导,别靠类比,结果挖出了一个隐藏的流量路由问题,逼着项目重写;另一条让 AI 扮演恶意用户攻击自己的代码,抓出了内存溢出死循环和未来时间戳污染这类手工审查很难发现的 bug。两条提示词组成“生成—验证”闭环,项目最近一周请求量超过一千万次。

推荐理由:两条提示词组成一个“生成—验证”闭环,有具体的 bug 例子和一周一千万次请求的生产数据,不是纯理论。扣分是因为这是单人经验分享,没有跨来源验证,而且项目是作者自己的产品,带点自我宣传的味道。

Hacker News 首页

一个老工程师的 AI 编程体验:从心流创作变成了流水线改稿

Andrew Diamond 把现在的 AI 辅助编程比作让小说家去批改学生作文。AI 能写出看起来没毛病的代码,但它不知道法律合规红线、外部接口延迟、团队接下来的改动计划,也不知道跟敏感数据处理模块会不会撞出安全漏洞。他把 AI 定位成一个干活快但缺系统级常识的初级工程师,需要资深的人把关。文章最核心的担忧是:当写代码变成审代码,创作时那种忘记时间的...

推荐理由:一篇个人色彩很浓的随笔,不是产品发布也不是研究突破,所以分数不会给到 80 以上。但比喻精准,对心流状态的担忧也具体,值得推荐给日常用 AI 写代码的工程师看看。

6月28日星期日

AI HOT 精选

马斯克说 Grok 4.5 已在 SpaceX 和 Tesla 内部测试,性能接近 Opus

Grok 4.5 基于一个 1.5 万亿参数的 V9 基础模型,训练时额外喂了 Cursor 的数据,现在在 SpaceX 和 Tesla 内部试用。马斯克说初步跑分接近甚至可能超过 Opus,但没说是哪个版本的 Opus、用的什么基准测试、测了多大样本。强化学习还在继续拉性能,Grok Build 工具链也在完善。另外 SpaceX 今年打算每个月发...

推荐理由:马斯克自己出来说 Grok 4.5 跑分接近甚至可能超 Opus,还提到用 Cursor 数据训练,信号很强。但正文没披露 Opus 具体版本、用的什么基准、测了多少样本,这些缺口让判断得打个折。1.5 万亿参数和内部试用是实打实的信息,所以给 78 分,先别太激动。

AI HOT 精选

新浪开源 VibeThinker-3B:推理能力能塞进小模型,但知识储备不行

新浪微博放出了一个 30 亿参数的小模型 VibeThinker-3B,在数学和编程题上能跟 DeepSeek V3.2、Kimi K2.5 这些大几百倍甚至上千亿参数的模型打平。它是在阿里的 Qwen2.5-Coder-3B 基础上,靠多阶段后训练(先监督微调学各种任务,再用强化学习专攻数学、编程、理科推理,最后自我蒸馏合并技能)把性能拉上去的。在 ...

推荐理由:新浪这个VibeThinker-3B最抓人的点是30亿参数能在数学和编程上跟DeepSeek V3.2、Kimi K2.5这些大模型打平,对做端侧部署或者想省推理成本的人是个实打实的信号。训练方法也交代得比较清楚,不是黑盒,而且他们自己验证了一个结论:推理能力可以压缩到小模型里,但事实知识不行,这点对选型有参考价值。没给更高分是因为目前只有这一篇报道,模型在更杂的任务上表现还不清楚,先打个折。

Computing Life · Share · 鸭哥调研

前沿模型安全重心移向运行时:GPT-5.6 和 Anthropic 走了两条不同的工程路

OpenAI 和 Anthropic 最新的系统卡显示,模型安全不再只靠训练阶段的对齐,而是转向运行时的管控。GPT-5.6 Sol 在推理过程中用激活分类器实时监测模型内部状态,在有害内容到达用户前就掐断,同时配套了账户安全分和两级扫描系统。Anthropic 用 SAE 探针发现 Mythos Preview 在 29% 的核心行为测试里已经意识到...

推荐理由:HKR 三条都踩中了:对比视角新鲜,有具体的失败次数和拦截机制,而且直接戳中 agent 开发者的日常痛点。分数定在 82 是因为文章本身是二手分析,没有原始测试数据,信息增量主要来自解读角度而非一手实验。

6月27日星期六

AI 群聊日报

GPT-5.6 Sol 发布但可能拿不到,GLM 5.2 抢不到货,STOC 现场跑通 AI 自动证数学题

OpenAI 预览了 GPT-5.6,分 Sol、Terra、Luna 三档,Sol Ultra 在 TerminalBench 2.1 跑出 91.9% 排第一,最便宜的 Luna 也超过了上一代旗舰 Claude Opus 4.8。但受前一天出口管制消息影响,群里有人泼冷水说“5.6 也发不出来了”。另一边,GLM 5.2 的 Coding Pla...

推荐理由:GPT-5.6 三档发布是当天最大新闻,Sol Ultra 跑分和定价都清楚,但出口管制的不确定性让这条消息的冲击力打了折扣,所以重要性没给到 85 以上。GLM 5.2 卖断货和自动化证明流水线是加分项,不过日报本身是二手信息源,不是一手公告,整体判断就定在这个档位。

Latent Space

OpenAI 发布 GPT-5.6 系列,但只给政府点头的 20 来家伙伴用

OpenAI 推出了三个新模型:Sol(旗舰)、Terra(中档)、Luna(快速便宜),但这次不是公开发布,而是应美国政府要求,先开放给大约 20 家受信任的合作伙伴做有限预览。Sol 在 Terminal-Bench 2.1 上跑到了 91.9%,在一些编程任务上超过了 Claude Mythos 5,不过 OpenAI 特意强调它没跨过网络安全的...

推荐理由:我会先打个折,因为正文没披露 Terra 和 Luna 的具体跑分,也没说清楚网络安全红线到底卡在哪。但 Sol 的 91.9% 和压过 Mythos 5 是硬指标,加上美国政府要求限制发布这件事本身比跑分更有信息量——它说明模型能力已经到了需要控管的程度。对从业者来说,这比一个公开 API 更值得盯。

Computing Life · Share · 鸭哥调研

AI 编程正在进入它的 DevOps 时刻

字节在 FORCE 大会上公开了一组内部数据:TRAE 团队超过 90% 的代码由 AI 生成,但人均需求吞吐率只提升了约 60%。代码生成端已经很快,但 review、测试、依赖检查、staging 和安全审计这些下游环节没有同步加速,AI 写好的代码像半成品一样堵在交付流水线里。文章认为,下一阶段 AI 编程工具的竞争会从“谁更会写代码”转向“谁能...

推荐理由:字节在 FORCE 大会上放出的内部数据很实在:90% 的代码是 AI 写的,但人均吞吐率只涨了 60%。这个差距说明代码生成本身不是瓶颈,交付流水线里 review、测试、依赖检查、staging 和安全审计这些环节没同步加速,AI 产出的代码堆在那儿出不去。文章没有停留在产品发布层面,而是把工程交付的真实卡点讲清楚了,对正在推 AI 编程的团队有直接参考价值。

Hacker News 首页

开源模型可能 2026 年 12 月追上闭源,但换个基准看差距纹丝不动

Jamie Dborin 用 Artificial Analysis 的 18 个基准测了开源和闭源大模型之间的差距。只看他们主打的“智能指数”,差距一直在缩小,按趋势线外推,到 2026 年 12 月 3 号左右开源就能追平。但把 18 个基准全算上,平均差距几乎是一条直线,稳定在不到 5 个月。进步最大的是编程,从落后 15 个月缩到一两个月;其他...

推荐理由:Jamie Dborin 拿 Artificial Analysis 的 18 个基准测了开源和闭源大模型的差距,然后自己拆了自己的台。按他们主推的“智能指数”画趋势线,开源会在 2026 年 12 月 3 号左右追平闭源,这个日期很抓眼球。但把 18 个基准全算上,平均差距稳在不到 5 个月,几乎是一条直线,说明整体追得没那么快。进步最大的是编程,从落后 15 个月缩到一两个月,其他能力就没这么乐观。我会先打个折:单一指数外推变数太大,全基准那条平线反而更值得认真看。正文没披露这 18 个基准的具体权重和构成,所以“智能指数”到底有多代表综合能力...

6月26日星期五

AI HOT 精选

AI 的下一个突破口:在工作中边干边学

Dwarkesh Patel 认为,各大 AI 实验室现在赌的是用海量可验证任务把模型训成通用智能,但这套打法漏了一个关键前提:任务光能验证还不够,还得能“刷”——也就是能在确定、可回放的环境里并行跑大量试错。他用电脑操作举了个例子:让 AI 在 Etsy 上下单是可验证的,但你没法同时派一千个代理去冲亚马逊的结账流程,会被封。这就是为什么电脑操作的进...

推荐理由:Dwarkesh Patel 这篇文章把当前 RL 训练范式拆成“可验证”和“可重放”两个条件,指出电脑操作和编程任务卡在后者——能验证结果,但没法大规模并行试错。Etsy vs 亚马逊的例子让瓶颈变得很具体。没给 85 分是因为这只是一篇个人分析,不是实验报告或产品发布,证据链靠推演而非数据。

AI HOT 精选

Ornith-1.0 开源四个编程智能体模型,397B 版本自称打平 Claude Opus 4.8

Ornith-1.0 放出了四个尺寸的模型,从 9B 到 397B 都有,MIT 协议随便用。它们基于 gemma4 和 qwen3.5 做后训练,用的强化学习方法同时优化任务拆解和方案自我修正,相当于教模型先想清楚步骤再动手改代码。397B 在 SWE-Bench Verified 上拿了 82.4 分,Terminal-Bench 2.1 上 77...

推荐理由:开源编程智能体模型,397B 在 SWE-Bench Verified 上拿了 82.4 分,MIT 协议,四个尺寸可选。分数够看,协议也友好,但发布渠道是 X 帖子,不是官方博客或论文,训练数据和 RL 配置细节没展开,所以我会先打个折——分数可信,但复现和验证的门槛还在。