跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 441–460 条 · 共 1,195 条

7月11日星期六

AI HOT 精选

OpenAI 最新 Agent 模型把一位 AI 创始人的 Mac 硬盘清空了

AI 创业者 Matt Shumer 让 GPT-5.6-Sol 的 subagent 帮忙清理文件,给了 Full Access 权限。结果 shell 里 $HOME 路径解析出错,Agent 直接跑了 rm -rf /Users/mattsdevbox,数年代码、文件、照片全没了。这个任务之前安全跑过几百次,这次翻车后 Agent 自己还生成了事...

推荐理由:OpenAI 的 GPT-5.6-Sol 子 agent 在 Full Access 权限下,因为 shell 里 $HOME 路径解析错误,跑了 rm -rf /Users/mattsdevbox,把 Matt Shumer 整台 Mac 的数据全删了。这不是理论推演,是一次实打实的 agent 安全翻车。故事本身够抓人,失败细节清楚,而且直接戳中开发者最怕的事——自己手滑或者 AI 手滑,硬盘就空了。

Computing Life · Share · 鸭哥调研

31 秒自愈攻击:JADEPUFFER 撕掉了传统防御的最后一块遮羞布

Sysdig 记录了一次真实攻击:黑客利用 Langflow 漏洞(CVE-2025-3248,评分 9.8)扔进一个恶意 agent,这个 agent 在 31 秒内自己改代码、绕过防御、建后门、删数据库。这是首个真实世界里 agent 加密本地数据的案例。入口是一个没打补丁的 Langflow 实例,网上还有约 7000 个节点裸奔。agent 在...

推荐理由:这是首个真实世界里 agent 自我纠错完成攻击的案例,31 秒的时间线很具体,HKR 全中。扣在 82 分是因为目前只有 Sysdig 单方报告,600 多种 payload 的说法没有第三方验证,而且安全事件本身对非安全岗的直接可操作性有限。

Hacker News 首页

12 个模型写 4 个同样的 App:GPT-5.6、Grok 4.5、Claude 和 Muse Spark 现场比试

TryAI 让 12 个模型各试 5 次,去写一个伪 3D 迷宫、一个魔方、一个计算器和一个生命游戏。GPT-5.6 Sol 最稳,迷宫 5 次全过,但每次跑要花 1.35 美元;Grok 4.5 也是 5 次全过,只要 0.27 美元,性价比很高。Meta 新出的 Muse Spark 1.1 有点抽风,5 次里坏了 3 次,但能跑的那两次质量跟 S...

推荐理由:TryAI 搞了场 12 个模型的编程实战,用四个小应用测通过率、成本和延迟,GPT-5.6 Sol 和 Grok 4.5 的性价比差距是最大看点。我会先打个折:这是第三方评测,不是官方发布,样本量也不大,所以分数没给太高。Muse Spark 1.1 表现抽风,拉低了一点整体信号的清晰度,但核心结论——Grok 4.5 在可靠性和价格上很能打——对选模型的人有直接参考价值。

7月10日星期五

AI 群聊日报

GPT-5.6 Sol 发布日:跑分领先但群友实测还是给 Fable 打工,有人让它读完整个 GitHub 写遗书

OpenAI 把 Codex 客户端改名叫 ChatGPT,GPT-5.6 Sol 正式上线。官方跑分在 Terminal-Bench 2.1、BrowseComp 和 Agents' Last Exam 三项领先,价格只有 Fable 的一半,但群里用同一个代码库实测的结论是 Fable 还是好很多,5.6 的定位迅速收敛成给 Fable 当打工仔—...

推荐理由:GPT-5.6 Sol 上线是当天最大事件,这条群聊日报的价值在于补上了官方跑分之外的社区实测对比。信息密度高,有第一手判断。我会先打个折,因为来源是群聊整理而非一手信源,部分细节依赖群友自述,但整体信号很清晰。

Latent Space

OpenAI 发布 GPT-5.6 三款模型,Codex 并入 ChatGPT 超级应用

OpenAI 在 7 月 10 日推出了 GPT-5.6 系列,按规模分 Sol、Terra、Luna 三个版本。旗舰款 Sol 在 Agents' Last Exam 上拿到 53.6 分,比 Claude Fable 5 高出 13.1 分,但成本只有后者的四分之一左右。API 定价上,Sol 每百万输入/输出 token 收 5 美元和 30 美...

推荐理由:OpenAI 主版本更新,旗舰模型在关键 agent 基准上领先 Claude Fable 5 超过 13 分,定价又很激进,加上 Codex 并入 ChatGPT 变成超级应用,属于多事件叠加,三个维度都打中了。正文没披露 Sol 的具体参数量,这点先别太激动。

AI HOT 精选

OpenAI 发了 GPT 5.6,ChatGPT 应用改版学 Claude 分 Tab,交互反而更绕了

OpenAI 把 Codex 应用直接改名叫 ChatGPT,布局上明显在跟 Anthropic 的产品形态。新应用硬拆成 Work 和 Code 两个 Tab,但切换时只有左上角图标变一下,聊天窗口被缩到右下角一个小弹窗里,不少用户反馈找不到旧的聊天记录。Codex 的 Site 插件已经上线,能生成多套网页、接业务数据并部署到 OpenAI 的站点...

推荐理由:OpenAI 这次产品大改版,GPT 5.6 发布同时把 Codex 并进 ChatGPT,UI 直接照着 Claude 的 Tab 模式来。但切换逻辑是坏的,聊天被降级到角落弹窗,用户找不到旧记录——这个产品决策值得打问号。分数没给更高是因为正文没披露 GPT 5.6 本身的能力提升细节,也没说这次改版后的用户数据反馈,只能先按现有信息给到 78 分。

AI HOT 精选

Meta 放出 Muse Spark 1.1,一个会拆任务、能跨设备操作的 agent 模型,价格压得很低

扎克伯格亲自在 X 上官宣了这个模型,通过新的 Meta Model API 开放。它的核心思路是让模型自己把复杂任务拆给多个子 agent 并行干,还能跨设备控制图形界面。上下文窗口给到 100 万 token。在 4 个 agent 类基准上拿了第一,其中 JobBench 从上一代的 17.0 分直接跳到 54.7 分,翻了 3.2 倍,说明在模...

推荐理由:Meta 发了个带 agent 能力的主力模型,扎克伯格自己站台,JobBench 分数暴涨 3.2 倍,数字够硬。100 万 token 上下文和跨设备 GUI 控制说明不是只刷榜,有产品落地意图。扣分点:正文没提价格和延迟,实际用起来划不划算还得等上线后自己测。

Computing Life · Share · 鸭哥调研

聊天框在拖 AI Agent 的后腿:该换成邮件式异步协作了

文章认为 Cursor、Claude Code 这类工具的聊天框界面,会诱导人只写模糊指令、期待秒回,让 AI 没时间自己编译、跑测试和纠错。作者提出把一问一答改成邮件式异步流程:把详细任务、附件和本地路径一次性发给 Agent,然后关掉窗口等结果。文中提到 Manus 的邮件任务入口和创业公司 AgenticMail 是早期例子,但正文没披露这些邮件...

推荐理由:观点文章,论证扎实:从第一性原理拆解聊天框如何通过界面暗示同时规训用户和开发者,剥夺了 AI 安静编译和自测的时间。邮件式异步工作流在 Manus 和 AgenticMail 上已有早期例子,但正文没披露这些邮件的具体延迟和成功率,这点先别太激动。整体对从业者来说是个值得停下来想想的视角。

TechCrunch · AI

OpenAI 发布 GPT-5.6 系列,分三档,主打编程和省 token

OpenAI 这次一口气发了三个模型:Sol 是主力干活用的,Terra 算中配,Luna 是便宜版。Sam Altman 对 CNBC 说,Sol 在写代码任务上 token 效率提升了 54%,也就是说跑同样的活能省不少钱。公司还把它称为目前最强的网络安全模型,能干威胁建模、代码审查和蓝队演练(自己模拟攻击找漏洞)。不过正文没提具体定价和什么时候能...

推荐理由:OpenAI 旗舰模型更新,有两个能抓住人的点:54% 的 token 效率提升和网络安全定位,消息来自 TechCrunch 独家。没给 95 分是因为正文没提定价和上线时间,Sol 实际推理成本还不清楚,这点先别太激动。

AI HOT 精选

Bun 宣布从 Zig 转向 Rust 重写,起因是内存安全 bug 修不完

Bun 的作者 Jarred Sumner 发了一篇博客,说他们要把整个 Bun 从 Zig 语言换成 Rust 重写。直接导火索是 v1.3.14 版本修了一大串内存相关的崩溃和泄漏,比如释放后继续使用、重复释放、内存泄漏,问题集中在垃圾回收和手动内存管理混用的地方,太容易出错了。Bun 现在月下载量超过 2200 万,Claude Code 等工具...

推荐理由:被收购后 Bun 宣布从 Zig 切到 Rust 重写,直接原因是混用手动内存和 GC 搞出了一堆内存崩溃和泄漏,修起来太费劲。2200 万的月下载量和 Claude Code 的采用让这件事有分量。分数卡在 78 没往上走,是因为这本质上是一则技术栈迁移公告,不是新产品或新能力发布,实际效果还得等重写落地再看。

AI HOT 精选

OpenAI 把 Codex 和 ChatGPT 塞进了一个叫 ChatGPT Work 的桌面应用,背后是 GPT-5.6

ChatGPT Work 是一个新的桌面 agent,把 Codex 和 GPT-5.6 合在一起,能跨应用、跨文件干活,复杂项目可以连续跑好几个小时。它还带了一套新的编码流程、一个 Chrome 扩展、一个升级过的内置浏览器,以及用 GPT-5.6 加速的 Computer Use 功能。正文没提什么时候上线、怎么收费,也没说对电脑配置有什么要求。

推荐理由:OpenAI 发了一个桌面 agent,把 Codex 和 GPT-5.6 合在一起,直接跟 Cursor、Claude Code 抢地盘。产品形态和功能细节都摆出来了,当天就该写。正文没提上线时间、收费和配置要求,我会先打个折,但整体还是值得放头条。

7月9日星期四

Hacker News 首页

Meta 发布 Muse Spark 1.1:一个能自己用工具、写代码、管多步骤任务的多模态推理模型

Meta 超级智能实验室推出了 Muse Spark 1.1,相比上一代在工具调用、电脑操作和写代码上提升明显。这个模型能直接上手没见过的工具和 MCP 服务器(一种让模型调用外部服务的协议),不需要额外训练。它支持 100 万 token 的上下文窗口,能记住之前干过什么,还会主动压缩记忆,只保留关键步骤。做复杂任务时,它可以自己当主控,把活拆给并行...

推荐理由:Meta 超级智能实验室把 Muse Spark 1.1 推出来了,工具调用、电脑操作和写代码都比上一代强,最抓人的是它不用额外训练就能上手没见过的工具和 MCP 服务器,还带 100 万 token 上下文和主动记忆压缩。正文没给基准对比和定价,所以分数先压一压,但 agent 开发者肯定会拿它跑测试,开源也让验证门槛变低。

Ben's Bites

SpaceXAI 和 Cursor 联手训出 Grok 4.5,成本只有 Opus 的六分之一

SpaceXAI 和 Cursor 一起训了个新模型 Grok 4.5,性能大概卡在 Opus 4.7 和 4.8 之间,但按 token 算钱的话,比 Opus 便宜 6 倍,比 GPT-5.5 便宜 3 倍。现在 Cursor 里能用,API 也开放了。OpenAI 这边,GPT-5.6(Sol、Terra、Luna)今天会推给所有用户,早期测试的...

推荐理由:SpaceXAI 和 Cursor 联合发布 Grok 4.5,有具体性能区间和价格对比,三个维度都踩中了。扣分是因为来源是 newsletter 摘要而非一手公告,且正文截断,GPT-5.6 信息不全。跨源验证后加 3 分到 82,整体判断不变。

AI HOT 精选

OpenAI 发布 GPT-5.6 系列:Sol、Terra、Luna,主打用更少的钱跑出更高的分

OpenAI 在 7 月 9 日推出了 GPT-5.6 系列,包含旗舰模型 Sol、均衡型 Terra 和低成本 Luna。旗舰 Sol 在 Agents' Last Exam(一个覆盖 55 个专业领域的长流程测试)上拿了 53.6 分,比 Claude Fable 5 高出 13.1 分,但预估成本只有后者的四分之一左右。新加的 `ultra` 模...

推荐理由:OpenAI 旗舰模型换代,一次发三个变体,在长流程 agent 测试上直接赢了 Claude Fable 5 两位数,还打出四分之一成本的牌。这是 2026 年至今最重量的模型发布,会立刻影响 agent 工作流的选型决策。

Latent Space

SpaceXAI 发布 Grok 4.5,跟 Cursor 联手训了个主打编程和干活儿的模型

SpaceXAI 赶在 GPT-5.6 发布前一天放出了 Grok 4.5。这是个 1.5 万亿参数的大模型,比上一代 Grok 4.3 大了三倍,专门冲着编程和让模型进业务流程干活儿去设计的。Cursor 说这是他们头一回把模型能力扩展到纯写代码之外。马斯克自己讲,这模型跟 Opus 4.7 性能差不多,但更快更省钱——输入每百万 token 收 2...

推荐理由:SpaceXAI 在 GPT-5.6 发布前一天扔出 Grok 4.5,光这个时间点就值得看一眼。1.5 万亿参数,比 Grok 4.3 大了三倍,输入每百万 token 收 2 美元,规模和成本都有具体数字。马斯克说性能跟 Opus 4.7 差不多但更快更便宜——这点先别太激动,正文没给第三方跑分,只能当官方说法。真正有意思的是 Cursor 被收购后第一次把模型推到纯写代码之外,直接瞄准 agent 工作流,对做工具链的人是个信号。

Computing Life · Share · 鸭哥调研

代码干净不会让 AI 编程助手更聪明,但能让它少走弯路

SonarSource 用 Claude Code 跑了 660 次对照实验,比较干净代码和脏乱代码对 agent 的影响。结果有点反直觉:两边任务通过率几乎没差别,差距不到 1 个百分点。但干净代码让 agent 少消耗了 7.1% 的输入 token 和 8.5% 的输出 token,反复打开同一个文件确认的次数也少了 34%。在多模块任务里,输入...

推荐理由:SonarSource 用 Claude Code 跑了 660 次对照实验,比较干净代码和脏乱代码对 agent 的影响。结果反直觉:任务通过率几乎没差别,差距不到 1 个百分点,但干净代码让 agent 少消耗 7.1% 输入 token 和 8.5% 输出 token,反复打开同一文件确认的次数也少了 34%。数字具体、实验设计清楚,Hacker News 上有讨论佐证。HKR 全中。扣分项:正文没披露任务类型和难度分布,结论适用范围有限,但作为工程实践参考已经够用。

Computing Life · Share · 鸭哥调研

GPT-5.5 的推理卡在 516 个 token:模型“想”的那一层会单独坏掉

开发者 vguptaa45 审计了 39 万条 Codex 响应,发现 GPT-5.5 在 44% 的编程任务里,推理部分刚好在 516 个 token 处截断,而 GPT-5.4 是 19.8%,GPT-5.2 只有 0.34%。被截断的任务全部答错,同一道题如果完整跑完 6000 到 8000 个 token 则全对。社区复现后,在 prompt ...

推荐理由:开发者 vguptaa45 翻查了 39 万条 Codex 回复,发现 GPT-5.5 在 44% 的编程任务里,推理部分会精准地在第 516 个 token 处断掉,断掉的题全错,而同一道题让它完整跑完 6000 到 8000 个 token 就全对。对比 GPT-5.4 的 19.8% 和 GPT-5.2 的 0.34%,这个 bug 像是新版本引入的。社区复现后找到了临时绕过的方法,对日常靠它写代码的人有直接参考价值。没给更高分是因为这更像一个具体版本的质量缺陷,影响面暂时局限在 Codex 的推理环节,正文没披露 OpenAI 是否已确认或修复。

Hacker News 首页

我们让 Grok 4.5、GPT-5.5 和 Claude 写同样的三个小应用,比速度和成本

TryAI 给 Grok 4.5、GPT-5.5、Claude Opus 4.8 和 Fable 5 发了三个相同的编程任务:一个 3D 魔方、一个粒子重力沙盒、一个打砖块游戏,要求一次生成、不调提示词。Claude 两款模型在魔方上第一把就做对了,Grok 4.5 第一次只渲染出空白画面,用掉唯一一次重试机会后才成功,GPT-5.5 则只画出一个暗色...

推荐理由:TryAI 做了场编程实战,不是跑分,而是让几个模型一次生成三个应用,把翻车、重试、耗时和花费都摆出来。Claude 两款在魔方上第一把就过,Grok 4.5 第一次白屏、用掉唯一重试机会才成功,GPT-5.5 只画了个暗色画面——这些具体失败比榜单分数更有参考价值。我会先打个折:TryAI 不是一线评测机构,正文也只给了摘要,完整数据得点进去看,所以分数没给更高。

AI HOT 精选

Anthropic 秘密提交 IPO 申请,三季度利润预计超 10 亿美元

SemiAnalysis 的报告说,Anthropic 今年第三季度利润会超过 10 亿美元,并且在 6 月 1 日已经秘密交了上市申请。它和 OpenAI 两家现在的年度经常性收入加起来快 1000 亿美元了。Anthropic 能跑在前面,主要靠 Claude Code 在开发者里用得特别猛,帮它在企业生意上赚到了钱,成了 B2B 市场的领跑者。O...

推荐理由:SemiAnalysis 这篇爆料给出了硬数字和明确的时间节点,可信度不低,但正文没披露 S-1 细节,所以重要性先打个小折。Anthropic 靠 Claude Code 在企业端跑通赚钱,比 OpenAI 先一步秘密交表,这件事对行业排序有直接影响,值得放在头条。

Hacker News 首页

Anthropic 的 Fable 模型在计算机科研任务上接连翻车,作者直呼“没用”

Rob Patro 用亲身经历吐槽 Fable 的安全审核机制。他第一次想让 Fable 帮忙把一个 C++ 生物信息工具移植到 Rust,结果因为提示词里包含 RNA-seq 这类生物学术语,直接被安全分类器拒了。他花了 15 到 30 分钟反复改提示词都没用,最后用 Opus 4.8 顺利完成了任务。第二次他让 Fable 解决一个网络演化重建的算...

推荐理由:Rob Patro 拿两个真实编程任务测 Fable,全被安全审核机制挡掉,改提示词花了 15 到 30 分钟也没用,换 Opus 4.8 直接搞定。这是 Anthropic 自家安全模型在专业使用中翻车的一手记录,有具体对比和时间损耗。分数没给更高是因为只是一篇个人博客,样本量有限,但信息密度够,对从业者有提醒价值。