跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,196 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 861–880 条 · 共 1,196 条

5月17日星期日

AI HOT 精选

Anthropic CEO 说 AI 可能把 GDP 拉高 5%–10%,但失业和不平等也会跟着涨

Dario Amodei 给了两个数字:AI 可能推高 GDP 增速到 5%–10%,同时失业率会上升、贫富差距拉大。他的核心判断是软件成本会降到接近零,传统靠卖软件授权的商业模式会被打穿。现在工程师还能去做编辑或升级工作,但 AI 模型会不断吃掉更多任务,很多干了几十年的职业会慢慢消失。他担心社会还没意识到这场变化的规模和冲击有多大,自己既兴奋又发愁...

推荐理由:Dario Amodei 这次把话说得很直:AI 可能带来 5% 到 10% 的 GDP 增长,同时推高失业和不平等,软件成本会便宜到近乎免费。我会先打个折,因为原文是 X 上的摘要,不是完整访谈实录,没法确认他有没有给限定条件。但即便只是方向性判断,也足够让做 AI 的人重新掂量自己的位置——增长是你的机会,免费软件可能先吃掉你的老业务。

Computing Life · Share · 鸭哥调研

Vibe Coding 的安全危机:一键部署把 2000 个企业应用的数据晾在了公网上

安全公司 RedAccess 扫描了 Lovable、Replit 等四个 AI 编程平台上的 38 万个应用,发现约 2000 个直接暴露了敏感数据,包括医院排班表、银行财务数据和临床实验资料。问题不出在 AI 写的代码,而是这些平台默认帮你一键部署到公网,且不强制开启身份验证。Moltbook 社交平台上线三天就因数据库权限开关没打开,导致 150...

推荐理由:这篇文章抓的点很准:不是 AI 写的代码有漏洞,而是平台一键部署时默认公开,把医院排班、银行财务这些敏感数据直接晾在外面。我会先打个折,正文没披露具体是哪个平台、涉及多少家企业,数字只说了“数千个应用”,验证上弱了一点。但选题本身对做 AI 编程的人是个实打实的提醒,安全锅不一定在模型,也可能在发布流程的默认设置上。

AI HOT 精选

MagicPath 直接嵌进 Codex 当画布用,拖拽 UI 就能实时出代码

MagicPath 的 CEO 演示了把自家工具直接跑在 Codex 里,不再需要 Figma 和 IDE 两头切。用户在 Codex 里贴一条命令就能装好,然后像拖积木一样摆界面,Codex 会实时感知项目结构并自动生成、修改代码。演示里没提复杂交互和状态管理能覆盖到什么程度,但至少常规 UI 搭建看起来省掉了一轮导出导入的折腾。

推荐理由:MagicPath 把可拖拽的设计画布塞进了 Codex,一条命令配好就能用,拖完 UI 直接出代码。演示看着挺顺,但正文只给了一条视频,没提支持哪些框架、权限怎么控、复杂项目里能不能复现。我会先打个折:想法好,落地证据还薄,先当 featured 里偏轻的一条。

AI HOT 精选

Eric Jang 从零复现 AlphaGo:2026 年训练强围棋 AI 只要几千美元算力

Eric Jang 花了几个月从零实现 AlphaGo,并把过程写成教程和代码放了出来。他原本的理解是“用自我对弈训练的搜索增强神经网络”,但亲手做一遍后对细节有了更深体会。他给出一条关键判断:前沿研究仍然很贵,但特定能力的落地成本掉得很快——到 2026 年,训练一个能打的围棋 AI 租算力只要几千美元,不再需要 DeepMind 级别的资源。他自称...

推荐理由:我会先打个折:这是个人分享,不是论文或模型发布,所以信息密度有限。但亮点很明确——Eric Jang 一个人花几个月从零把 AlphaGo 做出来,还给了个具体成本判断:2026 年租算力训强围棋 AI 只要几千美元。这个数字直接说明当年需要大团队、大预算的系统,现在个人和小团队也能碰了。正文没披露具体训练配置和模型强度验证,所以“强”到什么程度还不好说,这点先别太激动。整体适合当一条有话题、有数字、对从业者有参考价值的动态来推。

5月16日星期六

TechCrunch · AI

OpenAI 联合创始人 Greg Brockman 正式接管产品策略,计划把 ChatGPT 和编程工具 Codex 合并成一个产品

Greg Brockman 不再只是临时管产品,现在正式接手 OpenAI 的产品方向。Wired 拿到的一份内部备忘录显示,他打算把 ChatGPT 和 Codex 打通,做成一个统一的体验,不再让聊天和写代码割裂。Brockman 在备忘录里说,这是为了集中精力押注“智能体未来”,同时在消费者和企业市场两边赢。OpenAI 对 TechCrunch...

推荐理由:我会先打个折:正文没给出合并后的具体功能边界、上线时间或灰度计划,所以这更像一个方向信号而不是产品发布。Brockman 回归产品线本身是强信号,但 Wired 的合并说法目前只有一句话,细节全缺,这点先别太激动。如果合并成真,等于把对话和写代码两条主线拧成一股,对开发者工作流冲击不小;但没看到落地前,只能当人事+路线图变动来理解。

AI HOT 精选

Anthropic 内部手册:AI 反而会让创业失败率变高

Anthropic 发了份内部手册叫《Founder's Playbook》,结论挺反直觉:像 Claude Code 这类 AI 工具,不是让创业更容易成功,而是会把失败率推高。手册把创业拆成想法、原型、发布、扩张四个阶段,逐个拆解 AI 放大风险的方式。最核心的问题是,AI 能几分钟跑出一个能用的原型,创始人很容易把“能跑通”当成“市场需要”,再用...

推荐理由:Anthropic 这份创始人手册没在吹自家工具多好用,而是警告 Claude Code 这类 AI 会让创业者在四个阶段更容易踩坑。我会先打个折:正文没给出具体数据或可复现的测试,更像经验总结。但“降低建造成本却放大判断错误”这个角度确实少见,对正在用 AI 加速开发的团队是个清醒提醒。

AI HOT 精选

三个研究员用 Anthropic 的 Mythos 工具,六天写出一个 macOS 内核漏洞,绕过了苹果 M5 芯片的内存完整性保护

苹果在 M5 和 A19 芯片上花五年做的 MIE 内存完整性保护,被三个研究员用 Anthropic 的 Mythos 工具攻破了。他们 4 月 25 日发现漏洞,5 月 1 日就写完利用程序,全程只用了六天。攻击手法是纯数据攻击,不碰指针,靠普通用户权限的标准系统调用就能拿到 root 权限。团队已经当面把报告交给了苹果。完整技术细节要等苹果发补丁...

推荐理由:我会先打个折:正文只提了三位研究人员和 Mythos 工具,没披露漏洞是否已报给苹果、Mythos 具体怎么辅助的、以及 Anthropic 的回应,所以信息有缺口。但 6 天从发现到完成内核漏洞利用、绕过 M5/A19 的 MIE 并拿到 root,这个速度和效果本身就很说明问题——AI 辅助攻击开发的门槛在降。对从业者来说,这比单纯说“AI 不安全”更有冲击力,因为直接落在具体芯片和系统上。H/K/R 全过,但单篇来源和缺少后续处理信息,让我没给到 85 分以上。

AI HOT 精选

Codex 现在能遥控多台电脑,ChatGPT 里切项目就能换设备

Codex 通过 ChatGPT 不仅能连一台电脑,还能直接控制另一台,多设备管理不用来回切换客户端,在 ChatGPT 里换个项目就能拿到对应设备的上下文和文件。推文里还提到支持远程 SSH 去设置其他虚拟机,多机协作的灵活度上了一个台阶。不过正文没披露延迟表现和权限隔离细节,实际用起来稳不稳还得看后续反馈。

推荐理由:这条更新让 Codex 从“陪你聊代码”往“替你上手操作”迈了一步,多设备远程控制和项目级上下文切换是实打实的机制,不是概念包装。我会先打个折:目前只有一条 X 上的简短预告,没有官方发布页、定价、权限模型,也没有可复现的演示,信息密度偏薄。所以重要性给到 76、放在 featured 里是合适的——有料,但别急着当成熟产品看。

r/LocalLLaMA

Qwen3.6-35B-A3B 和 9B 登上 Terminal-Bench 2.0 公开榜,小模型在硬核智能体测试里能跑分了

Qwen3.6 的两个新尺寸上了 Terminal-Bench 2.0 的公开排行榜。搭配 little-coder 这套脚手架(给模型加了一套在终端里干活的外壳),35B-A3B 版本跑出 24.6%(±3.2),压过了 Gemini 2.5 Pro 在 Gemini CLI 上的 19.6% 和 Qwen3-Coder-480B 在 Terminu...

推荐理由:Qwen3.6-35B-A3B 在 Terminal-Bench 2.0 上拿了 24.6%±3.2,比 Gemini 2.5 Pro 在 Gemini CLI 下的 19.6% 和自家 480B 大模型的 23.9% 都高。35B-A3B 这种规模能打,说明小模型做终端 agent 有戏,部署成本会友好很多。不过这是 Reddit 帖子,只贴了排行榜数字,测试怎么跑的、能不能复现,正文都没说。分数本身有参考价值,但别急着当定论,先打个折看。

AI HOT 精选

OpenAI 在 IPO 前夜大洗牌:Brockman 接管所有产品,三大业务线合并,全力押注一个能自己干活儿的桌面超级应用

OpenAI 把 ChatGPT、Codex 和 API 三个原本各自为战的团队合并成一个产品组织,由总裁 Greg Brockman 正式接管产品战略。ChatGPT 原负责人 Nick Turley 被调去管企业业务,消费者端换上了前 Instagram 副总裁。这次重组的目标是集中力量搞一个代号“Super App”的桌面应用,把聊天、写代码和还...

推荐理由:HKR 三项都成立:这是 OpenAI 顶层产品重组,覆盖 ChatGPT、Codex 和 API。正文只有一条摘要,信息量不算深,但属于当天必须写的新闻。Anthropic 估值 9000 亿美元这个数字正文没给出处,我会先打个折,不把它当核心事实用。

量子位 · 公众号

Codex 接上 HeyGen 插件,用自然语言就能生成和剪辑数字人视频

OpenAI 的 Codex 现在能直接调用 HeyGen 插件,你给它一段文字指令,它就能生成带数字人、字幕的视频,还能做剪辑。文章里测了一个大概一分钟的数字人视频,试了把 10 秒后的内容剪掉,以及删掉第 8 秒的一次眨眼动作。正文没披露生成延迟和具体成本,也没说剪辑精度到底有多高,所以“不用开剪辑软件”这个说法先打个折看。

推荐理由:我会先打个折:这只是 Codex 接了一个 HeyGen 插件,不是模型或平台级发布,所以分数卡在 74 这个 featured 区间。文章好处是给了三个带时间点的实测,不是纯吹牛,能看出它能干什么、干得怎么样。正文没披露生成延迟和失败率,这点先别太激动。整体对做 agent 和工具链的人有参考价值,但范围就一个插件工作流,别当成视频剪辑要被颠覆了。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

AI HOT 精选

OpenClaw 团队跑着 100 个 AI 实例干活,完全不看 token 账单

OpenClaw 项目组把 AI 用量拉满,常驻约 100 个 Codex 实例,把代码审查、安全扫描、issue 去重归类、测试环境复现并录屏验证、从会议里自动建任务、垃圾评论过滤和性能回退监控全交给它们跑。他们用 clawpatch.ai 把项目拆成功能单元做审查,还接了 Vercel DeepSec 做安全分析。正文没披露具体花了多少钱,但明确说...

推荐理由:我会先打个折:这只是一条X上的分享,没有披露成本、效果指标或可复现的搭建方式,所以别当成熟方案看。但它的钩子很准——用约100个Codex实例同时干代码审查、安全分析、议题去重、测试复现、任务创建、垃圾过滤和性能回归监控这七件事,还明说“无视令牌成本”,对正在琢磨AI agent怎么落地的从业者来说,是个有参考价值的实操片段。H、K、R都成立,放在featured里偏低的位置刚好。

The Verge · AI

OpenAI 又换高管了,这次是为了打赢 AI 代理这场仗

OpenAI 周五宣布 Greg Brockman 正式接管产品团队。他在内部备忘录里说,公司要把 ChatGPT 和 Codex 合并成一个统一的代理平台——你可以理解成让模型直接进业务流程干活,而不是只聊天或写代码。这已经是 OpenAI 近期又一次高管洗牌,目标很明确:在 AI 代理的竞争里抢到先手。

推荐理由:这条消息有嚼头,因为 Brockman 回归产品线不是普通的人事调整,背后是 OpenAI 想把聊天和写代码打通成一个 agent 体验。我会先打个折:正文没披露合并后的具体能力、上线时间、定价,也没说技术细节,所以重要性停在 83 是合理的。对从业者来说,这更像一个信号——OpenAI 在 agent 赛道上开始收拢产品线,但还没到能评估实际影响的程度。

5月15日星期五

阿里技术 · 公众号

阿里发布 Qoder 1.0,从 AI 写代码工具升级成能自己干活儿的开发工作台

阿里推出了 Qoder 1.0,支持 Windows、macOS 和 Linux。这次最大的变化是它不再只是一个帮你补全代码的编辑器,而是加了一个叫 Quest 的独立工作区,能让多个智能体同时跨项目跑任务。团队知识引擎可以把项目文档、代码库变成可检索的上下文,省得你反复解释。新增的 Experts 模式内置了规划、调研、写码、审查、测试五个角色,试图...

推荐理由:阿里把 Qoder 从写代码工具推到了让智能体自己干活的工作台,加了独立任务视窗、跨项目并行和团队知识库,听着像给开发团队配了几个能记住项目上下文的 AI 同事。正文没披露定价、跑分或任务成功率,所以实际省不省事、稳不稳定还不好说,先当一次有料的产品更新看。

r/LocalLLaMA

网友用百万级 token 实测 Qwen 3.6 35B MTP 版,速度比之前快了约一半

一位 Reddit 用户分三次跑了超过一百万 token 来测 Qwen3.6-35B-A3B 的多 token 预测(MTP)版本,上下文拉到 300k,量化用 KV Q8_0。他给出的结论是生成速度大概比之前测过的版本快了 1.5 倍。不过帖子正文被 Reddit 的安全策略挡了,看不到具体测试环境、硬件配置和任务类型,所以这个提速是在什么条件下跑...

推荐理由:一个 Reddit 用户拿 Qwen3.6-35B-A3B MTP 版跑了三轮百万 token 的测试,在 300k 上下文、KV Q8_0 量化下,速度大概是旧测试的 1.5 倍。这个多 token 预测版(一次预测多个 token)确实在本地跑出了可感知的加速,但正文没披露功耗、显存占用和不同量化级别的对比,所以这个 1.5 倍先别太激动,得看自己硬件上复现怎么样。帖子本身有细节、有实测,对想省钱跑长上下文的开发者有参考价值,但毕竟只是单篇个人测试,重要性我给 74。

AI HOT 精选

Codex 进了 ChatGPT 手机版,可以不在电脑前写代码了

OpenAI 把 Codex 塞进了 ChatGPT 的手机应用里,现在能直接在手机上写和跑代码。正文没说是 iOS 还是安卓都能用,也没提功能砍了多少、要不要付费、什么时候全量推。我会先打个折:目前只是预览版,稳定性和完整度都别抱太高期待。

推荐理由:OpenAI 官方产品更新,HKR 三项都踩中了,但正文信息很薄。没写支持哪些手机系统、功能开到什么程度、收不收费、什么时候推,所以只能放在 featured 这一档。我会先打个折:移动端编程体验听着新鲜,实际能不能用、好不好用,全看后续放出的细节。

量子位 · 公众号

160行代码就能跑通LeCun的JEPA世界模型

一个叫keon/jepa的开源教学库把LeCun提出的JEPA世界模型拆成了5个独立变体,每个都用单个PyTorch文件实现,最短160行,最长278行,只依赖PyTorch和torchvision。其中iJEPA在CIFAR-10上跑了100轮,线性探测准确率52.7%,不算高,但胜在代码够短、能跑通。V-JEPA、C-JEPA和LeWorldMod...

推荐理由:我会先打个折:这不是新模型或新论文,是一个教学仓库,把 JEPA 的几个变体写成极简 PyTorch 单文件,方便看懂核心思路。亮点是代码量压到 160 行起步,依赖干净,适合想快速上手世界模型、又不想啃大项目的人。正文没披露训练数据或性能对比,所以别当生产级工具用,但作为学习材料够直接。

AI HOT 精选

Anthropic 的 Mythos AI 五天挖出两个 macOS 内核漏洞,还串成一条提权攻击链

《华尔街日报》说,Anthropic 的安全研究工具 Mythos 在五天内帮研究人员找到两个之前没人发现的 macOS 内核漏洞,并把它们串成一个完整的提权攻击链,绕过了苹果的内存完整性保护。这意味着攻击者能碰到系统本该锁死的区域。报道指出,现在 macOS 的防御思路已经不是不让漏洞被发现,而是尽量抬高漏洞利用的门槛。Mythos 能帮上忙的地方在...

推荐理由:Anthropic 的 Mythos AI 五天挖出两个未知 macOS 内核漏洞还串成提权链,这事本身信号很强。我会先打个折:目前只有社交平台帖子,没看到论文或复现条件,漏洞具体怎么挖的、模型在哪个环节起了作用,正文都没披露。所以分数压在 81,不往上拉。对从业者来说,这条消息值得看,但别急着把它当成 AI 做漏洞挖掘的成熟证据。

AI HOT 精选

Claude Code 更新 v2.1.142:后台会话可配置,快速模式默认切到 Opus 4.7

Anthropic 给 Claude Code 命令行工具发了 v2.1.142 版本。这次主要干了两件事:一是新增了 8 个命令行参数,用来控制后台会话的行为,比如可以指定会话闲置多久自动关掉、最多同时跑几个后台任务;二是把 Fast 模式的默认模型从之前的版本升级到了 Opus 4.7,意味着快速模式下模型的理解和生成能力会更强。另外修了 15 个...

推荐理由:这次更新对 Claude Code 用户来说挺实在:Fast 模式默认用 Opus 4.7,省去手动切换的步骤;8 个后台会话标志让配置更细,15 个以上的修复也说明稳定性在补。我会先打个折,毕竟是个小版本号,但改动直接落在编码流程上,对 Anthropic 工具链用户有实际影响,放在 featured 档合理。