跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1141–1160 条 · 共 1,195 条

2月26日星期四

OpenAI News

OpenAI Codex 和 Figma 打通了代码与设计稿的来回转换

OpenAI 和 Figma 在 2026 年 2 月 26 日发布了一项新集成:在 Codex 桌面端里,你可以直接把代码转成 Figma 里能编辑的设计稿,也能把 Figma Design、Figma Make 和 FigJam 里的内容拉回代码里继续开发。这个来回转换的流程靠 Figma MCP Server 实现,走的是 MCP 协议,相当于给...

推荐理由:OpenAI 和 Figma 搞了个 Codex 集成,代码能直接生成可编辑的 Figma 设计,反过来 Figma 里的设计、Make 原型和 FigJam 白板也能回写成代码。底层走的是 MCP,通过 Figma MCP Server 接进 Codex 桌面应用。OpenAI 说 Codex 周活已经过百万,年初到现在用量涨了四倍多。我会先打个折,因为正文没披露支持哪些模型、权限怎么划、收不收费、双向转换稳不稳定——这些才是实际落地要盯的。

2月20日星期五

Hugging Face 博客

GGML 和 llama.cpp 团队加入 Hugging Face,本地跑大模型的项目会继续独立运营

Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...

推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。

2月14日星期六

阮一峰的网络日志

字节 Seed 2.0 模型搭配 TRAE 工具,用 Skill 文件给 AI 编程加技能

阮一峰用字节刚发的 Seed 2.0 Code 模型和 TRAE 编程工具,跑了一个把 ASCII 字符画转成手绘风格图的网页应用,本地预览直接能用。Seed 2.0 是字节的通用基座模型,分 Pro、Lite、Mini 和 Code 四个版本,能处理文字、图片、视频等多种数据,也支持让模型调用外部工具。文章重点讲了 Skill 怎么用:把反复要写的提...

推荐理由:这篇文章不是官方通稿,而是一个能跟着跑的通路演示。H 和 K 都站得住,因为既有完整应用产出,又有模型矩阵和 Skill 机制的具体拆解。R 也成立,Skill 文件的设计直接踩中 coding agent 工作流复用的痛点。整体是强教程而非重大发布,所以重要性停在 75。

Dwarkesh Patel 访谈

Dario Amodei:模型能力的指数增长快到头了,时间偏差也就一两年

Anthropic CEO Dario Amodei 在访谈里说,模型能力的指数增长曲线和他三年前预期的差不多,但这条曲线快走到头了,时间上可能就差一两年。他把进步归因于算力、数据、训练时长和可扩展的目标函数,并强调预训练和强化学习(RL)遵循的是同一套缩放逻辑,不是两套。RL 在数学和编程任务上同样表现出对数线性的收益,但正文没给出具体曲线、模型版本...

推荐理由:我会先打个折:正文没给实验曲线、模型版本或可复现参数,所以这不是一篇能拿来复盘的硬证据。但 Amodei 作为 Anthropic 的 CEO,把预训练和 RL 说成同一套扩展故事,并给指数增长判了个一两年的大限,这个信号级别很高。他提到 RL 在数学、编程任务上也是对数线性收益,说明靠堆算力还能再挤一阵子,但天花板已经在视野里了。对做模型训练和算力规划的人,这相当于一个方向性提醒:别按无限指数去押注。

2月13日星期五

OpenAI News

OpenAI 给 Codex 和 Sora 换了一套“先用额度,超了再扣钱”的访问系统

OpenAI 发了一篇工程博文,解释他们怎么解决 Codex 和 Sora 用户老撞速率限制的问题。核心做法是自研了一套实时访问引擎,把速率限制和预购点数揉在一起:请求先走免费速率额度,额度用完了自动从点数余额里扣,用户不用切换系统。文章说这套“决策瀑布”模型能在一个请求里同步完成判断,点数扣减异步处理,并且有三套独立数据(产品用量、计费事件、余额变动...

推荐理由:这是 OpenAI 官方的产品更新,标题抛出了“超越速率限制”这个钩子,对开发者来说很抓眼球,所以 H 和 R 都成立。但正文完全没披露具体怎么调、调多少、谁受益、花多少钱、什么时候上,信息密度极低,K 不成立。我会先打个折,把它放在 featured 底线,等后续有参数再重新评估。

2月12日星期四

MIT Technology Review · AI

AI 让线上诈骗更容易了,而且可能还会更糟

微软说截至 2025 年 4 月的一年里,他们拦下了 40 亿美元的诈骗和欺诈交易,其中很多可能靠 AI 生成内容帮忙。研究人员估计现在至少一半的垃圾邮件是用大语言模型写的,用大模型搞针对性邮件攻击的比例也从 2024 年 4 月的 7.6% 涨到了 2025 年 4 月的 14%。先别急着脑补“全自动 AI 黑客”,眼下真正的问题是 AI 把钓鱼、换...

推荐理由:这篇不是那种“全自动 AI 黑客来了”的标题党,它把焦点拉回到已经发生的事:钓鱼邮件、深伪、恶意代码生成,AI 在降低犯罪成本。数字有,但正文没披露这些攻击的总体增幅,所以判断要收着点。适合放进精选,因为它是一份有数据支撑的趋势报告,不是当天炸出来的事件或产品发布。

MIT Technology Review · AI

中国开源 AI 下一步怎么走:从追赶变成铺管道

MIT Technology Review 这篇展望认为,DeepSeek 在 2025 年初放出 R1 之后,中国公司已经能反复拿出性能接近西方顶级系统、但价格便宜很多的模型。文章举了月之暗面 Kimi K2.5 的例子,说它在早期跑分上接近 Anthropic 的 Claude Opus,价格大约是后者的七分之一。在 Hugging Face 上,...

推荐理由:这篇不是产品发布,但给出了实在的市场信号——约七分之一的价格、Hugging Face 下载份额,以及一个清晰的判断:中国开源正从少数通用模型转向大量可蒸馏、可微调的专用变体。信息量够,对从业者有参考价值,放 featured 没问题。

OpenAI News

OpenAI 发布 GPT-5.3-Codex-Spark,一个跑在专用芯片上、主打实时交互的写代码模型

OpenAI 放出了一个研究预览版模型 GPT-5.3-Codex-Spark,专门为在 Codex 里实时写代码设计。它是个 GPT-5.3-Codex 的缩小版,跑在 Cerebras 的晶圆级芯片上,推理速度超过每秒 1000 个 token,体感上几乎没有延迟。目前只开放给 ChatGPT Pro 用户,上下文窗口 128k,纯文本输入。模型默...

推荐理由:OpenAI 这条更新只给了一个标题,确认型号叫 GPT-5.3-Codex-Spark,正文没有任何实质内容。名字里带 Codex 和 Spark,大概率是代码相关的新模型,但没披露参数、定价、上下文窗口、跑分,也没说是不是只做代码。我会先打个折:名字有话题性,能吸引开发者注意,所以重要度给到 72、放在 featured 没问题;但信息缺口太大,没法判断实际能力,这点先别太激动。

阮一峰的网络日志

阮一峰实测智谱 GLM-5:跟 Claude Opus 4.6、GPT-5.3-Codex 比编程,互有胜负

阮一峰拿四个编程任务对比了 GLM-5、Claude Opus 4.6 和 GPT-5.3-Codex。网页设计上 GLM-5 和 Opus 4.6 都挺好看,GPT-5.3 页眉没粘住往下拉就没了;3D 太阳系沙盒都能跑,但 GLM-5 缺了引力网格线,Opus 4.6 动画效果最好;愤怒的小鸟游戏 Opus 4.6 还原度最高,GLM-5 能玩但弹...

推荐理由:这篇文章靠单人实测和视频对比撑起来,不是标准化基准测试,所以我会先打个折。但它给了 4 个具体任务和明确的时间差,对正在挑编程模型的团队有直接参考价值。正文没披露 GLM-5 的规模、训练成本或更多样本量,这点先别太激动。整体看,它把一个国产旗舰拉到和两款闭源顶配同场比较,信息密度和时效性都够,放在 featured 档合理。

2月6日星期五

TechCrunch · AI

OpenAI 和 Anthropic 在同一天抢着发布能自己干活的编程模型,前后只差几分钟

OpenAI 推出了 GPT-5.3 Codex,一个专门给自家编程工具 Codex 用的新模型。按 OpenAI 的说法,这个模型让 Codex 从“能写代码、审代码”升级到“几乎能替开发者在电脑上干所有事”,甚至能在几天内从零做出功能复杂的游戏和应用。速度比上一代 GPT-5.2 快了 25%,而且 OpenAI 说这是第一个“自己参与造自己”的模...

推荐理由:这条消息的看点全在时间差——OpenAI 在 Anthropic 发布后几分钟就甩出自己的代理式编码模型,说明两边在让模型进开发流程这件事上咬得很紧。但正文能用的信息太少:没模型名、没跑分、没价格、没上下文窗口、也没说谁能用,只提了一嘴跟 Codex 有关。所以我会先打个折,重要性给到 75、放在 featured 低位,因为话题热度够,但证据太薄,暂时没法判断性能或性价比。

2月5日星期四

MIT Technology Review · AI

AI 圈被误解最深的一张图:METR 的时间线图到底在说什么

METR 这张图横轴是模型发布时间,纵轴是“时间线”——一个他们自己发明的指标,指模型在编程任务上能做到 50% 成功率时,对应的人类用时。Claude Opus 4.5 在 2025 年 12 月测出来大约是 5 小时,但 METR 自己给的误差范围是 2 到 20 小时,所以别拿一个数字当定论。这张图主要测的是写代码,不是通用 AI 能力,而且“5...

推荐理由:这篇文章不是新模型或产品发布,而是对一张流行图表的权威解释性评论。它把 METR 图里容易误读的地方拆得很清楚:5小时不是模型自己能跑5小时,而是人类做同样任务要花的时间;图主要测编码任务,且以50%成功率划线。这些细节对盯着 AGI 进度的人有用,但信息增量属于澄清而非首发,所以放在 featured 低段位。

2月3日星期二

Computing Life · 鸭哥

学 AI 的人卡在配置和部署上,这个团队用工程基建代替教程来解决

作者团队两年开了四门课、教了 2500 多人,发现大部分学员不是学不会,而是被绑卡、配环境、部署这些琐事耗光了热情。他们做了一个叫 AI Builder Space 的教学平台,学员注册后直接拿到免绑卡的统一 API,背后接好了 GPT、Claude、Gemini 等主流模型,改个参数就能对比实验;写完代码调个接口就能一键部署到 <名字>.ai-bui...

推荐理由:这篇文章把老生常谈的“教程没用”落到了具体数字和产品设计上:2500多个学员,真正交付产品的很少,卡在配置、实验、部署和上下文整理四件事。团队没再写新教程,而是搭了个平台,把免绑卡API、一键部署、多模型切换和MCP接入打包进去,让Cursor和Claude Code一行命令就能用。思路对,但正文没披露转化率、留存和成本,所以判断先打个折,放在featured低段。

2月1日星期日

Lex Fridman 播客

2026年AI现状:大模型、编程、规模定律、中国、智能体、GPU与AGI

Lex Fridman 与 Sebastian Raschka、Nathan Lambert 聊了聊 2026 年的 AI 竞赛。他们把 2025 年 1 月 DeepSeek R1 的发布看作一个关键转折点,那次发布让很多人意识到,用少得多的算力和成本也能做出接近顶尖水平的模型。现在竞争已经不只是美国公司的事,中国这边除了 DeepSeek,还有 Z...

推荐理由:这期播客不是新闻爆料,而是高质量的行业判断。三位把 2025 年 1 月 DeepSeek R1 发布当作转折点,认为技术扩散在加速,差距更多体现在算力、预算和团队文化上,而不是某个模型刷榜。我会先打个折:正文没给任何硬数据支撑,所以别当技术报告读。但如果你关心 AI 竞争格局怎么变,这期值得听。

1月30日星期五

阮一峰的网络日志

你是第几级 AI 编程

史蒂夫·耶格把 AI 编程分成 8 级,从在 IDE 里装插件、逐条确认建议,到一路无脑点 Yes,再到同时开十几个 AI 窗口并行写代码,最后用编排器让机器自己管机器。他说自己已经到了第 8 级,还让 AI 写了个叫“煤气镇”的编排工具,攒了 22.5 万行 Go 代码,一行都没看过。这个工具已经拿到 6000 颗星,但他也直说用起来很费钱,而且可能...

推荐理由:Steve Yegge 这篇不是产品发布,是他自己的实践总结,但把“黑箱编程”从个人习惯抬到了工具链选择的层面。8 级分级本身有传播力,里面提到的并行跑 Agent 的成本和失控风险也写得很直白,没画饼。我会先打个折:这是二手评论,不是一手模型或产品,所以分数停在 77 合理。

MIT Technology Review · AI

美国国土安全部用上了 Google Veo 3 和 Adobe Firefly 做视频

一份 DHS 公开的 AI 工具清单显示,他们正在用 Google Veo 3(视频生成)、Google Flow(整合了 Veo 3 的剪辑工具)和 Adobe Firefly 来制作和编辑对外发布的视频内容,估计有 100 到 1000 个使用许可。这算是第一次有书面证据表明,移民执法部门在社交媒体上发的那些看着像 AI 做的视频,背后可能用的就是...

推荐理由:这条消息的冲击力在于,一个联邦机构已经不只是内部试用,而是把生成视频工具写进了对外内容制作的流程里。100 到 1000 份许可的估算说明规模不小,但正文没披露具体项目、发布时间或单条视频归属,所以实际落地到什么程度还看不清。我会先打个折,不把它推到更高等级,因为缺少可验证的产出案例。真正值得盯的是跨平台水印和内容溯源目前没法验证,这点先别太激动,但确实是个持续的风险敞口。

1月29日星期四

阮一峰的网络日志

Kimi 把模型和智能体绑在一起发,Manus 则靠别人的模型做上层应用

Kimi 这次发布的重点不是 K2.5 模型本身,而是它同时推出了一个基于该模型的智能体应用,直接在官网上线了。这跟 Manus 的做法正好相反:Manus 用的是 Anthropic 的 Claude 模型,自己只做上层的智能体产品,属于分层开发。Kimi 走一体化路线,把底层模型和上层应用打包发布。文章实测了 K2.5 智能体的“视觉编程”功能,上...

推荐理由:这篇值得看,因为它讲的是产品形态的转向,而不只是模型跑分。Kimi 这次把 K2.5 模型和 Agent 模式一起塞进官网切换入口,等于告诉用户“你不用管底下是什么,直接用就行”。1500 步操作和 100 个 Agent 并发的数字,说明他们在长任务和并发上做了工程投入;视觉编程那条路,是从设计稿或录屏直接出页面,想法挺直接。但我会先打个折:正文没写价格、上下文长度和 API 条件,这些才是工程落地的硬指标。另外消息源本身是评论性质,不是一手技术报告,所以判断要留余地。整体来说,它把“一体化还是分层”这个老问题又拉回台面上,对做 Agent 产品...

1月28日星期三

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

1月5日星期一

Import AI

Meta 用 GPT、Claude 和 Llama 自动写底层算子,开发时间从几周缩到几小时,部分性能比 PyTorch 基线快 17 倍

Meta 公开了一套叫 KernelEvolve 的系统,专门自动生成和优化 AI 底层算子(kernel),用来在自家不同芯片上跑推荐模型、服务广告。它会接收需求,然后调用内部和外部的大模型(Llama、GPT、Claude)生成候选算子,通过验证后把好的结果存进知识库,让后续生成越来越准。Meta 说这套系统把新算子的开发时间从几周压到了几小时,生...

推荐理由:我会先打个折:这是 newsletter 对技术工作的转述,不是一篇独立论文,所以停在 80 分。但 HKR 三项都站得住——让模型写算子这件事本身就新鲜,数字和流程交代得够具体,去中心化训练那条线又直接碰到算力成本和权力集中的神经。正文说去中心化训练按每年 20 倍在涨,但跟前沿训练还差约 1000 倍,这点先别太激动,差距能不能继续缩小才是政策影响的关键。

1月1日星期四

36 氪 · 直链

月之暗面融了5亿美金,账上趴着100亿,杨植麟说短期不上市

月之暗面在2025年最后一天宣布完成5亿美元融资,投后估值43亿美元,IDG领投,阿里、腾讯、高榕、今日资本等老股东超额跟投。创始人杨植麟发内部信说公司现金超过100亿元,短期不着急上市。2025年他们主动停掉烧钱投流,砍了多个C端产品,把重心转向开源和海外。7月开源的K2模型一周内冲上OpenRouter全球趋势榜第二,海外付费用户月均环比增长超17...

推荐理由:月之暗面是国内一线模型公司,新融资加运营数据本身就值得关注。HKR 三项全中:战略转向有信号、财务和收入数字够硬、话题踩中行业焦虑点。但本质还是融资和业务动态,不是重大模型或产品发布,所以留在 featured 不升 tier。

2025年12月18日星期四

OpenAI News

OpenAI 发了 GPT-5.2-Codex,但正文是空的

标题只确认了模型名叫 GPT-5.2-Codex,版本号 5.2。正文没披露任何细节——不知道价格、上下文长度、是否开放 API,也不清楚它跟旧版 Codex 是什么关系。等官方补全文档再判断。

推荐理由:这条消息就一个标题,正文是空的,所以我会先打个折——能确认的只有 OpenAI 发了个叫 GPT-5.2-Codex 的东西,版本号 5.2。没写定价、没写上下文长度、没写是取代旧 Codex 还是并行跑,也没写谁现在能用。真正该盯的是后续正文和 API 文档什么时候补上。但光这个名字就够让做代码 agent 和开发工具的人盯一眼,因为 OpenAI 在编程模型上再推新版,直接影响工具链选型和成本预期。