跳到正文

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

1,195 条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 1161–1180 条 · 共 1,195 条

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了份用户报告:ChatGPT 的性别差距快没了,低收入国家涨得最猛

OpenAI 和哈佛经济学家 David Deming 一起发了篇 NBER 工作论文,分析了 150 万条 ChatGPT 对话,是目前规模最大的消费者使用研究。先说谁在用:到 2025 年 7 月,可识别性别的用户里女性名字占比从 2024 年 1 月的 37% 涨到了 52%,性别差距基本抹平。低收入国家的用户增长速度是高收入国家的 4 倍多,不...

推荐理由:H、K、R 全中:150 万对话的用法拆解本身就是好钩子,49/40/11 的用法分法和 4 倍增速差是实打实的新信息,对关注 AI 落地和用户扩散的人有直接参考价值。停在 82 分是因为这是消费者使用研究,不是模型或产品变动,属于高信号背景信息而非当天必读。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月2日星期二

OpenAI News

OpenAI 收购实验平台 Statsig,创始人 Vijaye Raji 将出任应用部门 CTO

OpenAI 宣布要收购 Statsig,一家做 A/B 测试、功能开关和实时决策的实验平台。收购完成后,Statsig 的创始人 Vijaye Raji 会加入 OpenAI,担任应用部门的 CTO,向 Fidji Simo 汇报。他主要负责 ChatGPT 和 Codex 的产品工程,包括底层系统和内容安全。Raji 之前在 Meta 管过大规模消...

推荐理由:OpenAI 买下 Statsig 并让 Vijaye Raji 当 Applications CTO,管 ChatGPT 和 Codex 的工程,这步棋把产品实验能力和工程领导力一起收了。正文没披露收购金额和整合时间表,但汇报关系和独立运营的框架都交代清楚了,信息量够,值得写。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

OpenAI News

OpenAI 发布 GPT-5:一个模型自动判断该快答还是慢想,全员可用

OpenAI 在 8 月 7 日上线了 GPT-5,所有 ChatGPT 用户都能用。这次最大的变化是把快速回答和深度推理合进了一个系统:内置一个路由器,根据问题类型、复杂度和用户意图实时决定用哪个模型。Plus 用户额度更高,Pro 用户能解锁 GPT-5 pro,那个版本推理链条更长,答案更细。官方说 GPT-5 在编程、写作、健康咨询上比前代强,...

推荐理由:OpenAI 发新旗舰模型本身就是顶格事件。这次不是单纯升级,而是把推理能力内置进系统,用路由器统一调度,所有 ChatGPT 用户都能用,Plus 和 Pro 再拉开配额。HKR 三项全中,缺价格、上下文窗口和 API 细节不影响 p1 判定。

2025年8月5日星期二

OpenAI News

OpenAI 开源了两个推理模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议

OpenAI 发了两个开源模型,一个 1200 亿参数,一个 200 亿参数,都是纯文本推理模型,能调“思考用力程度”,支持工具调用和结构化输出,可以直接放进让模型干活的业务流程里。模型权重用 Apache 2.0 协议开放,也兼容自家的 Responses API。正文没提上下文长度、价格和跑分。安全方面,OpenAI 说 1200 亿参数版本在生物...

推荐理由:这条当天就得写:H 来自 OpenAI 走开放权重路线,K 来自许可、机制和安全事实但缺关键指标,R 来自开源与闭源部署的争论。分数没给到 90 是因为正文没披露上下文长度、价格和完整基准结果,我会先打个折。

2025年7月30日星期三

Mistral AI

Mistral 发布 Codestral 25.08 与企业级编码栈

Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。

推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业级编码栈的部署方式,可据此判断私有化编码方案是否可行。

2025年7月17日星期四

OpenAI News

ChatGPT 现在能自己操作电脑帮你干活了,把搜资料、跑代码、做 PPT 合成一个 agent

OpenAI 在 7 月 17 日把 Operator 的网页操作能力和 deep research 的信息整合能力合进了一个 ChatGPT agent 里,Pro、Plus、Team 用户都能用。它相当于给 ChatGPT 配了一台虚拟电脑,自带浏览器、终端和 API 接口,能自己上网点来点去、筛选结果、跑代码分析数据,最后直接生成可编辑的幻灯片或...

推荐理由:OpenAI 把 Operator、deep research、终端和 API 访问揉成一个 agent mode,Pro、Plus、Team 用户都能用。我会先打个折:正文没披露定价、配额和基准结果,所以实际成本和效果还得等。真正值得盯的是权限设计——敏感操作要用户点头,用户可以随时接管浏览器或叫停任务,这比功能堆叠更关键。

2025年7月11日星期五

Mistral AI

Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。

推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数和 API 定价,便于对比现有方案。

2025年6月4日星期三

Mistral AI

Mistral AI 发布企业级编码助手 Mistral Code

Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 气隙部署,代码保留在企业边界内。

推荐理由:官方给出企业级编码助手的模型组合、部署方式与客户案例,可据此判断私有化编码方案的落地路径。

2025年6月1日星期日

OpenAI News

OpenAI 封禁一批中国账号,用 ChatGPT 生成美国对立内容但几乎没人看

OpenAI 根据 Meta 的线索,封掉了一批来自中国的 ChatGPT 账号,内部代号叫“Uncle Spam”。这些账号主要干三件事:一是生成支持和反对关税的帖子,在 X 和 Bluesky 上同时发,故意挑动对立情绪;二是用 AI 生成“退伍军人”之类的假头像,冒充美国老兵批评现任政府;三是让模型写代码去扒 X 和 Bluesky 的用户资料,...

推荐理由:OpenAI 根据 Meta 的线索端掉了一批中国 ChatGPT 账号,代号“Uncle Spam”。文章把具体操作摊开了:用 AI 在 X 和 Bluesky 上同时发正反两种关税帖子,故意制造对立;生成“退伍军人”假头像冒充美国老兵骂现任政府;还让模型写代码去扒两个平台的用户资料。这些细节让事件从“又抓了一批号”变成了一个可拆解的操作案例。我会先打个折,因为这不是产品更新或模型发布,而是一次安全事件通报,所以分数落在值得推荐的区间里。

2025年5月23日星期五

OpenAI News

OpenAI 把 Operator 的底层模型从 GPT-4o 换成了 o3,但 API 版本暂时不动

OpenAI 在 5 月 23 日发了份系统卡补充说明,核心就一件事:Operator 这个能替你操作网页的智能体,后台模型从 GPT-4o 升级到了 o3。API 那边还是用 4o,没换。o3 版 Operator 的安全策略和之前一样,多层防护,额外用了一批电脑操作的安全数据做了微调,主要是教模型什么时候该确认、什么时候该拒绝。它继承了 o3 写代...

推荐理由:这是一次有实质内容的 OpenAI 部署更新。H 来自 Operator 用 o3 而 API 仍用 4o 的分裂操作,K 来自明确的安全与能力边界说明,R 来自浏览器 agent 场景的直接相关性。没给更高分是因为这只是系统卡补编,正文没披露评测分数和误用数据,验证力度有限。

2025年5月21日星期三

Mistral AI

Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上。

推荐理由:Mistral 与 All Hands AI 联合发布的智能体编码模型,给出了 SWE-Bench Verified 成绩与本地部署门槛。

OpenAI News

OpenAI 在 Responses API 里塞进了远程 MCP、生图、代码解释器和文件搜索

OpenAI 给 Responses API 加了一批新工具,最核心的是支持远程 MCP 服务器,让模型能直接连上 Shopify、Stripe、Twilio 这些外部服务干活。同时把 gpt-image-1 生图、Code Interpreter 和文件搜索也做成了内置工具,o3 和 o4-mini 现在能在思考链里直接调用这些工具,并且跨请求保留推...

推荐理由:OpenAI 把 Responses API 做成一个更完整的 agent 入口,远程 MCP、图像生成、Code Interpreter、文件搜索和推理中调工具全塞进去了。HKR 三项都踩中,但正文节选没披露完整定价和全部可用性细节,所以我会先打个折——重要性给 83、tier 放 featured 是合理的,别因为截图外的信息缺口把分拉太高。

2025年5月16日星期五

OpenAI News

OpenAI 为 o3 和 o4-mini 系统卡补了一份 Codex 说明

OpenAI 在 5 月 16 日给 o3 和 o4-mini 的系统卡打了个补丁,专门讲 Codex 这个云端编程助手。Codex 背后是 codex-1 模型,它是 o3 的一个变体,专门针对软件工程任务用强化学习练过,目标是写出像人一样风格、符合 PR 偏好的代码,并且会自己跑测试直到通过。每个 Codex 实例都在一个独立的云端容器里干活,容器...

推荐理由:这篇是系统卡补编,不是主产品发布,但信息密度不低。我会先打个折,因为安全文档通常偏保守,不过它把执行细节讲清楚了:独立云容器、用户自配开发环境、启动后断网、能跑测试和 lint。真正值得看的是可验证链路——Codex 会引用终端日志和文件,结果能直接导出成 GitHub PR 或本地 diff,这对审计和信任加分很大。正文没披露具体性能基准或成本数据,所以别急着对标其他编码代理。整体属于有料但不炸裂,featured 合理。

OpenAI News

OpenAI 发布云端编程代理 Codex,能并行处理多个开发任务

OpenAI 在 5 月 16 日推出了 Codex 的研究预览版,这是一个跑在云端的软件工程代理,底层是专门为编程优化过的 codex-1 模型(基于 o3)。你可以把它当成一个能同时干好几件事的远程开发助手:在 ChatGPT 侧边栏里给它派活,比如写新功能、修 bug、回答代码库的问题或者直接提 PR。每个任务都在独立的沙盒环境里跑,它会自己读代...

推荐理由:OpenAI 这次不是给代码补全加功能,而是直接扔出一个云端软件工程代理 Codex。它能在隔离沙箱里读写仓库、跑命令和测试,单个任务耗时 1 到 30 分钟,还会把终端日志和测试结果吐出来给你看——这点挺实在,不是光说“能写代码”就完了。首发给了 Pro、Business、Enterprise 用户,6 月 3 日才扩到 Plus,正文在价格和完整限制上截断了,所以我会先打个折:产品方向够硬,但商业细节没讲透,先给 88 分。