跳到正文

#编码

今日 0 条

4月15日星期三

X · @claudeai

Claude Code 推出定时任务功能,写好指令就能在云端自动跑,不用一直开着电脑

Anthropic 给 Claude Code 加了一个叫 routines 的研究预览功能。你可以一次性配好提示词、代码仓库和要对接的工具,然后让它按时间表、API 调用或事件触发自动执行。这些任务跑在 Anthropic 自己的服务器上,所以你的笔记本不用一直开着。正文没提怎么收费、有没有次数限制,也没说这个功能会推给哪些用户。

推荐理由:这次更新把 Claude Code 从本地交互式编程扩展到了托管、定时和事件驱动的执行模式,HKR 三项全中,Anthropic 的产品动态本身也有加分。但正文没公布价格、配额和具体开放范围,所以先放在 featured 而不是 P1。真正值得盯的是托管执行这条链路,不是单次补全功能。

4月11日星期六

X · @claudeai

Claude 出了 Word 插件,现在可以在侧边栏直接写稿、改稿

Anthropic 把 Claude 塞进了 Word,目前是测试版。你在文档侧边栏就能让它帮你起草、编辑和修改内容,Claude 会保留原有格式,改动以修订模式显示,方便你逐条确认。这个功能只开放给 Team 和 Enterprise 用户,正文没提价格、支持地区,也没说什么时候正式上线。

推荐理由:这是个有用但分量中等的 Anthropic 产品更新。官方帖子确认了 Word 侧边栏入口、Team 和 Enterprise 方案可用、保留原有格式并以修订模式显示改动,所以 K 和 R 都站得住。但价格、地区和具体上线时间都没说,信息缺口明显,只能放在 featured 的低位。

4月10日星期五

X · @OpenAI

OpenAI 给 ChatGPT 加了个 100 美元/月的 Pro 档,主要给 Codex 重度用户用

OpenAI 新设了一个每月 100 美元的 Pro 订阅档,Codex 用量是 Plus 档的 5 倍,适合长时间、高强度的编程任务。这个档位保留了原 Pro 的全部功能,包括专属 Pro 模型以及 Instant 和 Thinking 模型不限次使用。到 5 月 31 日前有个限时活动,Codex 用量临时提到 Plus 的 10 倍。正文没解释为...

推荐理由:OpenAI 给 Pro 加了个每月 100 美元的新档位,核心是把 Codex 用量提到 Plus 的 5 倍,其他 Pro 功能不变。5 月底前有个临时福利,Codex 额度再翻倍到 10 倍,但我会先打个折,这只是限时促销。真正值得盯的是,他们开始把代码代理这种重度用法单独拿出来计费,说明以后高强度用 AI 写代码可能要多掏钱。正文没提新模型或技术突破,所以重要性主要落在定价信号上,对团队预算和工具选型有直接参考价值。

4月8日星期三

X · @AnthropicAI

Anthropic 启动 Glasswing 项目,用新模型 Claude Mythos Preview 找关键软件漏洞

Anthropic 发了个新项目叫 Project Glasswing,专门盯着最关键的软件做安全加固。背后用的是他们最新的前沿模型 Claude Mythos Preview,官方说它找漏洞的能力仅次于最顶尖的人类专家。不过正文没给出具体跑分、测试范围、怎么申请试用,也没说什么时候正式开放,所以实际效果还得等可复现的评测出来再看。

推荐理由:这篇 Anthropic 一手公告,标题和摘要确认了 Project Glasswing 和 Claude Mythos Preview 两个名字,说能力仅次于顶尖人类专家,但正文没披露任何可复现的评测数据、软件范围或接入细节。我会先打个折:真正该盯的是他们后续会不会放出基准分数和第三方验证,现在只能当个方向性信号看。

4月3日星期五

X · @claudeai

Claude 的电脑操控功能 Cowork 和 Code Desktop 现在支持 Windows 了

Claude 把电脑操控能力带到了 Windows 上,覆盖 Cowork 和 Code Desktop 两个入口。正文只发了一句话和一条链接,没提支持哪些 Windows 版本、权限怎么管、操作延迟多少、要不要额外付费,也没说什么时候正式推送。对想在 Windows 上跑桌面 agent 的人来说,现在只能知道功能有了,但稳定性和实际跑起来怎么样,这...

推荐理由:Claude 把 computer use 能力从非 Windows 平台扩到了 Windows,标题就这一句事实。正文没披露支持哪些 Windows 版本、权限怎么隔离、操作延迟多少、要不要加钱、什么时候正式上线,这些才是决定能不能在生产环境用的关键。我会先打个折:桌面代理在 Windows 上的稳定性边界还没给可复现条件,别急着全量上。分数维持 74,因为这是官方更新,但信息密度只够确认可用性,离评估还差一截。

3月17日星期二

OpenAI News

OpenAI 发了 GPT-5.4 mini 和 nano,主打编程和子任务,mini 跑得比 GPT-5 mini 快一倍多

OpenAI 在 3 月 17 号推出了 GPT-5.4 mini 和 nano,都是给高吞吐、低延迟场景用的轻量模型。mini 在编程、推理、看图、调工具上都比上一代 GPT-5 mini 强,速度还快了一倍多。跑分上,mini 在 SWE-Bench Pro 拿到 54.4%,跟大哥 GPT-5.4 的 57.7% 差距不大,但延迟低很多,适合需要...

推荐理由:这是 OpenAI 官方模型发布,不是小修小补。我会先打个折:虽然叫 GPT-5.4 mini,但别当它是 GPT-5.4 的完整缩小版,更像是一个专攻编码和子代理任务的轻量选手。真正值得盯的是它用更低价格和更快速度,把 SWE-Bench Pro 拉到 54.4%,离大模型只差 3.3 个百分点——这点先别太激动,正文没披露其他基准的对比,不知道通用能力缩水多少。nano 更极端,只走 API,价格压到输入 0.20 美元,明显是给大批量、简单任务准备的。整体看,OpenAI 在推‘够用且便宜’的代理专用模型,对频繁调用代码工具的场景挺省钱。

3月11日星期三

Mistral AI

Mistral 用 Vibe 构建自动编写 Rails 测试的智能体

Mistral 基于其开源编码助手 Vibe 构建了一个自动编写 Rails RSpec 测试的智能体,可读取源码、生成或改进测试、按风格规则与覆盖率目标校验,并在 CI/CD 中无人干预运行。

推荐理由:Mistral 公开了用 Vibe 构建自动写 RSpec 测试智能体的完整方法,包含上下文工程、技能文件与自定义工具的可迁移细节。

OpenAI News

OpenAI 给 Responses API 加了个电脑环境,让模型能自己敲命令行干活

OpenAI 在 2026 年 3 月 11 日说,他们的 Responses API 现在能调用一个 shell 工具,在托管的隔离容器里执行命令。模型(GPT-5.2 及之后版本)会自己提议该敲什么命令,API 负责在后台跑、把结果流式传回来,还能同时开多个会话并行处理。容器里带了文件系统、可选的 SQLite 和受限的网络访问。这相当于给模型配了...

推荐理由:这次更新把 Responses API 从“调工具”升级成“给模型一台隔离电脑”,shell 执行、流式输出、并行跑命令、上下文压缩都实装了,对 agent 开发者是实打实的新能力。正文后半段截断,定价、配额和完整安全边界都没写,所以实际落地成本和安全兜底还得等后续披露。

3月6日星期五

OpenAI News

OpenAI 把代码安全扫描工具 Codex Security 开放给付费用户试用,下个月免费

OpenAI 在 3 月 6 日上线了 Codex Security 的研究预览版,面向 ChatGPT Pro、Enterprise、Business 和 Edu 用户,下个月可以免费用。这个工具相当于一个应用安全助手,会先读懂你的项目结构,生成一份可编辑的威胁模型,再根据这个模型去找漏洞、做验证、给修复建议。过去 30 天里,它扫了外部仓库超过 1...

推荐理由:这是 OpenAI 给开发和安全团队的一个实质性产品更新,不是泛泛的安全宣传。切入点新、有具体扫描和误报数据、回应了 AI 编码风险和告警疲劳,三个点都站得住。不过目前还是研究预览,正文没披露误报下降的具体测试条件和补丁的采纳率,效果得等正式版再看。

3月5日星期四

OpenAI News

OpenAI 发布 GPT-5.4 Thinking 系统卡,首次给通用推理模型加了高级网络安全防护

OpenAI 在 2026 年 3 月 5 日公开了 GPT-5.4 Thinking 的系统卡。这是 GPT-5 系列最新的推理模型,也是第一个把“高级网络安全能力”的防护措施做进通用模型里的产品。它的安全方案跟之前的 GPT-5 系列差不多,但这次把给 GPT-5.3 Codex(代码模型)用的那套网络安全防护搬到了 ChatGPT 和 API 里...

推荐理由:这篇系统卡信息量不大,没给具体分数、缓解细节和部署条件,我会先打个折。但它真正值得盯的是风险门槛的变化——OpenAI 把“高能力网络安全”缓解从专用模型扩到了通用推理模型,这是一个信号。标题里的“首个”不是公关话术,而是安全策略在升级。正文没披露评测数据,所以别指望从这里看到性能对比,重点看安全边界怎么划。

2月26日星期四

OpenAI News

OpenAI Codex 和 Figma 打通了代码与设计稿的来回转换

OpenAI 和 Figma 在 2026 年 2 月 26 日发布了一项新集成:在 Codex 桌面端里,你可以直接把代码转成 Figma 里能编辑的设计稿,也能把 Figma Design、Figma Make 和 FigJam 里的内容拉回代码里继续开发。这个来回转换的流程靠 Figma MCP Server 实现,走的是 MCP 协议,相当于给...

推荐理由:OpenAI 和 Figma 搞了个 Codex 集成,代码能直接生成可编辑的 Figma 设计,反过来 Figma 里的设计、Make 原型和 FigJam 白板也能回写成代码。底层走的是 MCP,通过 Figma MCP Server 接进 Codex 桌面应用。OpenAI 说 Codex 周活已经过百万,年初到现在用量涨了四倍多。我会先打个折,因为正文没披露支持哪些模型、权限怎么划、收不收费、双向转换稳不稳定——这些才是实际落地要盯的。

2月20日星期五

Hugging Face 博客

GGML 和 llama.cpp 团队加入 Hugging Face,本地跑大模型的项目会继续独立运营

Hugging Face 宣布 GGML 和 llama.cpp 的团队正式加入公司。Georgi Gerganov 和他的团队会继续把全部时间花在维护 llama.cpp 上,项目的技术方向和社区管理保持完全独立,不会变成闭源。这次合作最实际的变化是,他们会把 transformers 库里的模型定义更顺滑地接到 llama.cpp 里,目标是做到近...

推荐理由:我会先打个折:正文只说了团队加入和方向,没给时间表、团队规模和商业条款,所以别当成交割日来看。但这件事确实值得盯——HF 把 GGML/llama.cpp 团队收进来,等于把本地推理最核心的工程力量绑定了,同时承诺保持 100% 开源和社区自主。真正有意思的是技术对接:如果 transformers 的模型定义能一键落到 llama.cpp,对开发者来说省掉一大截适配工作。这点先别太激动,等他们真把“单击发布”做出来再说。

2月13日星期五

OpenAI News

OpenAI 给 Codex 和 Sora 换了一套“先用额度,超了再扣钱”的访问系统

OpenAI 发了一篇工程博文,解释他们怎么解决 Codex 和 Sora 用户老撞速率限制的问题。核心做法是自研了一套实时访问引擎,把速率限制和预购点数揉在一起:请求先走免费速率额度,额度用完了自动从点数余额里扣,用户不用切换系统。文章说这套“决策瀑布”模型能在一个请求里同步完成判断,点数扣减异步处理,并且有三套独立数据(产品用量、计费事件、余额变动...

推荐理由:这是 OpenAI 官方的产品更新,标题抛出了“超越速率限制”这个钩子,对开发者来说很抓眼球,所以 H 和 R 都成立。但正文完全没披露具体怎么调、调多少、谁受益、花多少钱、什么时候上,信息密度极低,K 不成立。我会先打个折,把它放在 featured 底线,等后续有参数再重新评估。

2月12日星期四

OpenAI News

OpenAI 发布 GPT-5.3-Codex-Spark,一个跑在专用芯片上、主打实时交互的写代码模型

OpenAI 放出了一个研究预览版模型 GPT-5.3-Codex-Spark,专门为在 Codex 里实时写代码设计。它是个 GPT-5.3-Codex 的缩小版,跑在 Cerebras 的晶圆级芯片上,推理速度超过每秒 1000 个 token,体感上几乎没有延迟。目前只开放给 ChatGPT Pro 用户,上下文窗口 128k,纯文本输入。模型默...

推荐理由:OpenAI 这条更新只给了一个标题,确认型号叫 GPT-5.3-Codex-Spark,正文没有任何实质内容。名字里带 Codex 和 Spark,大概率是代码相关的新模型,但没披露参数、定价、上下文窗口、跑分,也没说是不是只做代码。我会先打个折:名字有话题性,能吸引开发者注意,所以重要度给到 72、放在 featured 没问题;但信息缺口太大,没法判断实际能力,这点先别太激动。

1月28日星期三

Mistral AI

Mistral 发布终端编码智能体 Mistral Vibe 2.0

Mistral 发布终端编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型系列驱动,新增自定义子智能体、多选项澄清、斜杠命令技能、统一智能体模式和自动更新。

推荐理由:原文列出 Vibe 2.0 的自定义子智能体、斜杠命令技能等具体能力与订阅入口,可据此判断终端编码智能体的工作流变化。

2025年12月18日星期四

OpenAI News

OpenAI 发了 GPT-5.2-Codex,但正文是空的

标题只确认了模型名叫 GPT-5.2-Codex,版本号 5.2。正文没披露任何细节——不知道价格、上下文长度、是否开放 API,也不清楚它跟旧版 Codex 是什么关系。等官方补全文档再判断。

推荐理由:这条消息就一个标题,正文是空的,所以我会先打个折——能确认的只有 OpenAI 发了个叫 GPT-5.2-Codex 的东西,版本号 5.2。没写定价、没写上下文长度、没写是取代旧 Codex 还是并行跑,也没写谁现在能用。真正该盯的是后续正文和 API 文档什么时候补上。但光这个名字就够让做代码 agent 和开发工具的人盯一眼,因为 OpenAI 在编程模型上再推新版,直接影响工具链选型和成本预期。

2025年12月9日星期二

Mistral AI

Mistral 发布 Devstral 2 编码模型与 Mistral Vibe CLI

Mistral AI 发布 Devstral 2 编码模型家族,含 123B 的 Devstral 2 与 24B 的 Devstral Small 2,分别采用修改版 MIT 和 Apache 2.0 许可,均为开源。

推荐理由:原文给出 Devstral 2 的 SWE-bench 成绩、开源许可与部署门槛,可据此判断开源编码模型的落地成本。

2025年10月6日星期一

OpenAI News

OpenAI 的 Codex 编程助手正式上线,新增 Slack 集成、SDK 和管理后台

OpenAI 在 10 月 6 日宣布 Codex 结束预览、进入正式可用阶段。这次主要加了三个东西:一是能在 Slack 频道里直接 @Codex 派活,像喊同事帮忙一样;二是放出了 Codex SDK,让你把驱动命令行版 Codex 的那个智能体嵌进自己的工具或流程里,官方说配合 GPT‑5‑Codex 模型不用额外调优就能用;三是给企业管理员上了...

推荐理由:OpenAI 把 Codex 从预览推到正式版,顺手加了 Slack 集成、SDK 和管理员控制,这比发个模型补丁重得多。我会先打个折:正文没披露云端任务的具体价格,这点先别太激动。但用量数据摆在那里,10 倍增长和 40 万亿 token 说明调用量是真金白银在跑。更值得盯的是内部数据——工程师全上、PR 合并效率提 70%,这是企业买单前最想看到的验证。整体看,这不是一次功能更新,是编码助手开始抢工作流入口和团队席位的明确动作。

2025年9月15日星期一

OpenAI News

OpenAI 把 GPT-5 调成了专门干活的编程助手 Codex,一个模型同时搞定聊天写码和长时间自主跑任务

OpenAI 发布了 GPT-5-Codex,并把它设为 Codex 云端任务和代码审查的默认模型。这个模型专门针对真实软件工程任务训练过,既能跟你快速交互式写代码,也能自己独立跑复杂任务,测试中最长连续干了超过 7 个小时。在 OpenAI 内部员工的使用数据里,对于 token 消耗最少的那 10% 的简单对话,GPT-5-Codex 比 GPT-...

推荐理由:OpenAI把GPT-5-Codex设为Codex云任务和代码审查的默认模型,给了几个硬数字:7小时自主执行、低端请求token省93.7%、高端请求耗时翻倍。这说明他们想把交互编程和长时代理执行揉在一起,但定价和完整可用性正文没披露,所以先别急着算账。

OpenAI News

OpenAI 发了份用户报告:ChatGPT 的性别差距快没了,低收入国家涨得最猛

OpenAI 和哈佛经济学家 David Deming 一起发了篇 NBER 工作论文,分析了 150 万条 ChatGPT 对话,是目前规模最大的消费者使用研究。先说谁在用:到 2025 年 7 月,可识别性别的用户里女性名字占比从 2024 年 1 月的 37% 涨到了 52%,性别差距基本抹平。低收入国家的用户增长速度是高收入国家的 4 倍多,不...

推荐理由:H、K、R 全中:150 万对话的用法拆解本身就是好钩子,49/40/11 的用法分法和 4 倍增速差是实打实的新信息,对关注 AI 落地和用户扩散的人有直接参考价值。停在 82 分是因为这是消费者使用研究,不是模型或产品变动,属于高信号背景信息而非当天必读。

OpenAI News

OpenAI 发了 GPT-5-Codex 的系统卡补充说明,专门给写代码的 agent 用

这个模型是 GPT-5 的一个变体,针对 Codex 里的 agent 编程场景做了优化。训练时用了强化学习,让它在真实编程任务里学会写出更贴近人类风格和 PR 偏好的代码,还能自己跑测试直到通过。现在可以在终端、IDE、网页、GitHub 和 ChatGPT 手机 App 里用。安全方面,模型层面做了防有害任务和防提示注入的训练,产品层面加了沙盒和可...

推荐理由:HKR 三项都踩实了:OpenAI 把代理式编程铺到多个入口,训练和安全措施有具体交代,而且正好打在行业最关心的执行边界上。基准分数、价格和上下文窗口正文都没写,所以分数没往上拉,停在 84。

2025年9月2日星期二

OpenAI News

OpenAI 收购实验平台 Statsig,创始人 Vijaye Raji 将出任应用部门 CTO

OpenAI 宣布要收购 Statsig,一家做 A/B 测试、功能开关和实时决策的实验平台。收购完成后,Statsig 的创始人 Vijaye Raji 会加入 OpenAI,担任应用部门的 CTO,向 Fidji Simo 汇报。他主要负责 ChatGPT 和 Codex 的产品工程,包括底层系统和内容安全。Raji 之前在 Meta 管过大规模消...

推荐理由:OpenAI 买下 Statsig 并让 Vijaye Raji 当 Applications CTO,管 ChatGPT 和 Codex 的工程,这步棋把产品实验能力和工程领导力一起收了。正文没披露收购金额和整合时间表,但汇报关系和独立运营的框架都交代清楚了,信息量够,值得写。

2025年8月7日星期四

OpenAI News

OpenAI 在 API 里放出了 GPT-5,分了三个尺寸,主打写代码和跑流程

OpenAI 8 月 7 号在 API 上线了 GPT-5,提供 gpt-5、gpt-5-mini 和 gpt-5-nano 三个尺寸,让开发者在性能、成本和延迟之间自己选。这次最核心的变化是 API 设计本身:新增了 verbosity 参数(低/中/高)控制回答长短,reasoning_effort 可以设成 minimal 跳过深度思考直接出结果...

推荐理由:这是 OpenAI 旗舰模型在 API 的正式发布,重要性拉满。钩子落在 GPT-5 上线这件事本身;知识增量靠具体基准分和新控制参数撑住;共鸣点全在开发者接口层面——工具调用、延迟调节、代码能力对比,都是工程师拿到新模型第一反应会问的问题。正文没给价格和完整可用性,这点先别太激动,但接口设计的变化比模型名本身更值得盯。

OpenAI News

OpenAI 发布 GPT-5,开始向付费团队推送

OpenAI 在 8 月 7 日推出了 GPT-5,官方说法是至今最聪明、最快、最有用的模型,把之前的 4o、o 系列推理、agent 和高等数学能力都整合到了一起。当天就开始向 Team 用户推送,企业和教育版下周跟上,API 也同步开放。文章给了两个硬数字:ChatGPT 企业付费用户 500 万,每周活跃用户接近 7 亿,说明铺量已经很大。但正文...

推荐理由:GPT-5 发布本身就是全行业事件,HKR 三项全中。文章给了上线节奏和 500 万商业付费用户这个数字,但基准跑分、价格、上下文长度全都没提,所以放在最高档的底部。

OpenAI News

OpenAI 发布 GPT-5:一个模型自动判断该快答还是慢想,全员可用

OpenAI 在 8 月 7 日上线了 GPT-5,所有 ChatGPT 用户都能用。这次最大的变化是把快速回答和深度推理合进了一个系统:内置一个路由器,根据问题类型、复杂度和用户意图实时决定用哪个模型。Plus 用户额度更高,Pro 用户能解锁 GPT-5 pro,那个版本推理链条更长,答案更细。官方说 GPT-5 在编程、写作、健康咨询上比前代强,...

推荐理由:OpenAI 发新旗舰模型本身就是顶格事件。这次不是单纯升级,而是把推理能力内置进系统,用路由器统一调度,所有 ChatGPT 用户都能用,Plus 和 Pro 再拉开配额。HKR 三项全中,缺价格、上下文窗口和 API 细节不影响 p1 判定。

2025年8月5日星期二

OpenAI News

OpenAI 开源了两个推理模型 gpt-oss-120b 和 gpt-oss-20b,用 Apache 2.0 协议

OpenAI 发了两个开源模型,一个 1200 亿参数,一个 200 亿参数,都是纯文本推理模型,能调“思考用力程度”,支持工具调用和结构化输出,可以直接放进让模型干活的业务流程里。模型权重用 Apache 2.0 协议开放,也兼容自家的 Responses API。正文没提上下文长度、价格和跑分。安全方面,OpenAI 说 1200 亿参数版本在生物...

推荐理由:这条当天就得写:H 来自 OpenAI 走开放权重路线,K 来自许可、机制和安全事实但缺关键指标,R 来自开源与闭源部署的争论。分数没给到 90 是因为正文没披露上下文长度、价格和完整基准结果,我会先打个折。

2025年7月30日星期三

Mistral AI

Mistral 发布 Codestral 25.08 与企业级编码栈

Mistral AI 发布 Codestral 25.08,并推出面向企业的完整编码栈,包含 Codestral、Codestral Embed、Devstral 与 Mistral Code IDE 插件。

推荐理由:原文给出 Codestral 25.08 的补全提升数据与整套企业级编码栈的部署方式,可据此判断私有化编码方案是否可行。

2025年7月17日星期四

OpenAI News

ChatGPT 现在能自己操作电脑帮你干活了,把搜资料、跑代码、做 PPT 合成一个 agent

OpenAI 在 7 月 17 日把 Operator 的网页操作能力和 deep research 的信息整合能力合进了一个 ChatGPT agent 里,Pro、Plus、Team 用户都能用。它相当于给 ChatGPT 配了一台虚拟电脑,自带浏览器、终端和 API 接口,能自己上网点来点去、筛选结果、跑代码分析数据,最后直接生成可编辑的幻灯片或...

推荐理由:OpenAI 把 Operator、deep research、终端和 API 访问揉成一个 agent mode,Pro、Plus、Team 用户都能用。我会先打个折:正文没披露定价、配额和基准结果,所以实际成本和效果还得等。真正值得盯的是权限设计——敏感操作要用户点头,用户可以随时接管浏览器或叫停任务,这比功能堆叠更关键。

2025年7月11日星期五

Mistral AI

Mistral 发布 Devstral Medium 并升级 Devstral Small 1.1

Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。

推荐理由:Mistral 与 All Hands AI 联合发布两款编码智能体模型,给出了 SWE-Bench Verified 分数和 API 定价,便于对比现有方案。

2025年6月4日星期三

Mistral AI

Mistral AI 发布企业级编码助手 Mistral Code

Mistral AI 发布企业级 AI 编码助手 Mistral Code,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium 四个模型,支持云端、专属容量或本地 GPU 气隙部署,代码保留在企业边界内。

推荐理由:官方给出企业级编码助手的模型组合、部署方式与客户案例,可据此判断私有化编码方案的落地路径。

2025年6月1日星期日

OpenAI News

OpenAI 封禁一批中国账号,用 ChatGPT 生成美国对立内容但几乎没人看

OpenAI 根据 Meta 的线索,封掉了一批来自中国的 ChatGPT 账号,内部代号叫“Uncle Spam”。这些账号主要干三件事:一是生成支持和反对关税的帖子,在 X 和 Bluesky 上同时发,故意挑动对立情绪;二是用 AI 生成“退伍军人”之类的假头像,冒充美国老兵批评现任政府;三是让模型写代码去扒 X 和 Bluesky 的用户资料,...

推荐理由:OpenAI 根据 Meta 的线索端掉了一批中国 ChatGPT 账号,代号“Uncle Spam”。文章把具体操作摊开了:用 AI 在 X 和 Bluesky 上同时发正反两种关税帖子,故意制造对立;生成“退伍军人”假头像冒充美国老兵骂现任政府;还让模型写代码去扒两个平台的用户资料。这些细节让事件从“又抓了一批号”变成了一个可拆解的操作案例。我会先打个折,因为这不是产品更新或模型发布,而是一次安全事件通报,所以分数落在值得推荐的区间里。

2025年5月28日星期三

2025年5月23日星期五

OpenAI News

OpenAI 把 Operator 的底层模型从 GPT-4o 换成了 o3,但 API 版本暂时不动

OpenAI 在 5 月 23 日发了份系统卡补充说明,核心就一件事:Operator 这个能替你操作网页的智能体,后台模型从 GPT-4o 升级到了 o3。API 那边还是用 4o,没换。o3 版 Operator 的安全策略和之前一样,多层防护,额外用了一批电脑操作的安全数据做了微调,主要是教模型什么时候该确认、什么时候该拒绝。它继承了 o3 写代...

推荐理由:这是一次有实质内容的 OpenAI 部署更新。H 来自 Operator 用 o3 而 API 仍用 4o 的分裂操作,K 来自明确的安全与能力边界说明,R 来自浏览器 agent 场景的直接相关性。没给更高分是因为这只是系统卡补编,正文没披露评测分数和误用数据,验证力度有限。

2025年5月21日星期三

Mistral AI

Mistral AI 发布智能体编码模型 Devstral,Apache 2.0 开源

Mistral AI 与 All Hands AI 合作发布面向软件工程任务的智能体 LLM Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上得分 46.8%,比此前开源 SOTA 模型高出 6 个百分点以上。

推荐理由:Mistral 与 All Hands AI 联合发布的智能体编码模型,给出了 SWE-Bench Verified 成绩与本地部署门槛。

OpenAI News

OpenAI 在 Responses API 里塞进了远程 MCP、生图、代码解释器和文件搜索

OpenAI 给 Responses API 加了一批新工具,最核心的是支持远程 MCP 服务器,让模型能直接连上 Shopify、Stripe、Twilio 这些外部服务干活。同时把 gpt-image-1 生图、Code Interpreter 和文件搜索也做成了内置工具,o3 和 o4-mini 现在能在思考链里直接调用这些工具,并且跨请求保留推...

推荐理由:OpenAI 把 Responses API 做成一个更完整的 agent 入口,远程 MCP、图像生成、Code Interpreter、文件搜索和推理中调工具全塞进去了。HKR 三项都踩中,但正文节选没披露完整定价和全部可用性细节,所以我会先打个折——重要性给 83、tier 放 featured 是合理的,别因为截图外的信息缺口把分拉太高。

2025年5月16日星期五

OpenAI News

OpenAI 为 o3 和 o4-mini 系统卡补了一份 Codex 说明

OpenAI 在 5 月 16 日给 o3 和 o4-mini 的系统卡打了个补丁,专门讲 Codex 这个云端编程助手。Codex 背后是 codex-1 模型,它是 o3 的一个变体,专门针对软件工程任务用强化学习练过,目标是写出像人一样风格、符合 PR 偏好的代码,并且会自己跑测试直到通过。每个 Codex 实例都在一个独立的云端容器里干活,容器...

推荐理由:这篇是系统卡补编,不是主产品发布,但信息密度不低。我会先打个折,因为安全文档通常偏保守,不过它把执行细节讲清楚了:独立云容器、用户自配开发环境、启动后断网、能跑测试和 lint。真正值得看的是可验证链路——Codex 会引用终端日志和文件,结果能直接导出成 GitHub PR 或本地 diff,这对审计和信任加分很大。正文没披露具体性能基准或成本数据,所以别急着对标其他编码代理。整体属于有料但不炸裂,featured 合理。

OpenAI News

OpenAI 发布云端编程代理 Codex,能并行处理多个开发任务

OpenAI 在 5 月 16 日推出了 Codex 的研究预览版,这是一个跑在云端的软件工程代理,底层是专门为编程优化过的 codex-1 模型(基于 o3)。你可以把它当成一个能同时干好几件事的远程开发助手:在 ChatGPT 侧边栏里给它派活,比如写新功能、修 bug、回答代码库的问题或者直接提 PR。每个任务都在独立的沙盒环境里跑,它会自己读代...

推荐理由:OpenAI 这次不是给代码补全加功能,而是直接扔出一个云端软件工程代理 Codex。它能在隔离沙箱里读写仓库、跑命令和测试,单个任务耗时 1 到 30 分钟,还会把终端日志和测试结果吐出来给你看——这点挺实在,不是光说“能写代码”就完了。首发给了 Pro、Business、Enterprise 用户,6 月 3 日才扩到 Plus,正文在价格和完整限制上截断了,所以我会先打个折:产品方向够硬,但商业细节没讲透,先给 88 分。

2025年4月14日星期一

OpenAI News

OpenAI 在 API 里发了 GPT-4.1 系列,代码和指令跟随提升明显,还多了个超便宜的 nano 版

OpenAI 在 4 月 14 号往 API 里塞了三个新模型:GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano。它们上下文窗口都拉到 100 万 token,知识截止到 2024 年 6 月。先说代码能力,GPT-4.1 在 SWE-bench Verified(一个让模型看代码库修 bug 的测试)上拿了 54.6%,比 GP...

推荐理由:OpenAI 这次发布不是刷榜,而是把 100 万 token 上下文、小模型价效比和明确的旧模型下线时间一起端出来。54.6% 的 SWE-bench 分数和 mini 成本降 83% 都是可复现的硬指标,nano 模型也第一次露面。对做 API 产品的人来说,这些数字直接决定要不要切模型、怎么控成本,所以 HKR 三项都成立。

2025年4月2日星期三

OpenAI News

OpenAI 发了个 PaperBench,专门考 AI 能不能复现顶会论文

OpenAI 搞了个新基准测试 PaperBench,让 AI 智能体从零复现 20 篇 ICML 2024 的 Spotlight 和 Oral 论文,包括读懂论文、搭代码、跑实验。每篇论文的复现任务被拆成可打分的小步骤,总共 8,316 个,评分标准是跟论文原作者一起定的。目前表现最好的选手——Claude 3.5 Sonnet(新版)加上开源脚手...

推荐理由:OpenAI 扔出一个硬核基准 PaperBench,拿 20 篇 ICML 2024 的 Spotlight 和 Oral 论文当考题,让 AI 智能体去复现研究过程。不是简单问答,而是拆成 8,316 个可评分的子任务,评分标准还是找论文原作者一起建的,这点挺扎实。目前表现最好的是 Claude 3.5 Sonnet 搭配开源脚手架,平均复现得分 21.0%,但人类博士基线还没被超过,说明离真正能搞研究的 AI 还有明显距离。代码已开源,想自己测的可以直接跑。