跳到正文

#编码

今日 0 条

昨天 · 9月29日星期二

OpenAI News

OpenAI 发布 GPT-6.1 Sol 模型

OpenAI 发布 GPT-6.1 Sol,定位为面向编码、计算机操作和专业工作的接近 Astra 级智能。其标准 API 输入与输出 token 价格为 Astra 的五分之一。

推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其面向编码与计算机操作的能力定位及定价变化。

9月22日星期二

OpenAI News

Parallel 用 GPT‑6 Astra 做研究,时间和成本各砍一半

AI agent 基础设施公司 Parallel 拿 GPT‑6 Astra 去查六个州六个月内的劳动力市场数据,结果时间和代码成本都降了 50%。原因是 Astra 搜索更精准、中间步骤更少,还能把子任务分给多个 agent 并行跑。正文没提对比的是哪个旧模型,所以 50% 这个数字先当参考,但如果是真的,对做长链研究任务的团队挺省钱。

9月18日星期五

GitHub Blog · AI & ML

GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,可组合使用;RAG 并未死亡,它为模型提供训练数据之外的相关信息,减少 token 浪费并让回答更有依据。

9月16日星期三

OpenAI News

数据分析平台 Hex 用 GPT-6 Astra 把复杂分析变成可视化报告

数据分析平台 Hex 接入了 OpenAI 的 GPT-6 Astra,让用户用自然语言问问题,模型直接生成交互式图表和仪表盘。Hex 联合创始人说,之前的模型做可视化一直很吃力,但 Astra 能操作底层绘图库、处理地理空间数据转换,输出既能用又好看的图表。它还多了一层“分析判断”——检查答案是否合理、是否回答了用户的问题、是否符合业务目标。正文没披...

9月14日星期一

OpenAI News

Perplexity 把 GPT-6 Astra 放进真实系统里干活,人工检查的频率低了很多

Perplexity 的联合创始人 Johnny Ho 说,GPT-6 Astra 现在能直接写对外沟通文案、改线上代码、盯着生产环境运行,这些事以前的模型做不来。他们让 Astra 自己写测试程序,模拟外部 API 返回的数据,跑通完整的业务流程。因为模型更稳了,团队不用像以前那样频繁盯着看。不过正文只给了定性的说法,没披露具体的性能指标或延迟数据,...

推荐理由:Perplexity 联合创始人的说法比普通客户案例实在,给出了 Astra 在生产环境的具体用法。但正文只有定性描述,没给性能指标或延迟数据,所以分数卡在 featured 门槛上。

9月12日星期六

OpenAI News

Cognition 把 GPT‑6 Astra 接进 Devin,让 AI 编程助手自己测自己写的代码

Cognition 把 GPT‑6 Astra 用在了 Devin 身上,让这个 AI 编程助手能自己跑测试、录屏并生成报告。文章举了个例子:Devin 用 Astra 去测一款叫 Otter Run 的 iPhone 游戏,最后返回了模拟器运行录像和一份测试清单,标明了哪些检查过了、哪些还没覆盖。团队还把客户发来的 bug 截图丢给 Devin,修完...

推荐理由:GPT‑6 Astra 被塞进 Devin 做自测,是一个落地的开发流程,不是概念视频。文章给了三个场景:录屏、出测试清单、修客户 bug,细节够用。分数没给到 85 以上,因为这是 OpenAI 的客户案例,不是独立评测,效果得打个折看。

9月11日星期五

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:使用 diff、终端与浏览器面板

GitHub Copilot 应用内置 diff、终端和浏览器三个面板,让用户无需离开应用即可审查、运行和预览 AI 智能体生成的代码变更。diff 面板以绿色和红色高亮显示代码的增删改,终端面板支持直接运行项目命令并可通过 Run 按钮配置脚本,浏览器面板则提供 Pick & Polish 工具来选取页面元素并让智能体调整。

OpenAI News

用 ChatGPT 和 Codex 扫描基因组找抗生素,候选分子筛选从几年缩到几小时

宾大团队用自研深度学习模型扫描现存和灭绝物种的基因组,找能对抗耐药菌的分子。传统方法找候选分子要几年,AI 把初筛压到几小时。ChatGPT 和 Codex 用来写代码、处理数据、跨学科沟通——比如生物背景的人用它写程序,程序员用它补生物知识。2021 年全球约 500 万人死于细菌耐药感染,预计 2050 年翻倍。但正文没披露找到了哪些具体分子、有没...

9月9日星期三

OpenAI News

OpenAI 发布 GPT-6 Astra:能直接操作 Excel 和 Figma,干活更快,成本更低

OpenAI 推出了 GPT-6 Astra,一个主打干复杂活儿的模型。它不用 API 就能直接操作你电脑上的日常软件,比如 Excel 和 Figma。在一个 Excel 建模比赛里,它的速度比人类冠军快了大约 4 倍。在 Terminal-Bench 4.0 这个测试智能体干终端杂活能力的基准上,Astra 得分 57.9%,超过了 GPT-5.6...

推荐理由:OpenAI 放出 GPT-6 Astra,主打直接操作电脑软件和复杂任务,速度碾压人类冠军,属于行业级震动。HKR 三项全中,分数接近天花板。正文没提定价和具体铺开范围,这是目前唯一的信息缺口。

OpenAI News

GPT-5.6 Sol 帮麻省理工研究生跑量子芯片校准,晚上睡觉时实验自己做完

OpenAI 发了一个案例:MIT 量子工程组的研究生 Beatriz Yankelevich 把 GPT-5.6 Sol 连到实验室软件上,让它自动给超导量子比特做校准测量。模型能自己跑标准流程——找频率、校准脉冲、测相干时间——信号干净时基本不用人管。但信号弱或噪声大时,还是需要研究员介入指导。现在这个组经常让 agent 在夜里跑实验,研究员早上...

9月8日星期二

OpenAI News

OpenAI CFO 发文:GPT-6 Astra 已来,消费者与企业业务互相喂养

OpenAI CFO Sarah Friar 发了一篇博客,核心是给 GPT-6 Astra 定调:这是目前最聪明、对齐做得最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日(agent-workday)的产出。最...

推荐理由:OpenAI CFO 发了一篇博客给 GPT-6 Astra 铺路,说这是目前最聪明、对齐最好的模型。文章没给技术细节,更像一份战略叙事。她提到 ChatGPT 周活用户超过 10 亿,付费企业客户 250 万,内部研究团队现在每 1 个人类工作日,就对应 3.1 个智能体工作日的产出。我会先打个折——这个 3.1 倍是内部自报,没第三方验证,但数字本身够猛,从业者会拿来当参照。文章没披露模型参数、训练成本或具体评测基准,所以这篇的价值不在技术,在于 OpenAI 怎么对外讲自己的故事。

9月4日星期五

GitHub Blog · AI & ML

GitHub Copilot 应用新手指南:如何同时运行多个智能体

GitHub Copilot 应用支持同时运行多个智能体会话,每个会话运行在独立的 Git worktree 上,互不干扰且各自保留上下文,可随时切换并从中断处继续。用户可在会话视图中查看各任务标题与进度,例如在同一项目上并行执行 funded sort 开发、无障碍审查和测试运行。

9月3日星期四

OpenAI News

Playco 用 GPT-6 Astra 做游戏原型,手动修复减少 50%

Playco 用 GPT-6 Astra 做了一个叫 Playbot 的 AI 游戏开发 IDE,直接连 Unity 和 Godot 引擎,让模型自己编辑场景、跑测试、找 bug。他们先搭了一个灰色方块原型,然后让模型一次性生成三个不同主题的游戏世界,大部分第一次跑就能玩。相比上一代模型,手动修复量砍了一半。空间推理、UI 响应和手感都有提升。模型还能...

8月31日星期一

OpenAI News

日本创业公司 Polimill 用 GPT 给 1050 个地方政府搭了套公共 AI 系统

日本创业公司 Polimill 基于 OpenAI 的 GPT 和 Codex 做了一个叫 QommonsAI 的政务平台,目前已有约 1050 个地方政府、55 万公务员在用。核心是把各市町村分散的会议记录、福利档案、法律文书等数据统一成可跨地区搜索的知识库,公务员查资料不用再翻几年旧档案。开发速度提升了 3-5 倍,主要靠 Codex 辅助写代码和...

8月25日星期二

Hugging Face 博客

Multiverse 搞了个“量化感知修复术”,让 4-bit 压缩模型跑赢了原版全精度模型

Multiverse Computing 提出了一种叫“量化感知修复(QAH)”的方法,专门用来抢救那些先被砍掉一半参数、再被压到 4-bit 的模型。他们拿 GPT-OSS 120B 开刀,先剪枝到 60B,再量化成 MXFP4,然后用 QAH 修复。结果这个 4-bit 的小模型在 9 项基准测试里有 7 项反超了 bfloat16 的原版,尤其在...

推荐理由:一个 4-bit 模型在多数测试里打赢了原版全精度模型,这个结果本身就够反常识。方法叫 QAH,专门修复先剪枝再量化的模型,拿 GPT-OSS 120B 砍到 60B 再压成 MXFP4 做验证,9 项基准赢了 7 项,数字很直观。我会先打个折:正文没披露修复阶段用了多少额外算力、数据,也没说剩下 2 项输了多少,复现条件不透明。所以重要性给到 78,够上 featured,但离必转还差一口气。

8月19日星期三

OpenAI News

Replit 推出免费模式,用 GPT-5.6 Luna 把写代码的 token 成本砍到零

Replit 上线了 Free Mode,底层跑的是 GPT-5.6 Luna,用户不用再盯着 token 消耗,可以直接在项目里规划、头脑风暴和探索想法。CEO Amjad Masad 说 OpenAI 最近的降价让面向百万用户的免费层终于跑得通。遇到复杂推理任务,系统会切到 GPT-5.6 Sol,处理完再回到 Luna,同时保留项目上下文。Sam...

推荐理由:Replit 免费层上线是个具体的产品更新,有明确的机制(双模型切换)和 CEO 对成本的原话,信息量够上 featured。但它本质上是 OpenAI 的客户故事,不是模型发布,所以分数停在 72 不往上拉。

8月18日星期二

OpenAI News

Asana 用 Codex 两周清掉了原本预计要五年的测试框架迁移工作

Asana 的工程师用 OpenAI Codex 把公司里一个叫 Enzyme 的过时测试框架从代码库里彻底移除了。之前内部评估这个活要干五年、花大概 600 万美元,实际只用了两个日历周,模型和基础设施成本加起来约 1.2 万美元。做法是写一段五句话的提示词,同时跑最多四个编码 agent,每个 agent 在独立的代码副本里干活,工程师每天检查两次...

推荐理由:Asana 用 Codex 把 Enzyme 这个过时测试框架从代码库里连根拔掉了。内部原本评估要干五年、花 600 万美元,实际两周搞定,模型和基础设施成本加起来 1.2 万。数字本身就够有说服力,不需要额外渲染。文章把做法讲清楚了,不是公关稿那种“我们拥抱 AI 新时代”的调调。扣分项:这是 OpenAI 官方案例,天然有宣传成分,但方法细节给得足,瑕不掩瑜。

8月6日星期四

OpenAI News

OpenAI 首次公布各国 ChatGPT 使用数据:工作上“动手干”是“开口问”的两倍多

OpenAI 在 8 月 6 日放出了覆盖超 10 亿用户的国别使用数据。最明显的变化是,人们在工作场景下用 ChatGPT 直接产出成果或完成任务(比如写代码、做分析)的概率,是工作之外的两倍多。多媒体是增长最快的用法,占到了全部消息的 7.8%,在巴西和哥伦比亚这个比例超过 10%。拉美、大洋洲和非洲的人均使用率正在追赶早期市场,第二季度排名上升最...

推荐理由:OpenAI 自己公布了覆盖超 10 亿用户的国别数据,最抓人的点是:工作场景下用 ChatGPT 直接产出成果的概率,是工作之外的两倍多。多媒体消息占比到了 7.8%,拉美、大洋洲和非洲的人均使用率在追赶早期市场。数据本身有料,但这是官方单方面发布,没经过外部核实,我会先打个折。对想了解全球使用趋势的从业者值得一看,但别当独立报告用。

7月31日星期五

OpenAI News

OpenAI 发了一篇战略说明,讲怎么靠降价、提效和全栈联动把“智能”做成大宗商品

OpenAI 在 7 月 31 号发了篇博客,没发新模型,核心是解释他们的“充裕智能”打法。逻辑很简单:模型越强越便宜,用的人就越多;用的人越多,赚的钱和拿到的反馈就越多,就能继续砸钱搞研发和基建。他们给了几个具体数字:GPT-5.6 Luna 的输入/输出价格砍了 80%,降到每百万 token 0.2 美元和 1.2 美元;Terra 降了 20%...

推荐理由:OpenAI 官方博客用具体定价数据(GPT-5.6 Luna 降价 80%)把“充裕智能”战略讲清楚了。不是产品发布,所以重要性到不了 85,但作为战略信号值得放在 featured 位置。

7月29日星期三

OpenAI News

OpenAI 给 10 万名学术研究者免费开放 GPT-5.6,先从数学和科学领域开始

OpenAI 搞了个“ChatGPT for Academic Researchers”项目,计划到 2027 年让 10 万名科研人员免费用上他们最强的模型,包括 GPT-5.6 Sol Pro 和 Codex。今年夏天先开放 1 万个名额,高等研究院和巴黎高师已经能用上了。每个参与者还能拉上最多四个同事一起用,默认不会拿你的数据去训练模型。除了给工...

推荐理由:OpenAI 直接给学术界发福利,计划到 2027 年覆盖 10 万人,今年夏天先放 1 万个名额。高等研究院和巴黎高师已经用上了,每个参与者还能拉四个同事组队白嫖,数据默认不用于训练。这不是模型能力升级,是分发策略的大动作,对科研圈吸引力很强,对商业定价也可能有间接压力。正文没提申请门槛和筛选标准,这点先别太激动。

7月27日星期一

OpenAI News

OpenAI 研究:近一半非通用类 ChatGPT 工作对话,是在干别人岗位的活

OpenAI 经济研究团队分析了 80 多万条美国用户的 ChatGPT 对话,发现一个他们称为“任务跨界”的现象:在工作相关的非通用类消息里,有 43.5% 的内容其实属于另一个职业的活儿。客服(77%)、设计(75%)和 HR(69%)这三类人“借用”其他岗位任务的比例最高。营销和工程类的任务跑得最远,经常出现在非本行人员的对话里。小公司里这种跨界...

推荐理由:OpenAI 自己拿 80 万条对话做分析,数据源可信,规模也够。43.5% 这个跨界比例是个新鲜信号,比常见的“AI 提升效率”叙事有记忆点。没给 85 分是因为这是份研究报告,不是产品发布或模型更新,冲击力相对分散。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

7月8日星期三

OpenAI News

OpenAI 审计 SWE-Bench Pro,发现约三成题目本身有毛病

OpenAI 对编程评测集 SWE-Bench Pro 做了一次质量审查,估计里面大约 30% 的题目是坏的。他们先用自动管线筛出 286 道可疑题目,再让基于 Codex 的调查 agent 和五位资深工程师分别复核。工程师最终标记出 249 道(34.1%)有缺陷的题目,主要毛病是测试太死板、题目描述漏要求、测试覆盖不足,以及题目描述误导模型。Op...

推荐理由:OpenAI 对 SWE-Bench Pro 做了一次质量审计,发现约 34% 的题目有缺陷,这个比例逼着行业重新审视编程评测的可靠性。文章给出了具体的缺陷分类和一套人机结合的复核流程,不是空喊评测有问题。没给更高分是因为这本质上是一份基准质量报告,不是模型能力突破或产品发布,但它的警示作用对从业者很实在。

6月25日星期四

OpenAI News

OpenAI 发经济研究论文,用内部数据说明 Codex 怎么改变工作方式

OpenAI 在 6 月 25 日发了一篇经济研究论文,拿自家和外部用户过去一年的使用数据,看 Codex 这类能独立干活的 AI 工具到底渗透到什么程度。到 2026 年 5 月,抽样的个人用户里 80.6% 至少跑过一次估计要花人 30 分钟以上的任务,25.6% 跑过超 8 小时的任务。OpenAI 内部更夸张,Codex 现在占了每周输出 to...

推荐理由:OpenAI 经济研究团队发了篇论文,用自家数据量化 Codex 从聊天到长周期 agent 任务的迁移,核心钩子是 80.6% 和 25.6% 的渗透率。但这是自产自销的宣传型研究,不是独立第三方,所以分数压在 85 以下。

6月22日星期一

OpenAI News

三星电子向全员部署 ChatGPT 和 Codex,OpenAI 称这是其最大规模企业交易之一

三星电子要把 ChatGPT 企业版和 Codex 推给韩国所有员工,以及全球 DX(设备体验)部门的员工,覆盖研发、制造、营销等业务线。OpenAI 说这是他们至今最大的企业部署之一。Codex 现在每周有超过 500 万活跃用户,在韩国的周活从 2026 年 2 月 1 日起涨了近 800%。正文没披露这笔交易的金额和具体上线时间表。我会先打个折:...

推荐理由:OpenAI 至今最大的企业部署之一,加上 Codex 在韩国周活暴涨 800% 这个硬数字,让这条消息有分量。但正文没写交易金额和具体上线时间表,信息缺口明显,所以停在 78 分,不给更高。

6月17日星期三

Hugging Face 博客

GLM-5.2 发布:第一个真正能用 100 万 token 上下文的开源模型,专啃长周期编程任务

Z.AI 开源了 GLM-5.2,一个为长周期编程任务设计的模型。它把上下文窗口做到了 100 万 token,而且不是光能塞进去,是在 agent 跑一长串操作后质量依然稳得住。架构上用了两个新东西:IndexShare 让每四层稀疏注意力共用一个索引器,在 100 万 token 长度下把每个 token 的计算量砍到了原来的约三分之一;MTP 投...

推荐理由:Z.AI 开源了 GLM-5.2,主打 100 万 token 上下文和长周期 agent 任务。架构上 IndexShare 和 MTP 投机解码都是新东西,不是换皮。不过正文没放完整 benchmark,我会先打个折,卡在 85 以下。

6月3日星期三

阿里技术 · 公众号

当 AI Agent 变成主力开发者,研发工具链得从头想想了

这篇文章我没能看到正文,微信页面显示环境异常需要验证。从已有的英文摘要看,作者许晓斌提出了一个判断:用 AI Agent 做开发,能把从“有想法”到“出代码”的周期从几周甚至几个月压缩到几分钟。他举了几个例子,包括用 Agent 搭周报系统、多角色 Agent 协同开发、自动配镜像仓库。文章还点出了现有研发设施跟 Agent 开发模式不匹配的地方,比如...

推荐理由:这篇文章不是产品发布或模型评测,而是一篇基础设施层面的评论。我会先打个折,因为案例都来自作者自己的实践,没有第三方验证,但“周/月级压到分钟级”这个说法配上具体场景,对从业者来说有参考价值。正文没披露多角色 agent 协作的成功率和翻车率,这点先别太激动。整体放在 featured 里合理,属于那种看完会让你重新打量自己团队流水线的东西。

6月1日星期一

OpenAI News

OpenAI 封掉一批用 ChatGPT 装美国人、发帖反对美国数据中心的中国账号

OpenAI 在 6 月威胁报告里披露,他们封掉了一批很可能来自中国的 ChatGPT 账号。这批人用简体中文写提示词,让 ChatGPT 生成英文帖子和图片,在 X 上假装成各种背景的普通美国人,反复说数据中心和 AI 把电费拉高了,成本最后都摊到老百姓头上。他们还用 ChatGPT 修图、写自动化脚本,并骚扰海外异见人士。更值得留意的是,他们上传的...

推荐理由:OpenAI 的官方威胁报告,不是第三方猜测,可信度先打个底。披露的这套玩法——简体中文提示词转英文内容、批量伪装账号、专挑电费这种民生痛点反复说——把 AI 怎么被武器化做舆论影响讲得很实,对从业者来说既是安全警示,也踩中了行业正在面对的公众质疑。信息量够,冲击力强,直接给 featured。

5月28日星期四

Mistral AI

Mistral 将 Le Chat 升级为统一智能体 Vibe,覆盖办公与编码

Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,一个许可同时覆盖办公与编码,原有对话、设置和套餐全部保留。Work Mode 支持企业知识搜索、结构化数据分析、文档报告生成、多步任务定时调度和可复用技能,可连接 Google Workspace、Outlook、SharePoint、Slack、GitHub 等。

推荐理由:原文完整披露了 Vibe 的工作模式、编码模式与 CLI 更新,可据此判断它如何接入现有工作流。

阿里技术 · 公众号

用两个 Git 仓库把周报、洞察和效能报表自动化,省掉 80% 的手工活

周志伟分享了一套项目管理方案:用两个 Git 仓库,配合 AI 编程助手、Shell 和 Python,把催周报、搬数据、画图表、出工程效能报告这些事自动化了。正文没披露具体实现细节和验证数据,但按他的说法,至少能省掉 80% 的手工跟进和报表工作。

推荐理由:我会先打个折:80% 这个数字正文没给验证方法,别当基准看。但思路本身很实在——用两个 Git 仓库当数据源,让 AI 编码助手加脚本去自动拉数据、出图表、拼周报,把项目经理从催收和搬运里解放出来。对 AI 从业者来说,这不是模型或平台发布,而是一个可抄作业的工作流改造,成本低、痛点准,所以给了 featured。

5月16日星期六

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash

Google DeepMind 发布 Gemini 3.5 模型家族,首款 Gemini 3.5 Flash 当日上线 Gemini 应用、Google Search AI Mode、Google Antigravity、Gemini API 及 Gemini Enterprise。

推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断它在长任务工作流中的定位。

5月15日星期五

阿里技术 · 公众号

阿里发布 Qoder 1.0,从 AI 写代码工具升级成能自己干活儿的开发工作台

阿里推出了 Qoder 1.0,支持 Windows、macOS 和 Linux。这次最大的变化是它不再只是一个帮你补全代码的编辑器,而是加了一个叫 Quest 的独立工作区,能让多个智能体同时跨项目跑任务。团队知识引擎可以把项目文档、代码库变成可检索的上下文,省得你反复解释。新增的 Experts 模式内置了规划、调研、写码、审查、测试五个角色,试图...

推荐理由:阿里把 Qoder 从写代码工具推到了让智能体自己干活的工作台,加了独立任务视窗、跨项目并行和团队知识库,听着像给开发团队配了几个能记住项目上下文的 AI 同事。正文没披露定价、跑分或任务成功率,所以实际省不省事、稳不稳定还不好说,先当一次有料的产品更新看。

5月13日星期三

OpenAI News

OpenAI 给 Windows 版 Codex 造了个沙箱,让编程助手能干活又不乱碰文件

Codex 是 OpenAI 的编程助手,能在开发者电脑上直接跑命令。Windows 版之前没有沙箱,用户要么得每条命令都点同意,要么就得开“完全访问”把安全交给运气。OpenAI 工程师 David Wiesen 写了篇文章讲他们怎么从零给 Windows 造沙箱。他们先看了 Windows 自带的几个方案:AppContainer 管得太死,编程助...

推荐理由:OpenAI 给 Windows 版 Codex 搭了个安全沙箱,主要管两件事:文件访问和网络连接。我会先打个折——正文没披露沙箱的技术方案,比如是容器还是虚拟化、权限粒度到哪一层,所以没法判断它到底有多硬。但这条消息对做 coding agent 的人很实际,因为文件系统和网络就是最容易出事的两个面。

5月7日星期四

OpenAI News

OpenAI 把 GPT-5.5 和 GPT-5.5-Cyber 的网络安全权限分级开放给已认证的防御方

OpenAI 把“可信网络访问”机制扩展到了 GPT-5.5 和 GPT-5.5-Cyber 上。简单说,就是给经过身份验证的安全从业者开绿灯,让他们能用更强的模型做防御类工作,比如漏洞分析、恶意软件排查、写检测规则,同时继续拦截攻击性操作。GPT-5.5 加上这个权限后,对大多数防御任务就够用了;GPT-5.5-Cyber 则更激进,只开放给做授权渗...

推荐理由:OpenAI 把可信网络访问从旧模型扩展到了 GPT-5.5 和 GPT-5.5-Cyber,只给验证过的防御者用,做漏洞研究和关键基础设施防护。我会先打个折:正文没披露怎么申请、要不要付费、模型在漏洞挖掘或攻防场景下的评测数据也没给,所以没法判断实际能力有多强。这点先别太激动,等有可复现的测试再下结论。

4月27日星期一

OpenAI News

OpenAI 开源了一套叫 Symphony 的规范,把项目管理看板变成 AI 编程 agent 的指挥中心

OpenAI 放出了 Symphony,一个开源的 agent 编排规范。它的核心思路是把 Linear 这类任务看板当成控制面板,每个待办任务都会自动分配一个编程 agent 去干活,人只负责最后审查结果。OpenAI 内部团队用上后,合并的 PR 数量三周内涨了五倍。工程师不用再同时盯着好几个 agent 会话,避免了频繁切换上下文的痛苦。agen...

推荐理由:H 和 R 都站得住:OpenAI 开源一个 Codex 编排规范,对 agent 工作流有直接关联,issue 变常驻 agent 的设想也够具体。K 这边我会先打个折,因为许可、接口、可复现的机制全都没披露,现在只能当个方向性信号看,别太激动。

4月23日星期四

OpenAI News

OpenAI 发布 GPT-5.5:干活更利索,写代码、查资料、跨软件操作都能自己跑通

OpenAI 推出了 GPT-5.5,主打让模型自己规划、调用工具、检查结果,去完成写代码、做研究、分析数据这类跨步骤的复杂任务。官方说它在 Terminal-Bench 2.0 这类命令行测试上准确率达到 82.7%,比上一代高,而且完成同样任务用的 token 更少,推理延迟跟 GPT-5.4 持平。正文没给具体的上下文窗口、定价和 API 开放时...

推荐理由:OpenAI 发新模型是当天新闻,点击和行业关联都拉满,所以 H 和 R 没悬念。K 不成立是因为这篇只确认了名字和大致用途,真正该盯的可复现参数一个都没披露,信息密度撑不起 p1,放在 featured 更合适。

4月22日星期三

OpenAI News

OpenAI 在 ChatGPT 里上线了团队版智能体,能自己跑流程、跨工具干活

OpenAI 给 ChatGPT 的企业版、教育版等付费计划加了一个叫“工作区智能体”的功能。你可以把它理解成能共享给整个团队用的自动化助手,背后由 Codex 驱动,在云端运行,人不在线它也能继续干活。它能跨多个工具(比如 Slack、CRM)执行多步骤任务,像自动筛选销售线索、写跟进邮件、每周五拉数据出报表、审核软件采购请求并生成 IT 工单。团队...

推荐理由:OpenAI 在 ChatGPT 里加了 workspace agents,等于把 Codex 塞进云端去跑跨工具的工作流,从纯聊天往团队自动化工作台又挪了一步。我会先打个折:正文没写价格、没列支持的工具、也没给延迟或成功率这些硬指标,所以重要性停在 86 分。H 打钩是因为从对话到 agent 的转变本身就有话题性;K 打钩是因为 Codex 驱动云端执行这个事实是新的,但信息缺口也明显;R 打钩是因为它直接踩在团队协作和自动化的关注点上,对做类似产品的团队会有压力。

4月17日星期五

腾讯技术工程 · 公众号

腾讯工程师用 Claude Code 跑通后台开发全流程,11 个环节在一个终端里搞定

这篇文章来自腾讯技术团队的一次实践复盘,他们用 Claude Code 搭配自定义的 Skills、Commands 和 MCP 服务器,把后台开发的 11 个步骤串成一个终端里的流水线。需求探索这一步花了 20 次工具调用、9.38 万 token、56 秒;执行阶段拆成 4 个任务,产出了 3 次代码提交。核心不是让 AI 直接写代码,而是把需求分...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是一篇来自一线的实践复盘。但它把 agentic engineering 从概念拉到了可复现的后台开发流程里,token 消耗、工具调用次数、人工卡点都给了具体数字,比市面上大多数“AI 写代码”的公关稿扎实。对正在琢磨怎么让模型进业务流程的从业者来说,这套终端内的编排思路和踩坑记录值得一看。

4月16日星期四

OpenAI News

OpenAI 发布 GPT-Rosalind:一个专为生物医药研究做的推理模型

OpenAI 在 2026 年 4 月 16 日推出了 GPT-Rosalind,一个专门面向生物学、药物发现和转化医学的前沿推理模型。它现在以研究预览版的形式在 ChatGPT、Codex 和 API 里对通过审核的客户开放。模型的核心卖点是能处理多步骤的科研流程,比如读文献、理解基因序列、设计实验和做数据分析,并且能调用超过 50 种科学工具和数据...

推荐理由:我会先打个折:正文没披露模型参数、价格和具体基准分数,所以别急着把它当成熟产品看。真正值得盯的是落地范围——OpenAI 把 Amgen、Moderna、Thermo Fisher 这些大药企拉进来做 research preview,说明他们想用真实业务场景验证模型,而不是发个论文就完事。Codex 里那个免费的生命科学插件能连 50 多个工具和数据源,对做生物信息学的人可能挺实用,但没给性能数据,这点先别太激动。整体看,这是 OpenAI 往垂直行业扎的一步,但信息缺口不小,暂时只能给 featured。

4月15日星期三

X · @claudeai

Claude Code 桌面版改版,一个窗口里能同时开好几个 Claude 会话干活

Anthropic 给 Claude Code 桌面版换了新界面,现在你可以在一个窗口里并排跑多个 Claude 会话,左边多了个侧边栏来管理这些会话。对写代码的人来说,这主要解决的是来回切窗口的打断问题——比如一边让 Claude 改后端,另一边让它写前端,不用再开好几个终端或 IDE 面板。正文没提具体推送时间、支持哪些平台,也没说多会话之间能不能...

推荐理由:Anthropic 官方发的产品更新,改动具体,直接关系到编码工作流里的上下文切换成本,所以 H、K、R 都成立。我会先打个折:没公布上线时间和平台覆盖,交互细节也缺,这让它的实际影响还看不全,所以分数压在 featured 门槛附近,不往上拔。