跳到正文

全部动态

今日 0 条

2024年12月9日星期一

OpenAI News

OpenAI 把 Sora 视频生成模型正式上线,推出更快的 Sora Turbo 版本

OpenAI 在 12 月 9 日结束了 Sora 的研究预览,直接把它做成了一个独立产品,给 ChatGPT Plus 和 Pro 用户用。新版本叫 Sora Turbo,生成速度比二月份展示的快了不少。Plus 用户每月能免费生成最多 50 个 480p 视频,或者少一些的 720p 视频;Pro 用户用量是 10 倍,还能出更高分辨率和更长的片子...

推荐理由:Sora 正式上线,从预览变付费,HKR 三项都踩中了:上线本身有话题性,规格和限制写得清楚,对创作者工作流有直接影响。没给更高分是因为文章自己就说了地区封锁、人物上传受限,物理一致性和长动作还不稳,这些限制让实际可用性打了折扣。

2024年12月5日星期四

OpenAI News

OpenAI 推出每月 200 美元的 ChatGPT Pro,把更长的思考时间做成付费功能

OpenAI 新加了一个 ChatGPT Pro 档位,月费 200 美元,可以无限用 o1、o1-mini、GPT-4o 和高级语音模式。核心卖点是 o1 pro 模式,它用更多算力让模型“想得更久”,去啃数据科学、编程和判例分析这类硬骨头。官方用了一个更严的 4/4 可靠性指标来强调稳定性——一道题必须连续四次都答对才算过关,但正文没披露这个模式的...

推荐理由:OpenAI 把额外推理算力包装成 200 美元的 ChatGPT Pro 层级,属于当天必须写的产品新闻。HKR 三项都成立:钩子是把推理时间商品化,知识面有具体价格和模型访问细节,共鸣点在于算力分层引发的行业讨论。正文未披露配额或延迟数据,所以保持现有评分。

OpenAI News

OpenAI 发布 o1 系统卡:用大规模强化学习训练模型先想再答,安全风险定在“中”以下才上线

OpenAI 把 o1 和 o1-mini 的安全测试结果公开了。核心就一句话:o1 系列用大规模强化学习训练模型在回答前先进行“思维链”推理,这让它在遵循安全规则、抵抗越狱攻击上比前代强。但正文没披露具体的数据配比和完整基准分。安全方面,他们设了上线门槛——风险缓解后评分必须“中”或更低。目前给出的评分是:网络安全低、生化威胁中、说服能力中、模型自主...

推荐理由:这是一份前沿推理模型的高信号安全披露,不是常规物料。HKR-K 强在公布了部署门槛、四项风险评级和测试范围;HKR-R 成立是因为从业者持续关注推理模型的安全阈值和 CoT 透明度。事实核查:系统卡原文确实列出了这些评级和门槛,未发现错误或过时信息,安全建议也符合当前实践。

2024年11月21日星期四

OpenAI News

OpenAI 公开两篇红队测试论文:一篇讲怎么请外部专家找茬,一篇讲怎么用 AI 自动找茬

OpenAI 在 2024 年 11 月 21 日发了两篇论文,把自家红队测试(就是找人来攻击模型、挖风险)的方法摊开来讲。第一篇白皮书专门说外部人类红队的流程,讲了三个具体设计选择:一是根据威胁模型挑人,比如要找懂网络安全、会小语种或熟悉某地区政治的人;二是给测试员看哪个版本的模型,没加安全措施的早期版本能测出新能力带来的风险,加了措施的版本能测防护...

推荐理由:我会先打个折:正文对自动化红队的实验指标和效果摘录不全,这点先别太激动。但 OpenAI 这次把外部红队怎么组队、怎么分配模型版本、怎么收反馈这三件事说清楚了,流程比“红队”这个词本身值钱。如果是真的按威胁建模来组队,安全团队可以直接抄作业。

2024年11月4日星期一

OpenAI News

OpenAI 给美国商务部 NTIA 的建言:一个 5GW 数据中心能拉动约 4 万个就业岗位

OpenAI 在 2024 年 11 月 4 日公开了它提交给美国国家电信和信息管理局(NTIA)的意见书,核心是在为 AI 基础设施抢政策。文章里算了一笔账:建一个 5GW 的数据中心,从施工到周边餐饮零售,能创造或支撑大概 4 万个工作岗位,给所在州贡献 170 亿到 200 亿美元的 GDP。OpenAI 还提到全球有 1750 亿美元的基础设施...

推荐理由:OpenAI向NTIA提交的政策意见,正文不涉及新模型参数或产品时间表,所以我会先打个折,不把它当产品信号看。但这份文件把AI基础设施的规模讲得很实在:一个5GW项目能拉动170亿到200亿美元州GDP、约4万个岗位,全球还有1750亿美元资金等着进场。对从业者来说,这些数字比模型跑分更贴近现实——算力供给、电力审批和场地安全,才是接下来卡不卡脖子的关键。

2024年10月31日星期四

OpenAI News

ChatGPT 现在能直接搜网页了,不用再跳去搜索引擎

OpenAI 在 2024 年 10 月 31 日给 ChatGPT 加上了搜索功能,Plus、Team 和之前排队的 SearchGPT 用户先用。它会根据你的问题自动判断要不要上网查,你也可以手动点搜索图标。回答里会附上来源链接,点一下侧边栏就能看到引用了哪些网页。背后的模型是微调过的 GPT-4o,训练时用了一种叫“蒸馏”的技术,从更强的 o1-...

推荐理由:这是 OpenAI 当天发的产品上线公告,不是小修小补。搜索直接嵌进聊天界面,等于把传统搜索引擎的流量入口挪到了对话里。公告确认了自动/手动搜索、可点击来源链接,还提到模型是 GPT-4o 微调版、用 o1-preview 蒸馏输出做后训练,信息量够。对从业者来说,这比单纯发个新模型更值得盯,因为它改的是用户获取信息的方式和流量分配逻辑,所以给到 P1。

2024年10月30日星期三

OpenAI News

OpenAI 开源了一个叫 SimpleQA 的事实性基准,专门测模型回答短问题的准确率

OpenAI 放出了一个包含 4326 道题的基准 SimpleQA,题目都是简短、有明确答案的事实类问题,比如“2022 年世界杯荷兰对阿根廷,哪位荷兰球员打进了运动战进球”。每道题都经过两名独立 AI 训练师交叉验证,又抽了 1000 道题做第三方审计,发现答案一致率 94.4%,估算数据集本身的固有错误率在 3% 左右。这个基准的目标是给前沿模型...

推荐理由:OpenAI 开源了一个事实问答基准 SimpleQA,4,326 道题,专门测模型回答短事实的准确率和校准能力。我会先打个折:它叫“简单”,但实际是给前沿模型挖坑,GPT-4o 得分不到 40%,说明越强的模型越容易在这上面翻车。数据质量方面,两道人工交叉核验,1,000 题抽检一致率 94.4%,估算固有错误率约 3%,这点先别太激动,3% 的错题率意味着有些题本身可能就有争议或歧义。整体看,这不是一篇例行公事的论文发布,而是一个直接打中可靠性、校准和基准信任问题的动作。

2024年10月24日星期四

OpenAI News

OpenAI 公布国家安全合作框架,明确禁止武器开发,但会帮美军做网络防御和行政提效

OpenAI 在 2024 年 10 月白宫发布 AI 国家安全备忘录后,公开了自己参与国家安全项目的边界。他们说自己有一套内部审核流程,由产品政策和国家安全团队把关,只接符合“民主价值观”的活。文章举了三个已有的例子:跟 DARPA 合作做网络防御、帮美国国际开发署用 ChatGPT 减轻行政杂活、以及在洛斯阿拉莫斯国家实验室搞生物科学研究。核心红线...

推荐理由:这篇不是产品发布,所以 H 分不高。真正有用的是 OpenAI 把内部评审流程摆出来了,还列了 3 个已经在跑的项目:跟 DARPA 做网络防御、帮 USAID 用 ChatGPT 减行政负担、跟洛斯阿拉莫斯国家实验室继续搞生物科学合作。同时明确画了红线——不准伤人、毁东西、造武器。我会先打个折,因为正文没披露模型版本、合同金额和实际效果数据,这些才是判断合作深度的硬指标。但光是把禁止用途和评审关卡公开写出来,在国防 AI 这个话题上就算有信息量了,所以 K 和 R 都给了通过。

2024年10月23日星期三

OpenAI News

OpenAI 把一致性模型简化并扩展到 15 亿参数,两步出图,质量追平扩散模型

OpenAI 发了个新方法叫 sCM,把连续时间一致性模型的训练搞稳定了,直接扩到 15 亿参数,在 512×512 的 ImageNet 上跑。它只用两步采样,出图质量就能跟现在最好的扩散模型打平,单张 A100 上 0.11 秒出一张图,比扩散模型快大约 50 倍。论文里对比了有效算力,sCM 花不到 10% 的算力就拿到差不多的 FID 分数。不...

推荐理由:这篇论文把连续时间一致性模型真正做大了,15 亿参数在 ImageNet 512×512 上跑通,两步采样就能拿到跟扩散模型差不多的样本质量,墙钟速度快了大约 50 倍。单张 A100、batch size=1、没做推理优化时 0.11 秒出一张图,这个数对实际部署有参考价值。我会先打个折:正文没披露跟其他快速采样方案(比如蒸馏模型)的直接对比,也没说训练用了多少算力,所以“快 50 倍”是跟谁比、代价多大,还得看后续细节。但能把快采样和大规模训练同时稳住,本身就是一个信号,说明这条路在工程上开始走得通了。

2024年10月22日星期二

OpenAI News

OpenAI 任命了首位首席经济学家,要研究 AI 到底怎么影响就业和经济增长

OpenAI 在 2024 年 10 月 22 日宣布,杜克大学教授 Ronnie Chatterji 将担任公司首位首席经济学家。这个职位不是发布新模型,而是专门研究 AI 对经济增长、就业和劳动力市场的长期影响,并想办法让技术红利扩散到更多人手里。Chatterji 之前在白宫负责协调 520 亿美元的芯片与科学法案,也当过美国商务部首席经济学家,...

推荐理由:我会先打个折:正文只说了 Ronnie Chatterji 是谁、干过什么,没说他上任后要做什么研究、怎么衡量 AI 的经济影响。但 OpenAI 专门设这个岗,说明他们想把经济影响从公关话题变成内部研究课题,这点值得盯。他之前管过 520 亿美元的芯片法案执行,政策接口经验是实的,不是挂名。

2024年10月15日星期二

OpenAI News

OpenAI 自查 ChatGPT 有没有看人下菜碟:用名字测偏见,整体翻车率约 0.1%

OpenAI 拿几百万条 ChatGPT 的真实对话做了次内部体检,想看看用户的名字会不会触发有害的刻板印象。他们让 GPT-4o 当“隐私保护评审员”去读聊天记录、找规律,研究员看不到原始对话。结果发现,ChatGPT 的回答质量不会因为名字暗示的性别或种族而变差,但确实有大约 0.1% 的情况,名字会引出有害偏见。在写故事这类开放任务里,出问题的概...

推荐理由:OpenAI 拿数百万条真实 ChatGPT 请求做了一次公平性审计,这种事很少见。我会先打个折:整体有害刻板印象发生率约 0.1%,看着很低,但研究也坦白种族相关判定的一致率不如性别高,这点先别太激动。真正该盯的是旧模型——GPT-3.5 Turbo 在分任务评测里偏差最明显,说明模型升级确实在压这个问题。研究用 GPT-4o 当隐私保护评审器,省了人工成本,但正文没披露评审器本身有没有系统性偏见。整体是一份有数据、有对比、有保留的工程报告,不是公关稿。

2024年10月10日星期四

OpenAI News

OpenAI 搞了个 MLE-bench,用 75 个 Kaggle 比赛来考 AI 的机器学习工程能力

OpenAI 从 Kaggle 挑了 75 个真实比赛做成基准测试,让 AI 智能体自己训练模型、处理数据、跑实验。最强的组合是 o1-preview 配上 AIDE 脚手架(一种帮模型自动迭代代码的工具),在 16.9% 的比赛里拿到了至少铜牌水平。这个成绩说明模型能独立完成一些 ML 工程任务,但离真正拿金牌还差得远。团队还研究了多给算力、多跑几次...

推荐理由:OpenAI 这次没让模型刷题,而是让它真刀真枪跑完 75 个 Kaggle 竞赛——从准备数据、训模型到交结果,整套 ML 工程流程都得自己来。最佳组合 o1-preview + AIDE 在 16.9% 的任务里摸到了铜牌线,说明能做一些,但离靠谱还差得远。我会先打个折:铜牌在 Kaggle 上不算难,正文也没披露具体是哪些任务、失败在哪类环节,所以别急着喊“替代 ML 工程师”。真正值得看的是它把评测从“会答题”扭到了“能干完整工程活”,而且代码开源,团队可以自己跑一遍看自家 agent 几斤几两。

2024年10月9日星期三

OpenAI News

OpenAI 说今年已端掉 20 多个滥用其模型的欺骗性网络

OpenAI 发了一篇安全更新,说从 2024 年初到现在,已经发现并掐断了超过 20 个试图用他们模型干坏事的行动和欺骗性网络。这些事主要跟选举干扰、社交媒体操纵以及有国家背景的团伙有关。文章把具体发现写进了 2024 年 10 月的一份威胁情报报告里,但正文没披露这 20 多个案例分别用了哪些模型,也没说具体是怎么发现和阻断的。我会先打个折,这更像...

推荐理由:OpenAI 这篇公告 HKR 三项都站得住:20 多次打击是个能让人点进来的数字,威胁情报报告更新到 10 月也算新事实,选举干扰和社媒操纵又是当下最烫手的安全话题。不过正文没给出具体样本分布、用了哪些模型、怎么处置的细节,所以分数停在 featured 不往上走。我会先打个折——没看到实操层面的干货,这点先别太激动。

2024年10月8日星期二

OpenAI News

OpenAI 与赫斯特达成内容合作,旗下 20+ 杂志和 40+ 报纸将进入 ChatGPT

OpenAI 在 2024 年 10 月 8 日宣布,跟美国老牌出版集团赫斯特(Hearst)签了内容授权协议。赫斯特会把《时尚先生》《时尚 COSMO》《ELLE》《跑者世界》《女性健康》等 20 多个杂志品牌和 40 多家报纸(包括《休斯顿纪事报》《旧金山纪事报》)的内容提供给 ChatGPT 这类产品。ChatGPT 目前每周有 2 亿用户,以后...

推荐理由:OpenAI 把 Hearst 旗下 20 多个杂志品牌和 40 多家报纸的内容接进 ChatGPT,正文顺带确认周活用户 2 亿。合作只覆盖杂志和报纸,不含 Hearst 其他业务,内容会带引用和原文链接。我会先打个折:出版商授权现在不算新鲜事,但这次规模摆在那,而且新闻内容进 AI 分发链的归属和引用问题一直没消停,所以值得放 featured。

2024年10月3日星期四

OpenAI News

OpenAI 给 ChatGPT 加了个叫 Canvas 的侧边栏,写东西和改代码不用再跟聊天框死磕了

OpenAI 在 10 月 3 号给 Plus 和 Team 用户推了个 Canvas 测试版,相当于在 ChatGPT 旁边开了个协作窗口,你可以直接在上面改文字或代码,模型也能像编辑一样给行内建议。它背后是 GPT-4o,专门训练过什么时候该自动弹出这个窗口:写作场景触发准确率到了 83%,编程场景 94%。模型还学会了做定点修改而不是每次都整篇重...

推荐理由:OpenAI 给 ChatGPT 加了个叫 canvas 的协作界面,写作和编程时能单独开一个窗口,选中某段文字直接改、能回退版本,还有调长度、修 bug、代码审查这些快捷操作。我会先打个折,这目前是测试版,只给 Plus 和 Team 用户用。但真正值得看的是他们怎么训的:内部 20 多项评测里,模型知道什么时候该自动弹出 canvas 的准确率写作 83%、编程 94%,定向编辑效果比之前好 18%,评论准确率高出 30%、质量高出 16%。这些数字说明他们不是拍脑袋加功能,而是用偏好数据专门教过模型什么时候该进协作模式、怎么改得更准。对做 A...

OpenAI News

OpenAI 拿到 40 亿美元银行授信,加上刚融的 66 亿,手里可动用资金超过 100 亿

OpenAI 在 2024 年 10 月 3 日宣布,从摩根大通、花旗、高盛等 9 家银行搞到了一个 40 亿美元的循环信贷额度。这笔钱目前还没动过,加上之前那轮 66 亿美元的融资,公司账上能随时调用的钱超过了 100 亿美元。说白了就是 OpenAI 给自己备了一大笔过冬或扩张的粮草,不是新产品发布。不过公告没提这笔贷款的利率、期限和抵押条件,所以...

推荐理由:OpenAI刚拿完66亿又搞了40亿的循环贷,账上可动用的钱超过100亿美元。我会先打个折:正文没写利率、期限和抵押条件,所以这更像一个资金实力的信号,而不是能细算成本的融资方案。对关注算力投入和现金流的人来说,这个弹药规模值得一看,但别急着下结论。

2024年10月2日星期三

OpenAI News

OpenAI 拿了 66 亿美元新融资,估值推到 1570 亿美元

OpenAI 宣布完成 66 亿美元融资,投后估值 1570 亿美元。钱会花在前沿 AI 研究、增加算力和继续做产品工具上。现在 ChatGPT 每周有超过 2.5 亿人在用。正文没披露具体投资人名单、持股条款,也没说算力具体会扩到多大规模。

推荐理由:OpenAI 官方发的融资公告,66 亿美元、1570 亿估值、2.5 亿周活用户,三个数摆出来就够了。我会先打个折:投资方是谁、股权怎么安排、算力具体扩多少,正文全没写,所以别急着脑补。真正值得盯的是钱又流向了算力,这条线比估值本身更说明问题。

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。

OpenAI News

OpenAI API 自动缓存重复的提示词前缀,费用直接打五折

OpenAI 给 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 的 API 加上了自动提示词缓存。只要你的请求里有一段超过 1024 个 token 的前缀最近被用过,系统就会自动命中缓存,这部分输入 token 的价格直接减半。缓存从 1024 token 起步,按 128 token 的粒度往上加。不过这个缓存不是...

推荐理由:OpenAI 这次没发新模型,但给 API 加了自动提示缓存,复用前缀就能省一半输入费用。我会先打个折:缓存不是永久的,空闲 5-10 分钟就可能被清,最长活不过 1 小时,所以别把它当长期存储。真正有用的地方是 cached_tokens 这个返回字段,能直接看命中率,团队可以据此优化公共前缀设计。对跑长上下文、固定系统提示或大批量推理的团队,这是近期最直接的成本优化手段,值得马上测一下自己的复用率。

OpenAI News

OpenAI 在 API 里上线了模型蒸馏,让你用大模型的回答去教小模型

OpenAI 10 月 1 号在自家 API 里推了一套模型蒸馏工具,核心思路是:先用 GPT-4o 或 o1-preview 这类大模型跑出结果,再用这些结果去微调 GPT-4o mini 这种便宜模型,让它在特定任务上接近大模型的表现,但成本更低。整套流程包括三个部分:Stored Completions 负责自动抓取和保存 API 的输入输出对,...

推荐理由:我会先打个折:这不是新模型发布,而是把模型蒸馏做成 API 内置流水线,附带自动存样本、评测和微调三个套件。正文说 store:true 抓取数据不额外增加延迟,这点先别太激动,实际体验要看并发量。免费 token 额度有截止日期,Evals 免费次数也绑定了与 OpenAI 共享评测的条件,省钱归省钱,但数据会留在对方那边。整体对想用大模型带小模型、又不想自建 infra 的团队挺实用,只是信息缺口在于蒸馏后的模型在具体任务上到底比直接微调强多少,正文没给对比数字。

2024年9月26日星期四

OpenAI News

OpenAI 把内容审核接口升级成多模态了,现在能同时看文字和图片

OpenAI 在 9 月 26 日上线了新的审核模型 omni-moderation-latest,基于 GPT-4o,所有开发者都能免费用。它最大的变化是能审图片了,覆盖暴力、自残、色情这 6 个子类,不过色情类里涉及未成年人的图片暂时还审不了。文字审核新增了“违法”和“违法/暴力”两个类别,比如“怎么偷东西”这种教人干坏事的提示词会被抓出来。多语言...

推荐理由:OpenAI 官方开发者产品更新,HKR 里 K 和 R 都站得住:新模型加了风险类别、图像子类,还给出 40 种语言平均提升 42% 的具体数字,多语言审核能力明显增强。R 也成立,因为审核和合规直接卡应用上线的脖子,免费开放意味着团队可以零成本试用。H 偏弱,就是个功能迭代,没什么戏剧性,所以整体放在 featured 的低位。

2024年9月16日星期一

OpenAI News

OpenAI 把安全委员会升级成独立监督机构,有权叫停模型发布

OpenAI 在 2024 年 9 月 16 日宣布,原先的安全与安保委员会将变成一个独立的董事会监督委员会,由卡内基梅隆大学的 Zico Kolter 当主席。这个委员会能审查重大模型的安全评估,如果觉得有风险,可以直接推迟发布,直到问题解决。公告里还提了几件事:刚完成了一个 90 天的安全流程审查;正在评估要不要搞一个 AI 行业的信息共享与分析中...

推荐理由:我会先打个折:没有新模型、没有外部审计结果、也没有可复现的基准数据,所以到不了 P1。但这条消息比泛泛的安全声明实在得多。OpenAI 把安全委员会升格成独立董事会监督委员会,由 Zico Kolter 当主席,能看重大安全评估,还能在问题没解决时叫停发布——这等于给发布流程加了一道硬闸门。正文还提到 90 天审查已完成、在评估行业 ISAC、跟洛斯阿拉莫斯国家实验室搞安全合作,信息密度不低。对从业者来说,这直接关系到模型发布的可预期性和安全问责,所以 HKR 三项都站得住。

2024年9月12日星期四

OpenAI News

OpenAI 发布 o1 系列模型,先想清楚再回答,数学推理从 13% 飙到 83%

OpenAI 在 9 月 12 日推出了 o1-preview 和 o1-mini 两个新模型,主打“先思考再回答”。在数学奥赛预选题上,GPT-4o 正确率只有 13%,o1 推理模型做到了 83%,编程能力也到了 Codeforces 前 11%。o1-mini 是个更小更快的版本,成本比 o1-preview 低 80%,适合写代码但不需要太广知...

推荐理由:这是一次 OpenAI 的重大推理模型发布,三个信号全中。H 来自“先想再答”的新玩法,K 来自具体的基准、安全和定价数字,R 来自从业者必须权衡的现实:推理能力上去了,但 API 基础功能还没跟上。

OpenAI News

OpenAI 发布 o1 预览版,靠增加思考时间把推理能力拉上去了

OpenAI 推出了新模型 o1-preview,主打推理能力。在 AIME 2024 数学竞赛题上,o1 单次答题正确率 74%,GPT-4o 只有 12%;如果让模型对同一道题算 64 次再投票,正确率能到 83%。编程竞赛 Codeforces 上 o1 排到前 11%,GPQA Diamond 博士级科学题正确率超过了人类专家。这些提升靠的是大...

推荐理由:这是一次有产品含义的实质性研究发布。钩子落在 o1 的推理线和大跨度的基准跃升上,知识性来自可验证的数字和推理扩展律的机制说明,相关性在于它直接冲击模型策略和推理经济学。信息密度高,没有公关腔,给 93 分合理。

OpenAI News

OpenAI 推出 o1-mini,一个专攻数理和编程、成本比 o1-preview 低 80% 的推理模型

o1-mini 是 OpenAI 在 2024 年 9 月 12 日发布的小号推理模型,先开放给 Tier 5 API 用户和付费 ChatGPT 用户。它最大的卖点是便宜:API 调用成本只有 o1-preview 的两成。性能上,它专攻 STEM 推理,在 AIME 数学竞赛里拿到 70.0% 的正确率(约 11/15 题,全美前 500 名水平)...

推荐理由:OpenAI 发了一个实打实的模型,不是概念稿,所以必须写。钩子在于便宜 80% 还能接近 o1 的推理分,数字够硬(AIME 70.0%、Codeforces 1650),而且它明确告诉你:STEM 行,非 STEM 只跟小模型差不多,开发者看完就知道该不该切过去。

2024年8月20日星期二

OpenAI News

OpenAI 和康泰纳仕合作,把 Vogue、纽约客等杂志内容接进 ChatGPT 和 SearchGPT

OpenAI 在 2024 年 8 月 20 日宣布与康泰纳仕(Condé Nast)达成合作,会把 Vogue、The New Yorker、GQ、Wired 等至少九个品牌的内容放进 ChatGPT 和还在测试的 SearchGPT 里。SearchGPT 会直接给出原文链接,让用户点进去看完整报道。公告里没提合作金额、授权范围、收入怎么分、以及具...

推荐理由:OpenAI 把 Vogue、The New Yorker、Wired 等 Condé Nast 旗下品牌的内容接进 ChatGPT 和 SearchGPT,搜索结果会带原文链接。对从业者来说,这验证了头部出版商在 AI 搜索里的分发位置,但合作细节全没披露——没写授权范围、没写钱怎么分、也没写哪些地区能用,所以我会先打个折,把它放在低分 featured 档。

OpenAI News

OpenAI 开放 GPT-4o 微调,训练费每百万 token 25 美元,9 月 23 日前每天送 100 万免费额度

OpenAI 把 GPT-4o 的微调权限开放给所有付费开发者了。训练价格是每百万 token 25 美元,用微调后的模型跑推理,输入每百万 token 3.75 美元,输出每百万 token 15 美元。到 9 月 23 日为止,每个组织每天能免费拿到 100 万训练 token。官方说,几十条样本就能让模型在特定任务上听话不少,比如调整回答风格、遵...

推荐理由:OpenAI 这次给 GPT-4o 开放微调,不是画饼,是直接上线了。我会先打个折:免费额度只到 9 月 23 号,每天 100 万 token,够你跑个小实验但别指望白嫖大项目。训练每百万 token 25 美元,推理输入 3.75、输出 15,价格不算低,但比从头训模型省事太多。真正值得盯的是两个外部团队的成绩——Cosine 在 SWE-bench Verified 上刷到 43.8%,Distyl 在 BIRD-SQL 上拿到 71.83%,说明微调后的 GPT-4o 在代码和 SQL 场景确实能打。正文没披露这两个微调具体用了多少数据、什...

2024年8月16日星期五

OpenAI News

OpenAI 封掉了一批用 ChatGPT 给伊朗隐蔽舆论战写稿的账号

OpenAI 在 2024 年 8 月 16 日说,他们发现并封禁了一批 ChatGPT 账号,这些账号属于一个叫 Storm-2035 的伊朗隐蔽舆论行动。这批账号用 ChatGPT 干两件事:一是写长文章,发在五个伪装成进步派或保守派新闻的网站上;二是生成英语和西班牙语的短评论,发在 X 和 Instagram 上。他们聊的主要是加沙冲突、以色列参...

推荐理由:钩子落在 OpenAI 主动曝光自家模型被用于隐蔽选举干预,够抓眼球。新知部分给了具体账号数、站点数和 Breakout Scale 2 级,说明操作规模小、传播效果差,这点先别太激动。风险关联上,模型滥用和选举安全是行业硬伤,但 OpenAI 自己说没看到有意义的受众触达,所以重要性停在 76 分,不往上拔。

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

2024年8月8日星期四

OpenAI News

OpenAI 把卡内基梅隆的机器学习系主任 Zico Kolter 拉进了董事会和安全委员会

OpenAI 在 2024 年 8 月 8 日宣布,卡内基梅隆大学教授 Zico Kolter 加入董事会,同时进入安全与安保委员会。Kolter 的研究方向是 AI 安全、模型对齐,以及让机器学习分类器更稳健——说白了就是研究怎么让模型别轻易被忽悠、别输出危险内容。他之前搞出过给深度学习模型加“硬约束”的方法,2023 年还带队开发了自动评估大模型安...

推荐理由:我会先打个折:这就是个任命通知,别当产品发布看。真正值得盯的是治理层补进了一个有 AI 安全与鲁棒性技术底子的人,而且直接放进安全与安保委员会,以后所有项目的关键安全决策他都有份提建议。正文没披露他具体投票权有多大、委员会多久开一次会,这点先别太激动。

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2024年8月6日星期二

OpenAI News

OpenAI 给 API 加了“结构化输出”,让模型按你给的 JSON 模板回话

OpenAI 在 2024 年 8 月 6 日上线了 Structured Outputs 功能,模型能严格按开发者提供的 JSON Schema 输出,不再只是生成合法 JSON 就完事。新模型 gpt-4o-2024-08-06 在复杂 schema 测试里拿了 100% 的准确率,而老模型 gpt-4-0613 不到 40%。用法上,在函数调用里...

推荐理由:我会先打个折,这不是新模型发布或公司级大事件,但把 JSON 模式从“输出合法 JSON”升级到“严格匹配你的 schema”,并且给出 100% 对不到 40% 的评测对比,对天天跟解析错误搏斗的开发者来说太解渴了。约束解码加模型训练这套组合拳,比旧版 JSON mode 靠谱得多,直接拉高了工具调用的下限。84 分给的是一个高价值的 API 能力更新,不是行业地震,但够实用。

2024年7月25日星期四

OpenAI News

OpenAI 发布 SearchGPT 原型,把实时搜索塞进聊天框里

OpenAI 在 7 月 25 号开始小范围测试 SearchGPT,一个临时上线的 AI 搜索原型。它直接用对话形式返回带实时信息的答案,每条信息都附有内联的出处标注,侧边栏还会列出更多来源链接,方便你点进去核实。这个原型目前只开放给一小部分用户和出版商试用,目的是收集反馈。官方明确说这只是个过渡产品,未来会把好用的功能整合进 ChatGPT 里。正...

推荐理由:我会先打个折:正文没披露模型名、规模、商用时间,所以没法往 90 以上打。但 OpenAI 拿一个带实时网页回答和出版商参与的独立搜索原型出来测试,当天就该写。它用文内引用和侧边栏来源链接解决了一部分可信度问题,连续追问也让搜索更像对话,这些点从业者会关心。不过别太激动,它只是个临时原型,最终要融进 ChatGPT,现在更像 OpenAI 在试探搜索边界和出版商关系。

2024年7月24日星期三

OpenAI News

OpenAI 用“规则打分”替代部分人工反馈,让模型在安全问题上更听话

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法:Rule-Based Rewards(RBRs),也就是用一套事先写好的规则给模型回复打分,而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝(简短道歉并明确说不)、软拒绝(带同理心地拒绝)和正常遵从——然后针对每类行为设定具体的评判标准,比如“回复是否在说...

推荐理由:我会先打个折:正文截取部分没给具体效果数字,也没对比基线,所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注,因为它解决的是工程上很实际的麻烦——政策一改,不用重新雇人标一堆数据,改规则就行。三种响应模式(硬拒、软拒、合规)让模型拒绝时不会太生硬,这点对产品体验有帮助。不过别太激动,论文没披露误拒率或漏判率,实际线上表现还得看后续有没有更细的评测。

2024年7月23日星期二

Hugging Face 博客

Llama 3.1 发布:405B、70B、8B 三个尺寸,主打多语言和长上下文

Meta 在 Hugging Face 上放出了 Llama 3.1,一共三个尺寸:8B、70B 和 405B。8B 适合在消费级显卡上跑,70B 给大规模 AI 应用,405B 主要用来做合成数据、让模型当裁判或者蒸馏小模型。每个尺寸都有基础版和指令微调版。这次还多了两个安全模型:Prompt Guard 是个小分类器,用来检测提示注入和越狱攻击;L...

推荐理由:Meta 的 Llama 3.1 是开源阵营的旗舰更新,标题已经把三个参数规模和两个关键能力点出来了。我会先打个折:正文没披露上下文窗口到底多长、支持哪些语种、许可是不是真开放可商用,也没给任何基准跑分,所以信息缺口不小。真正值得盯的是 405B 能不能免费用、长上下文推理实际要烧多少钱。这些没公布之前,分数先卡在 85-94 这个区间的低位。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

OpenAI News

OpenAI 给企业版 ChatGPT 加了合规 API 和自动管人工具

OpenAI 在 2024 年 7 月 18 日推出了企业合规 API,让公司能导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,主要给金融、医疗、法律这些强监管行业做审计和归档用。同时接入了 Forcepoint、Microsoft Purview、Netskope 等八家第三方合规厂商,方便做数据防泄漏和法务留存。用户管理方面,SCIM 自动...

推荐理由:OpenAI 给 ChatGPT Enterprise 加了合规 API、8 个第三方合规集成和 SCIM 用户管理,主要解决企业审计和账号管控的落地问题。我会先打个折:文章没展开“Expanded GPT controls”的具体细节,这部分只能先当占位。能确认的是,API 可以导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,对接了 Okta、Microsoft Entra ID、Google Workspace 和 Ping,对需要过合规审计的团队来说,省了自己拼积木的功夫。

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。

2024年6月13日星期四

OpenAI News

OpenAI 把退役陆军上将 Paul M. Nakasone 拉进董事会,主抓网络安全

OpenAI 宣布退役美国陆军上将 Paul M. Nakasone 加入董事会,并进入安全与安保委员会。Nakasone 是网络安全的老手,曾长期掌管美国网络司令部和国家安全局。公告说他的加入是为了应对 AI 越来越强后随之而来的高级网络威胁,比如保护训练超算、模型权重和用户数据。另外他也想帮 OpenAI 搞清楚怎么用 AI 帮医院、学校这类常被攻...

推荐理由:OpenAI 官方发文确认 Paul M. Nakasone 加入董事会,这件事的份量不在产品层面,而在治理和安全信号。我会先打个折:正文是空的,只给了标题,任命细节一概没提,所以没法判断是战略转向还是常规补位。但一个退役上将坐进 AI 公司的董事会,本身就够让行业多看两眼,尤其是那些做合规、出海或对接政府客户的人。这点先别太激动,等后续披露职责范围再说。