跳到正文

#OpenAI

今日 37 条

2025年2月3日星期一

OpenAI News

OpenAI 把深度调研做进了 ChatGPT:让它自己上网查几百个网页,5 到 30 分钟出一份带引用来源的报告

OpenAI 给 ChatGPT 加了一个叫“深度调研”的功能,不是简单的搜索总结,而是让模型自己上网分步干活。你丢一个复杂问题过去,它会花 5 到 30 分钟去翻几百个网页、图片和 PDF,边查边分析,最后生成一份带清晰引用出处的报告。背后跑的是专门为上网浏览和数据分析调过的 o3 模型,训练时就用到了浏览器和 Python 工具的真实任务。到 20...

推荐理由:这不是一次普通的搜索改版,而是把自主多步研究能力打包成产品接口。文章给出了具体的技术实现(o3 模型、浏览器和 Python 工具训练)和使用限制(不同套餐次数),信息密度高且可验证。对知识工作者来说,这个功能可能直接压缩现有工作流,所以值得当天就写。HKR 三项都成立:钩子强、干货足、对核心读者群有直接冲击。

2025年2月1日星期六

OpenAI News

OpenAI 封掉一批疑似中国账号,用 ChatGPT 写英文帖攻击蔡霞、写西语长文投放到拉美媒体批评美国

OpenAI 在 2025 年 2 月披露了一次代号“赞助不满”的行动:一批账号用 ChatGPT 生成内容,工作时间跟中国大陆作息一致。这些账号干了两件事——一是生成英文短评和图片,在 X 上冒充美国或印度用户攻击异议人士蔡霞;二是把中文文章翻译扩写成西班牙语长文,批评美国的社会分裂、政治暴力、毒品和移民等问题。这批西语文章出现在秘鲁、墨西哥、厄瓜多...

推荐理由:我会先打个折:这是 2025 年 2 月的旧闻重发,时效性扣分,不然能给到 82-84。但内容本身够硬——OpenAI 披露了一个代号“赞助不满”的行动,账号用 ChatGPT 干活,作息跟中国大陆一致,一边在 X 上冒充外籍用户攻击蔡霞,一边把中文文章扩写成西班牙语长文,专挑美国的社会分裂、毒品、移民问题骂。正文没披露那个真实公司具体是谁,但操作链条、语言转换路径和平台处置都交代清楚了,对从业者来说比泛泛的威胁报告有用得多。

OpenAI News

OpenAI 封掉了一个柬埔寨的团伙,他们用 ChatGPT 搞“杀猪盘”恋爱投资骗局

OpenAI 发现并封禁了一批来自柬埔寨的 ChatGPT 账号,这些人用模型来翻译和生成中日英文的诈骗对话,专门针对 40 岁以上、喜欢打高尔夫的中年男性下手。他们的套路很成熟:先在 Facebook、X 或 Instagram 上用偷来的网红美女照片公开搭讪,几天内就把人引到 LINE 或 WhatsApp 等私密聊天软件。OpenAI 还原了整个...

推荐理由:OpenAI 这份威胁情报还原了柬埔寨诈骗团伙怎么用 ChatGPT 批量生产中日英文的恋爱话术,专门钓 40 岁以上爱打高尔夫的中年男性。报告把从 Facebook 公开搭讪到拉进 LINE 私聊的完整路径都画出来了,实操细节多,不是泛泛而谈。我会先打个折,因为这是 2025 年 2 月的报告,时效性弱了点,而且本质是安全运营披露,不是模型能力或产品更新。但考虑到国内做反诈和出海社交产品的团队很需要这种一手案例来校准风控策略,还是值得推上首页。

OpenAI News

OpenAI 封禁一批中国关联账号,用 ChatGPT 写监控工具推销文案、分析文档和调试代码

OpenAI 在 2025 年 2 月披露,封掉了一组行为模式指向中国的 ChatGPT 账号,内部代号叫“同行评审”。这群人主要干三件事:一是把英文文档截图扔给模型做翻译和分析,部分内容涉及维吾尔人权抗议活动通告,但 OpenAI 说没法确认这些文件真假和来源;二是用模型生成一个叫“千阅境外舆情 AI 助手”的销售文案,声称这个工具能扒 X、Face...

推荐理由:这是一份来自 OpenAI 的官方威胁情报,有行动代号和对手战术,安全和政策交叉点上的料。但得打个折:内容是 2025 年 2 月的旧事重提,没有新进展,而且全是单方面叙述,正文没披露任何独立验证的信息。我会先把它当个值得追踪的信号,别急着下结论。

OpenAI News

OpenAI 封禁了一批用 AI 伪造求职材料、混进远程岗位的账号

OpenAI 在 2025 年 2 月的威胁报告里披露,他们封禁了几十个参与欺诈性求职活动的账号。这些账号用 OpenAI 的模型干了四件事:生成假简历和假求职档案、伪造推荐人身份帮忙做背景调查、在面试时实时生成技术题和行为题的答案,以及入职后继续用模型写代码、编借口(比如解释为什么不开摄像头、为什么从不正常地区登录)。整套操作和微软、谷歌之前曝光的朝...

推荐理由:OpenAI 自己的威胁情报报告详细说明了封禁账号的原因——一套完整的求职欺诈链条:假简历、实时面试作弊、入职后继续用模型掩盖身份。报告还关联了微软和谷歌之前曝光的类似活动,给出了具体的战术手法,不是空洞的安全通告。我会先打个折,因为正文没披露被封账号的具体数量、涉及的行业范围,也没说这些账号最终造成了多大实际损失,但作为一手情报,信息量已经足够让从业者警惕。

2025年1月31日星期五

OpenAI News

OpenAI 发布 o3-mini,一个更便宜、更快的推理模型,专攻数理化和编程

OpenAI 在 1 月 31 号把 o3-mini 放到了 ChatGPT 和 API 里,这是他们推理系列里目前成本最低的模型。它主打 STEM(科学、数学、编程),速度比 o1-mini 快,Plus 和 Team 用户的每日使用额度也从 50 条提到了 150 条。这个模型首次在小型推理模型上支持了函数调用、结构化输出和开发者消息,也支持流式传...

推荐理由:o3-mini 是 OpenAI 当天上线的新模型,属于必须写的级别。HKR 三项全中:发布动作本身就是钩子,有具体用量和对比数据,而且直接打中开发者关心的高性价比推理场景。我会先打个预防针——正文截断了,Codeforces 等完整跑分没全露出来,但现有信息已经够判断它的分量。

OpenAI News

OpenAI 发布 o3-mini 系统卡:整体风险定级为“中”,模型自主性首次达到“中”

OpenAI 给 o3-mini 的最终安全评分是“中”等风险,其中在生化核辐射、说服力和模型自主性这三项上都是“中”,网络安全是“低”。这是 OpenAI 第一个在“模型自主性”上拿到“中”的模型,主要因为它的编程和研究工程能力更强了。但别急着慌,系统卡里说它在“现实世界机器学习自我改进”的测试里表现还很差,没达到“高”风险的门槛。OpenAI 的规...

推荐理由:这是 OpenAI 官方的系统卡,不是日常宣传稿。我会先打个折:正文没给具体的基准分数,所以它算不上那种炸裂的模型发布。但它把 o3-mini 的部署后总体风险定在 Medium,模型自主性也首次到了 Medium,还明说了部署要求不高于 Medium、继续开发不高于 High——这些门槛本身比一个孤零零的分数更有看头。对从业者来说,知道模型现在踩在哪条线上,比单纯看跑分更实在。

2025年1月30日星期四

OpenAI News

OpenAI 把 o 系列推理模型部署到美国国家实验室的超算上,先给 1.5 万名科学家用

OpenAI 在 2025 年 1 月 30 日宣布跟美国国家实验室签了协议,把 o1 或另一款 o 系列模型部署在洛斯阿拉莫斯实验室的 Venado 超算上。这台超算用的是 NVIDIA 芯片,会作为共享资源开放给洛斯阿拉莫斯、劳伦斯利弗莫尔和桑迪亚三个国家实验室的大约 1.5 万名科学家。主要用在材料科学、可再生能源、天体物理、疾病防治、电网安全这...

推荐理由:我会先打个折:这不是新模型发布,也不是能力大跳跃,而是一次部署合作。但 OpenAI 把 o 系列模型送进洛斯阿拉莫斯、利弗莫尔、桑迪亚这三家核武相关实验室,还专门为核与 CBRN 用例设计了带安全许可研究员参与的审查流程,这个信号比普通商业合作重得多。标题和摘要里 1.5 万名科学家、Venado 超算这些数字让消息有肉,不是空泛的“战略合作”。所以 HKR 三项都站得住,重要性给 82、放在 featured 合理。

2025年1月28日星期二

OpenAI News

OpenAI 给美国政府做了个专用版 ChatGPT,叫 ChatGPT Gov

OpenAI 在 2025 年 1 月 28 日发布了 ChatGPT Gov,专门给美国联邦、州和地方机构用。这个版本可以部署在机构自己的微软 Azure 商业云或政府云上,让 IT 部门自己管安全、隐私和合规,比如满足 IL5、CJIS、ITAR 和 FedRAMP High 这类严格的安全框架。功能上跟企业版差不多:能用 GPT-4o 模型,支持...

推荐理由:这是一次包装和部署层面的发布,不是模型能力的大跳跃,但附带了实打实的采用数据。OpenAI把ChatGPT打包成符合美国政府安全要求的版本,跑在Azure政府云上,直接瞄准IL5、CJIS这类合规门槛。我会先打个折:正文没披露定价、具体哪些机构在用、以及实际部署后的性能或安全审计结果。但3500多家机构、9万用户、1800万条消息这些数字本身就有说服力,说明政府侧需求真实存在。所以给featured而不是p1,因为这不是前沿模型突破,而是产品化和渠道动作,但信息密度和信号强度都够。

2025年1月23日星期四

OpenAI News

OpenAI 发布 Operator 系统卡:一个能替你操作电脑的智能体,但高风险操作会强制让人确认

OpenAI 在 2025 年 1 月 23 日公开了 Operator 的安全评估报告。Operator 是一个能看懂屏幕截图、像人一样点击按钮和菜单的电脑操作智能体,底层结合了 GPT-4o 的视觉能力和强化学习训练出的推理纠错能力。它能帮你在浏览器里订菜、买票、填表,但也会引入新风险,比如被第三方网页里的恶意指令误导(提示注入攻击),或者自己操作...

推荐理由:这篇系统卡不是产品发布稿,而是安全说明书,但信息密度够高。我会先打个折:它只是 Operator 的配套文件,不是主产品公告,所以 featured 定位合理。真正值得看的是两件事:一是 OpenAI 把部署门槛定在缓解后 Medium 以下,这等于公开承诺了一个可验证的安全基线;二是高风险任务的处理很具体——金融交易、发邮件、删日程需要关键步骤确认,买卖股票直接封死。这些细节比泛泛的“安全第一”有用得多。说服力评 Medium 也值得留意,说明模型在影响人的决策上已经有一定能力,但还没到高危。整体事实清楚,没有发现错误或过时信息,对从业者判断 C...

OpenAI News

OpenAI 发布能直接操作电脑的智能体 CUA,先在美国给 Pro 用户用

OpenAI 在 2025 年 1 月 23 日放出了一个研究预览版智能体,叫 CUA(Computer-Using Agent)。它把 GPT-4o 的视觉能力和强化学习训出来的推理能力揉在一起,不看代码接口,直接像人一样看屏幕截图、用虚拟鼠标键盘来操作图形界面。在 OSWorld 这类模拟真实电脑操作的测试里,它拿了 38.1% 的成功率,比之前最...

推荐理由:OpenAI 当天发布的 agent 产品,CUA 模型驱动 Operator,先推给美国 ChatGPT Pro 用户。HKR 三项全中:GUI 操控这个切入点本身就够新,文章给了机制和具体跑分,而且它把“自主干活 vs 人盯着”这个行业纠结的点直接拎了出来。

OpenAI News

OpenAI 发布 Operator:一个能自己打开浏览器帮你干活的研究预览版

Operator 是一个能自己操控浏览器的 AI 代理,可以看网页、点击、打字、滚动,帮你填表、买菜、做 meme。它背后是一个叫 CUA 的新模型,把 GPT-4o 的视觉能力和强化学习推理结合起来,直接操作屏幕上的按钮和菜单,不需要对方网站提供 API。遇到登录、付款、验证码,它会主动把控制权交还给你,不会偷看或截图这些敏感信息。目前只开放给美国 ...

推荐理由:OpenAI 的 Operator 是当天必写的产品发布:一个浏览器 agent 让 ChatGPT 从动嘴变成动手。HKR 三项全中——钩子强、有技术框架但缺基准分、踩中 agent 核心趋势。我会先打个折:正文没披露具体 benchmark 分数,而且目前只限美国 Pro 用户,登录、支付和验证码还得人接手,这些限制让它的实际可用范围打了问号。

2025年1月22日星期三

OpenAI News

OpenAI 发现:让 o1 系列模型多想一会儿,对抗攻击成功率会大幅下降

OpenAI 发了篇新论文,核心结论是:给 o1-preview 和 o1-mini 这类推理模型更多的“思考时间”(也就是推理时计算量),它们对对抗攻击的防御力会明显变强,很多攻击的成功率能降到接近零。他们测了数学题、SimpleQA 的提示注入、Attack Bard 的对抗图片,还有 StrongREJECT 的越狱提示词。结果发现,攻击者投入的...

推荐理由:我会先打个折:OpenAI 自己在标题里写了“初步证据”,正文也没完整披露哪些情况下防御会失效,所以别当成熟方案看。但这条思路确实值得盯——不靠对抗训练,而是让模型多想一会儿来扛住没见过的攻击,在数学题、提示注入、滥用提示这几类测试里都看到了攻击成功率大幅下降。如果后续能确认成本和失效边界,对安全部署会是个挺省钱的方向。

2025年1月21日星期二

OpenAI News

OpenAI 拉上软银、甲骨文成立 Stargate,四年要砸 5000 亿美元建 AI 算力

OpenAI、软银、甲骨文和 MGX 联合成立了一家叫 Stargate 的新公司,计划未来四年在美国投 5000 亿美元建 AI 基础设施,首批 1000 亿美元已经启动。软银管钱,OpenAI 管运营,孙正义当董事长。目前得克萨斯州已经开始动工,Arm、微软、英伟达和甲骨文是首批技术合作方。这笔钱主要用来给 OpenAI 铺算力,OpenAI 也会...

推荐理由:这条远超常规合作公告。5000 亿四年、首批 1000 亿马上砸下去,OpenAI 把自己绑在了一个天文数字的基建计划上。HKR 全中:数字够吓人,分工和进度有实料,而且直接踩在算力控制权和资本集中的神经上。我会打 95 分,p1 没毛病。

2025年1月15日星期三

OpenAI News

OpenAI 和 Axios 达成内容合作,还出钱帮它在美国四个城市扩张本地新闻

OpenAI 宣布跟 Axios 签了内容合作协议,同时提供资金,帮 Axios 把本地新闻业务开到匹兹堡、堪萨斯城、博尔德和亨茨维尔这四个新城市。OpenAI 说现在合作的媒体机构接近 20 家,覆盖 160 多个新闻出口、几百个内容品牌和 20 多种语言。ChatGPT 的搜索功能会展示合作方的摘要、节选、出处和原文链接。正文没披露这次合作的具体金...

推荐理由:OpenAI和Axios的合作本身不算大新闻,但公告里透出的规模数字和Search展示方式挺实在。我会先打个折,因为资助金额和技术条款都没说,没法判断Axios到底拿了多少好处、模型具体怎么用他们的内容。不过对做AI应用和媒体的人来说,这相当于看到了一张更清晰的“AI搜索引用地图”:160多家机构、20多种语言,意味着引用和流量分配的模式在快速定型。这点值得留意,哪怕公告本身有点PR味。

2025年1月14日星期二

OpenAI News

OpenAI 董事会新添一位基础设施投资大佬 Adebayo Ogunlesi

OpenAI 在 2025 年 1 月 14 日宣布,全球基础设施合伙公司(GIP)的创始合伙人兼 CEO、贝莱德高级董事总经理 Adebayo Ogunlesi 加入其董事会。公告说,他带来的主要是基础设施投资、公司金融和全球市场策略方面的经验,目的是帮 OpenAI 在迈向通用人工智能(AGI)的过程中,更好地搞定大规模 AI 基础设施的转型和投资...

推荐理由:这条任命本身值得关注,因为 OpenAI 的董事会席位从来不只是挂名。Adebayo Ogunlesi 的背景是基础设施投资和全球市场,OpenAI 也明说需要这方面的经验,说明他们在为大规模算力和资本铺路。但公告本身信息量有限,只列了履历,没提他具体管什么、任期多长、会不会进某个委员会,所以只能算重要但不够扎实的人事消息。

2025年1月13日星期一

OpenAI News

OpenAI 发布经济蓝图,核心是呼吁美国搞全国统一的 AI 规则,别让各州各管各的

OpenAI 在 2025 年 1 月 13 日发了份政策文件,不是讲新产品,而是给美国政府提要求。他们认为 AI 的竞争关键是芯片、数据、能源和人才,并提到全球有 1750 亿美元在找 AI 项目投,美国不接住就会流向中国。文件最核心的主张是反对各州自己立法,要求搞一套全国通行的规则,理由是碎片化监管会拖慢创新。他们计划 1 月 30 日在华盛顿搞活...

推荐理由:OpenAI 发了份政策蓝图,不是产品更新,所以别当技术新闻看。我会先打个折:钩子不强,但信息量够。1750 亿美元这个数挺实在,说明资本端已经准备好了,就差政策松绑。他们反对州级碎片化监管,主张联邦统一规则,这对做美国市场的团队是个明确的信号。2 月 20 日的更新只是补了劳动力提案,没改核心主张。整体上,这份材料对关注合规、基建和人才策略的人有用,但对纯技术岗参考有限。

2024年12月27日星期五

OpenAI News

OpenAI 说非营利架构撑不住了,得改公司结构才能继续搞 AGI

OpenAI 董事会正在评估调整公司结构,核心原因是钱不够烧了。他们 2019 年预估搞 AGI 大概要 100 亿美元,现在发现大厂们都在砸几千亿,自己靠捐赠和非营利控股的混合模式根本融不到这个量级的钱。文章说,投资人愿意投,但到了这种资金规模,人家要的是常规股权,不是定制化的利润上限条款。目前 ChatGPT 每周有超过 3 亿人用,但正文没披露最...

推荐理由:OpenAI 自己出来说,2019 年以为融 100 亿美元就够,现在发现不够,得把架构改得更像普通公司,不然投资人不敢继续砸钱。文章没给新架构的具体条款,但把融资约束摊开了——这是核心。我会提醒读者盯紧两点:一是非营利那块最后还剩多少控制权,二是股权结构会怎么调。整体事实没硬伤,安全上也没问题,就是信息不全,但作为信号已经够用了。

2024年12月20日星期五

OpenAI News

OpenAI 公布 deliberative alignment:让模型先读安全规范再推理,o1 在安全基准上超过 GPT-4o

OpenAI 在 12 月 20 日介绍了 deliberative alignment,一种直接让推理模型学习人类写的安全规范文本,并在回答前先对着规范做推理的训练方法。o 系列模型用上了这套方法,推理时会在思维链里调取内部政策、判断请求是否违规,再给出回复。整个过程不需要人工标注思维链或答案。文章说 o1 在内部和外部安全基准上大幅超过 GPT-4...

推荐理由:我会先打个折:正文没给 o1 的具体基准分数,只说比 GPT-4o 强很多、部分数据集接近饱和,所以没法判断实际提升幅度。但方法本身有嚼头——用人类能看懂的安全规范训练模型在回答前显式推理,而且不需要人工写思维链样本,省了不少标注成本。安全对齐从“事后拦截”变成“事前想清楚”,这个转向值得关注。综合看,放在 featured 没问题,83 分也合理,毕竟缺了硬数据,离必写还差一口气。

2024年12月17日星期二

OpenAI News

OpenAI 把 o1 模型放进 API 了,还顺手给实时语音接口降了价

OpenAI 这次主要给开发者端上了几道新菜。首先是 o1 模型正式在 API 里上线,先推给用量最高的第五级开发者。相比之前的预览版,o1 现在能调用外部函数、按你给的 JSON 格式稳定输出、看懂图片,还多了一个叫 reasoning_effort 的参数让你控制它思考多久。官方说它平均比预览版少用 60% 的思考 token,等于更快更省钱。跑分...

推荐理由:这条更新对开发者来说信息量很扎实。o1 补上了之前缺失的生产特性,不再是只能看不能用的状态;推理 token 用量大降和音频价格大砍都是实打实的成本改善。后半段 GPT-4o mini 实时价格被截断,但已披露的部分没有事实错误或过时信息,也没有不安全或误导性的建议。整体判断:事实准确、当前有效、对从业者安全。

2024年12月13日星期五

OpenAI News

OpenAI 公开邮件时间线:马斯克 2017 年就想要一个营利公司,而且要绝对控制权

OpenAI 在 2024 年 12 月 13 日发了一篇博文,直接贴出邮件记录和时间线,回应马斯克的法律诉讼。核心事实是:2017 年马斯克不仅同意 OpenAI 转成营利性公司,还自己注册了一家叫“Open Artificial Intelligence Technologies, Inc.”的公益公司,要求拿到多数股权、绝对控制权和 CEO 位置...

推荐理由:这篇 OpenAI 单方面发布的博文,核心价值在于提供了马斯克当年推动营利化、索要控制权的具体证据,以及团队对 AGI 算力成本的早期估算(数十亿到可能低于 100 亿美元)。这些事实性内容本身没有发现错误或过时之处,也没有给出危险的操作建议。它本质上是一份法律公关叙事,不是独立验证的产品或研究发布,所以保持原有评分是合理的。

2024年12月9日星期一

OpenAI News

OpenAI 把 Sora 视频生成模型正式上线,推出更快的 Sora Turbo 版本

OpenAI 在 12 月 9 日结束了 Sora 的研究预览,直接把它做成了一个独立产品,给 ChatGPT Plus 和 Pro 用户用。新版本叫 Sora Turbo,生成速度比二月份展示的快了不少。Plus 用户每月能免费生成最多 50 个 480p 视频,或者少一些的 720p 视频;Pro 用户用量是 10 倍,还能出更高分辨率和更长的片子...

推荐理由:Sora 正式上线,从预览变付费,HKR 三项都踩中了:上线本身有话题性,规格和限制写得清楚,对创作者工作流有直接影响。没给更高分是因为文章自己就说了地区封锁、人物上传受限,物理一致性和长动作还不稳,这些限制让实际可用性打了折扣。

2024年12月5日星期四

OpenAI News

OpenAI 推出每月 200 美元的 ChatGPT Pro,把更长的思考时间做成付费功能

OpenAI 新加了一个 ChatGPT Pro 档位,月费 200 美元,可以无限用 o1、o1-mini、GPT-4o 和高级语音模式。核心卖点是 o1 pro 模式,它用更多算力让模型“想得更久”,去啃数据科学、编程和判例分析这类硬骨头。官方用了一个更严的 4/4 可靠性指标来强调稳定性——一道题必须连续四次都答对才算过关,但正文没披露这个模式的...

推荐理由:OpenAI 把额外推理算力包装成 200 美元的 ChatGPT Pro 层级,属于当天必须写的产品新闻。HKR 三项都成立:钩子是把推理时间商品化,知识面有具体价格和模型访问细节,共鸣点在于算力分层引发的行业讨论。正文未披露配额或延迟数据,所以保持现有评分。

OpenAI News

OpenAI 发布 o1 系统卡:用大规模强化学习训练模型先想再答,安全风险定在“中”以下才上线

OpenAI 把 o1 和 o1-mini 的安全测试结果公开了。核心就一句话:o1 系列用大规模强化学习训练模型在回答前先进行“思维链”推理,这让它在遵循安全规则、抵抗越狱攻击上比前代强。但正文没披露具体的数据配比和完整基准分。安全方面,他们设了上线门槛——风险缓解后评分必须“中”或更低。目前给出的评分是:网络安全低、生化威胁中、说服能力中、模型自主...

推荐理由:这是一份前沿推理模型的高信号安全披露,不是常规物料。HKR-K 强在公布了部署门槛、四项风险评级和测试范围;HKR-R 成立是因为从业者持续关注推理模型的安全阈值和 CoT 透明度。事实核查:系统卡原文确实列出了这些评级和门槛,未发现错误或过时信息,安全建议也符合当前实践。

2024年11月21日星期四

OpenAI News

OpenAI 公开两篇红队测试论文:一篇讲怎么请外部专家找茬,一篇讲怎么用 AI 自动找茬

OpenAI 在 2024 年 11 月 21 日发了两篇论文,把自家红队测试(就是找人来攻击模型、挖风险)的方法摊开来讲。第一篇白皮书专门说外部人类红队的流程,讲了三个具体设计选择:一是根据威胁模型挑人,比如要找懂网络安全、会小语种或熟悉某地区政治的人;二是给测试员看哪个版本的模型,没加安全措施的早期版本能测出新能力带来的风险,加了措施的版本能测防护...

推荐理由:我会先打个折:正文对自动化红队的实验指标和效果摘录不全,这点先别太激动。但 OpenAI 这次把外部红队怎么组队、怎么分配模型版本、怎么收反馈这三件事说清楚了,流程比“红队”这个词本身值钱。如果是真的按威胁建模来组队,安全团队可以直接抄作业。

2024年11月4日星期一

OpenAI News

OpenAI 给美国商务部 NTIA 的建言:一个 5GW 数据中心能拉动约 4 万个就业岗位

OpenAI 在 2024 年 11 月 4 日公开了它提交给美国国家电信和信息管理局(NTIA)的意见书,核心是在为 AI 基础设施抢政策。文章里算了一笔账:建一个 5GW 的数据中心,从施工到周边餐饮零售,能创造或支撑大概 4 万个工作岗位,给所在州贡献 170 亿到 200 亿美元的 GDP。OpenAI 还提到全球有 1750 亿美元的基础设施...

推荐理由:OpenAI向NTIA提交的政策意见,正文不涉及新模型参数或产品时间表,所以我会先打个折,不把它当产品信号看。但这份文件把AI基础设施的规模讲得很实在:一个5GW项目能拉动170亿到200亿美元州GDP、约4万个岗位,全球还有1750亿美元资金等着进场。对从业者来说,这些数字比模型跑分更贴近现实——算力供给、电力审批和场地安全,才是接下来卡不卡脖子的关键。

2024年10月31日星期四

OpenAI News

ChatGPT 现在能直接搜网页了,不用再跳去搜索引擎

OpenAI 在 2024 年 10 月 31 日给 ChatGPT 加上了搜索功能,Plus、Team 和之前排队的 SearchGPT 用户先用。它会根据你的问题自动判断要不要上网查,你也可以手动点搜索图标。回答里会附上来源链接,点一下侧边栏就能看到引用了哪些网页。背后的模型是微调过的 GPT-4o,训练时用了一种叫“蒸馏”的技术,从更强的 o1-...

推荐理由:这是 OpenAI 当天发的产品上线公告,不是小修小补。搜索直接嵌进聊天界面,等于把传统搜索引擎的流量入口挪到了对话里。公告确认了自动/手动搜索、可点击来源链接,还提到模型是 GPT-4o 微调版、用 o1-preview 蒸馏输出做后训练,信息量够。对从业者来说,这比单纯发个新模型更值得盯,因为它改的是用户获取信息的方式和流量分配逻辑,所以给到 P1。

2024年10月30日星期三

OpenAI News

OpenAI 开源了一个叫 SimpleQA 的事实性基准,专门测模型回答短问题的准确率

OpenAI 放出了一个包含 4326 道题的基准 SimpleQA,题目都是简短、有明确答案的事实类问题,比如“2022 年世界杯荷兰对阿根廷,哪位荷兰球员打进了运动战进球”。每道题都经过两名独立 AI 训练师交叉验证,又抽了 1000 道题做第三方审计,发现答案一致率 94.4%,估算数据集本身的固有错误率在 3% 左右。这个基准的目标是给前沿模型...

推荐理由:OpenAI 开源了一个事实问答基准 SimpleQA,4,326 道题,专门测模型回答短事实的准确率和校准能力。我会先打个折:它叫“简单”,但实际是给前沿模型挖坑,GPT-4o 得分不到 40%,说明越强的模型越容易在这上面翻车。数据质量方面,两道人工交叉核验,1,000 题抽检一致率 94.4%,估算固有错误率约 3%,这点先别太激动,3% 的错题率意味着有些题本身可能就有争议或歧义。整体看,这不是一篇例行公事的论文发布,而是一个直接打中可靠性、校准和基准信任问题的动作。

2024年10月24日星期四

OpenAI News

OpenAI 公布国家安全合作框架,明确禁止武器开发,但会帮美军做网络防御和行政提效

OpenAI 在 2024 年 10 月白宫发布 AI 国家安全备忘录后,公开了自己参与国家安全项目的边界。他们说自己有一套内部审核流程,由产品政策和国家安全团队把关,只接符合“民主价值观”的活。文章举了三个已有的例子:跟 DARPA 合作做网络防御、帮美国国际开发署用 ChatGPT 减轻行政杂活、以及在洛斯阿拉莫斯国家实验室搞生物科学研究。核心红线...

推荐理由:这篇不是产品发布,所以 H 分不高。真正有用的是 OpenAI 把内部评审流程摆出来了,还列了 3 个已经在跑的项目:跟 DARPA 做网络防御、帮 USAID 用 ChatGPT 减行政负担、跟洛斯阿拉莫斯国家实验室继续搞生物科学合作。同时明确画了红线——不准伤人、毁东西、造武器。我会先打个折,因为正文没披露模型版本、合同金额和实际效果数据,这些才是判断合作深度的硬指标。但光是把禁止用途和评审关卡公开写出来,在国防 AI 这个话题上就算有信息量了,所以 K 和 R 都给了通过。

2024年10月23日星期三

OpenAI News

OpenAI 把一致性模型简化并扩展到 15 亿参数,两步出图,质量追平扩散模型

OpenAI 发了个新方法叫 sCM,把连续时间一致性模型的训练搞稳定了,直接扩到 15 亿参数,在 512×512 的 ImageNet 上跑。它只用两步采样,出图质量就能跟现在最好的扩散模型打平,单张 A100 上 0.11 秒出一张图,比扩散模型快大约 50 倍。论文里对比了有效算力,sCM 花不到 10% 的算力就拿到差不多的 FID 分数。不...

推荐理由:这篇论文把连续时间一致性模型真正做大了,15 亿参数在 ImageNet 512×512 上跑通,两步采样就能拿到跟扩散模型差不多的样本质量,墙钟速度快了大约 50 倍。单张 A100、batch size=1、没做推理优化时 0.11 秒出一张图,这个数对实际部署有参考价值。我会先打个折:正文没披露跟其他快速采样方案(比如蒸馏模型)的直接对比,也没说训练用了多少算力,所以“快 50 倍”是跟谁比、代价多大,还得看后续细节。但能把快采样和大规模训练同时稳住,本身就是一个信号,说明这条路在工程上开始走得通了。

2024年10月22日星期二

OpenAI News

OpenAI 任命了首位首席经济学家,要研究 AI 到底怎么影响就业和经济增长

OpenAI 在 2024 年 10 月 22 日宣布,杜克大学教授 Ronnie Chatterji 将担任公司首位首席经济学家。这个职位不是发布新模型,而是专门研究 AI 对经济增长、就业和劳动力市场的长期影响,并想办法让技术红利扩散到更多人手里。Chatterji 之前在白宫负责协调 520 亿美元的芯片与科学法案,也当过美国商务部首席经济学家,...

推荐理由:我会先打个折:正文只说了 Ronnie Chatterji 是谁、干过什么,没说他上任后要做什么研究、怎么衡量 AI 的经济影响。但 OpenAI 专门设这个岗,说明他们想把经济影响从公关话题变成内部研究课题,这点值得盯。他之前管过 520 亿美元的芯片法案执行,政策接口经验是实的,不是挂名。

2024年10月15日星期二

OpenAI News

OpenAI 自查 ChatGPT 有没有看人下菜碟:用名字测偏见,整体翻车率约 0.1%

OpenAI 拿几百万条 ChatGPT 的真实对话做了次内部体检,想看看用户的名字会不会触发有害的刻板印象。他们让 GPT-4o 当“隐私保护评审员”去读聊天记录、找规律,研究员看不到原始对话。结果发现,ChatGPT 的回答质量不会因为名字暗示的性别或种族而变差,但确实有大约 0.1% 的情况,名字会引出有害偏见。在写故事这类开放任务里,出问题的概...

推荐理由:OpenAI 拿数百万条真实 ChatGPT 请求做了一次公平性审计,这种事很少见。我会先打个折:整体有害刻板印象发生率约 0.1%,看着很低,但研究也坦白种族相关判定的一致率不如性别高,这点先别太激动。真正该盯的是旧模型——GPT-3.5 Turbo 在分任务评测里偏差最明显,说明模型升级确实在压这个问题。研究用 GPT-4o 当隐私保护评审器,省了人工成本,但正文没披露评审器本身有没有系统性偏见。整体是一份有数据、有对比、有保留的工程报告,不是公关稿。

2024年10月10日星期四

OpenAI News

OpenAI 搞了个 MLE-bench,用 75 个 Kaggle 比赛来考 AI 的机器学习工程能力

OpenAI 从 Kaggle 挑了 75 个真实比赛做成基准测试,让 AI 智能体自己训练模型、处理数据、跑实验。最强的组合是 o1-preview 配上 AIDE 脚手架(一种帮模型自动迭代代码的工具),在 16.9% 的比赛里拿到了至少铜牌水平。这个成绩说明模型能独立完成一些 ML 工程任务,但离真正拿金牌还差得远。团队还研究了多给算力、多跑几次...

推荐理由:OpenAI 这次没让模型刷题,而是让它真刀真枪跑完 75 个 Kaggle 竞赛——从准备数据、训模型到交结果,整套 ML 工程流程都得自己来。最佳组合 o1-preview + AIDE 在 16.9% 的任务里摸到了铜牌线,说明能做一些,但离靠谱还差得远。我会先打个折:铜牌在 Kaggle 上不算难,正文也没披露具体是哪些任务、失败在哪类环节,所以别急着喊“替代 ML 工程师”。真正值得看的是它把评测从“会答题”扭到了“能干完整工程活”,而且代码开源,团队可以自己跑一遍看自家 agent 几斤几两。

2024年10月9日星期三

OpenAI News

OpenAI 说今年已端掉 20 多个滥用其模型的欺骗性网络

OpenAI 发了一篇安全更新,说从 2024 年初到现在,已经发现并掐断了超过 20 个试图用他们模型干坏事的行动和欺骗性网络。这些事主要跟选举干扰、社交媒体操纵以及有国家背景的团伙有关。文章把具体发现写进了 2024 年 10 月的一份威胁情报报告里,但正文没披露这 20 多个案例分别用了哪些模型,也没说具体是怎么发现和阻断的。我会先打个折,这更像...

推荐理由:OpenAI 这篇公告 HKR 三项都站得住:20 多次打击是个能让人点进来的数字,威胁情报报告更新到 10 月也算新事实,选举干扰和社媒操纵又是当下最烫手的安全话题。不过正文没给出具体样本分布、用了哪些模型、怎么处置的细节,所以分数停在 featured 不往上走。我会先打个折——没看到实操层面的干货,这点先别太激动。

2024年10月8日星期二

OpenAI News

OpenAI 与赫斯特达成内容合作,旗下 20+ 杂志和 40+ 报纸将进入 ChatGPT

OpenAI 在 2024 年 10 月 8 日宣布,跟美国老牌出版集团赫斯特(Hearst)签了内容授权协议。赫斯特会把《时尚先生》《时尚 COSMO》《ELLE》《跑者世界》《女性健康》等 20 多个杂志品牌和 40 多家报纸(包括《休斯顿纪事报》《旧金山纪事报》)的内容提供给 ChatGPT 这类产品。ChatGPT 目前每周有 2 亿用户,以后...

推荐理由:OpenAI 把 Hearst 旗下 20 多个杂志品牌和 40 多家报纸的内容接进 ChatGPT,正文顺带确认周活用户 2 亿。合作只覆盖杂志和报纸,不含 Hearst 其他业务,内容会带引用和原文链接。我会先打个折:出版商授权现在不算新鲜事,但这次规模摆在那,而且新闻内容进 AI 分发链的归属和引用问题一直没消停,所以值得放 featured。

2024年10月3日星期四

OpenAI News

OpenAI 给 ChatGPT 加了个叫 Canvas 的侧边栏,写东西和改代码不用再跟聊天框死磕了

OpenAI 在 10 月 3 号给 Plus 和 Team 用户推了个 Canvas 测试版,相当于在 ChatGPT 旁边开了个协作窗口,你可以直接在上面改文字或代码,模型也能像编辑一样给行内建议。它背后是 GPT-4o,专门训练过什么时候该自动弹出这个窗口:写作场景触发准确率到了 83%,编程场景 94%。模型还学会了做定点修改而不是每次都整篇重...

推荐理由:OpenAI 给 ChatGPT 加了个叫 canvas 的协作界面,写作和编程时能单独开一个窗口,选中某段文字直接改、能回退版本,还有调长度、修 bug、代码审查这些快捷操作。我会先打个折,这目前是测试版,只给 Plus 和 Team 用户用。但真正值得看的是他们怎么训的:内部 20 多项评测里,模型知道什么时候该自动弹出 canvas 的准确率写作 83%、编程 94%,定向编辑效果比之前好 18%,评论准确率高出 30%、质量高出 16%。这些数字说明他们不是拍脑袋加功能,而是用偏好数据专门教过模型什么时候该进协作模式、怎么改得更准。对做 A...

OpenAI News

OpenAI 拿到 40 亿美元银行授信,加上刚融的 66 亿,手里可动用资金超过 100 亿

OpenAI 在 2024 年 10 月 3 日宣布,从摩根大通、花旗、高盛等 9 家银行搞到了一个 40 亿美元的循环信贷额度。这笔钱目前还没动过,加上之前那轮 66 亿美元的融资,公司账上能随时调用的钱超过了 100 亿美元。说白了就是 OpenAI 给自己备了一大笔过冬或扩张的粮草,不是新产品发布。不过公告没提这笔贷款的利率、期限和抵押条件,所以...

推荐理由:OpenAI刚拿完66亿又搞了40亿的循环贷,账上可动用的钱超过100亿美元。我会先打个折:正文没写利率、期限和抵押条件,所以这更像一个资金实力的信号,而不是能细算成本的融资方案。对关注算力投入和现金流的人来说,这个弹药规模值得一看,但别急着下结论。

2024年10月2日星期三

OpenAI News

OpenAI 拿了 66 亿美元新融资,估值推到 1570 亿美元

OpenAI 宣布完成 66 亿美元融资,投后估值 1570 亿美元。钱会花在前沿 AI 研究、增加算力和继续做产品工具上。现在 ChatGPT 每周有超过 2.5 亿人在用。正文没披露具体投资人名单、持股条款,也没说算力具体会扩到多大规模。

推荐理由:OpenAI 官方发的融资公告,66 亿美元、1570 亿估值、2.5 亿周活用户,三个数摆出来就够了。我会先打个折:投资方是谁、股权怎么安排、算力具体扩多少,正文全没写,所以别急着脑补。真正值得盯的是钱又流向了算力,这条线比估值本身更说明问题。

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。