跳到正文

#OpenAI

今日 0 条

2024年8月16日星期五

OpenAI News

OpenAI 封掉了一批用 ChatGPT 给伊朗隐蔽舆论战写稿的账号

OpenAI 在 2024 年 8 月 16 日说,他们发现并封禁了一批 ChatGPT 账号,这些账号属于一个叫 Storm-2035 的伊朗隐蔽舆论行动。这批账号用 ChatGPT 干两件事:一是写长文章,发在五个伪装成进步派或保守派新闻的网站上;二是生成英语和西班牙语的短评论,发在 X 和 Instagram 上。他们聊的主要是加沙冲突、以色列参...

推荐理由:钩子落在 OpenAI 主动曝光自家模型被用于隐蔽选举干预,够抓眼球。新知部分给了具体账号数、站点数和 Breakout Scale 2 级,说明操作规模小、传播效果差,这点先别太激动。风险关联上,模型滥用和选举安全是行业硬伤,但 OpenAI 自己说没看到有意义的受众触达,所以重要性停在 76 分,不往上拔。

2024年8月13日星期二

OpenAI News

OpenAI 发布 SWE-bench Verified:人工复核过的代码能力测试集

OpenAI 和 SWE-bench 原作者一起搞了个“验过货”的子集,叫 SWE-bench Verified。他们发现原版测试有坑:单元测试太死板、问题描述含糊、环境搭不起来,导致明明对的代码被判错,会系统性地低估模型写代码的真实水平。截至 2024 年 8 月 5 日,头部智能体在原版 SWE-bench 上得分约 20%,在 SWE-bench...

推荐理由:这不是一次常规发布。OpenAI 拉着原作者把 SWE-bench 翻了一遍,点出三类硬伤,还给出了新的分数天花板。我会先打个折:正文没披露修正后的完整新榜单,但现有数据已经足够让人重新审视那些代码智能体的评测成绩。

2024年8月8日星期四

OpenAI News

OpenAI 把卡内基梅隆的机器学习系主任 Zico Kolter 拉进了董事会和安全委员会

OpenAI 在 2024 年 8 月 8 日宣布,卡内基梅隆大学教授 Zico Kolter 加入董事会,同时进入安全与安保委员会。Kolter 的研究方向是 AI 安全、模型对齐,以及让机器学习分类器更稳健——说白了就是研究怎么让模型别轻易被忽悠、别输出危险内容。他之前搞出过给深度学习模型加“硬约束”的方法,2023 年还带队开发了自动评估大模型安...

推荐理由:我会先打个折:这就是个任命通知,别当产品发布看。真正值得盯的是治理层补进了一个有 AI 安全与鲁棒性技术底子的人,而且直接放进安全与安保委员会,以后所有项目的关键安全决策他都有份提建议。正文没披露他具体投票权有多大、委员会多久开一次会,这点先别太激动。

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2024年8月6日星期二

OpenAI News

OpenAI 给 API 加了“结构化输出”,让模型按你给的 JSON 模板回话

OpenAI 在 2024 年 8 月 6 日上线了 Structured Outputs 功能,模型能严格按开发者提供的 JSON Schema 输出,不再只是生成合法 JSON 就完事。新模型 gpt-4o-2024-08-06 在复杂 schema 测试里拿了 100% 的准确率,而老模型 gpt-4-0613 不到 40%。用法上,在函数调用里...

推荐理由:我会先打个折,这不是新模型发布或公司级大事件,但把 JSON 模式从“输出合法 JSON”升级到“严格匹配你的 schema”,并且给出 100% 对不到 40% 的评测对比,对天天跟解析错误搏斗的开发者来说太解渴了。约束解码加模型训练这套组合拳,比旧版 JSON mode 靠谱得多,直接拉高了工具调用的下限。84 分给的是一个高价值的 API 能力更新,不是行业地震,但够实用。

2024年7月25日星期四

OpenAI News

OpenAI 发布 SearchGPT 原型,把实时搜索塞进聊天框里

OpenAI 在 7 月 25 号开始小范围测试 SearchGPT,一个临时上线的 AI 搜索原型。它直接用对话形式返回带实时信息的答案,每条信息都附有内联的出处标注,侧边栏还会列出更多来源链接,方便你点进去核实。这个原型目前只开放给一小部分用户和出版商试用,目的是收集反馈。官方明确说这只是个过渡产品,未来会把好用的功能整合进 ChatGPT 里。正...

推荐理由:我会先打个折:正文没披露模型名、规模、商用时间,所以没法往 90 以上打。但 OpenAI 拿一个带实时网页回答和出版商参与的独立搜索原型出来测试,当天就该写。它用文内引用和侧边栏来源链接解决了一部分可信度问题,连续追问也让搜索更像对话,这些点从业者会关心。不过别太激动,它只是个临时原型,最终要融进 ChatGPT,现在更像 OpenAI 在试探搜索边界和出版商关系。

2024年7月24日星期三

OpenAI News

OpenAI 用“规则打分”替代部分人工反馈,让模型在安全问题上更听话

OpenAI 在 7 月 24 日公开了他们用在安全对齐上的新方法:Rule-Based Rewards(RBRs),也就是用一套事先写好的规则给模型回复打分,而不是每次都靠人反复标注。这套方法把模型面对敏感请求时的反应分成三类——硬拒绝(简短道歉并明确说不)、软拒绝(带同理心地拒绝)和正常遵从——然后针对每类行为设定具体的评判标准,比如“回复是否在说...

推荐理由:我会先打个折:正文截取部分没给具体效果数字,也没对比基线,所以分数压在 78–84 这个区间。但 OpenAI 把安全规则显式写进奖励模型这件事本身值得关注,因为它解决的是工程上很实际的麻烦——政策一改,不用重新雇人标一堆数据,改规则就行。三种响应模式(硬拒、软拒、合规)让模型拒绝时不会太生硬,这点对产品体验有帮助。不过别太激动,论文没披露误拒率或漏判率,实际线上表现还得看后续有没有更细的评测。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

OpenAI News

OpenAI 给企业版 ChatGPT 加了合规 API 和自动管人工具

OpenAI 在 2024 年 7 月 18 日推出了企业合规 API,让公司能导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,主要给金融、医疗、法律这些强监管行业做审计和归档用。同时接入了 Forcepoint、Microsoft Purview、Netskope 等八家第三方合规厂商,方便做数据防泄漏和法务留存。用户管理方面,SCIM 自动...

推荐理由:OpenAI 给 ChatGPT Enterprise 加了合规 API、8 个第三方合规集成和 SCIM 用户管理,主要解决企业审计和账号管控的落地问题。我会先打个折:文章没展开“Expanded GPT controls”的具体细节,这部分只能先当占位。能确认的是,API 可以导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,对接了 Okta、Microsoft Entra ID、Google Workspace 和 Ping,对需要过合规审计的团队来说,省了自己拼积木的功夫。

2024年7月17日星期三

OpenAI News

OpenAI 用“证明者-验证者博弈”让大模型写的东西更好懂,人类评估错误率降了一半

OpenAI 让 GPT-4 家族里的大模型和小模型玩一个博弈游戏:大模型当“证明者”负责解题,小模型当“验证者”负责判对错。大模型如果只追求答案正确,写出来的解题步骤会越来越难读——人类评估员在限时条件下,错误率几乎翻倍。换成这种博弈训练后,大模型必须写出连小模型都能看懂的推理过程,结果人类评估的准确率也上来了。文章说大小模型之间的预训练算力差了大约...

推荐理由:OpenAI 这篇研究把可读性做成训练信号,强模型要写出弱模型能核验的答案,人类评审也证实有效果。我会先打个折:正文只给了部分数字,完整实验表没披露,所以不能把效果说死。但思路本身戳中了可扩展监督的痛点,加上 hook 清晰、机制新,放在 featured 没问题。

2024年6月13日星期四

OpenAI News

OpenAI 把退役陆军上将 Paul M. Nakasone 拉进董事会,主抓网络安全

OpenAI 宣布退役美国陆军上将 Paul M. Nakasone 加入董事会,并进入安全与安保委员会。Nakasone 是网络安全的老手,曾长期掌管美国网络司令部和国家安全局。公告说他的加入是为了应对 AI 越来越强后随之而来的高级网络威胁,比如保护训练超算、模型权重和用户数据。另外他也想帮 OpenAI 搞清楚怎么用 AI 帮医院、学校这类常被攻...

推荐理由:OpenAI 官方发文确认 Paul M. Nakasone 加入董事会,这件事的份量不在产品层面,而在治理和安全信号。我会先打个折:正文是空的,只给了标题,任命细节一概没提,所以没法判断是战略转向还是常规补位。但一个退役上将坐进 AI 公司的董事会,本身就够让行业多看两眼,尤其是那些做合规、出海或对接政府客户的人。这点先别太激动,等后续披露职责范围再说。

2024年6月10日星期一

OpenAI News

OpenAI 和苹果宣布合作,ChatGPT 将直接内置到 iPhone、iPad 和 Mac 系统里

苹果会在 iOS、iPadOS 和 macOS 里把 ChatGPT 塞进 Siri 和系统自带的写作工具,用的是 GPT-4o 模型。用户不用跳转 App,就能让 Siri 直接调 ChatGPT 回答问题或理解图片、文档,写作工具里也能让 ChatGPT 帮忙生成文字和配图。隐私方面,OpenAI 说通过 Siri 和写作工具发起的请求不会被他们存...

推荐理由:官方帖子只给了一个标题,说 OpenAI 和 Apple 合作了,其他全是空白。我会先打个折:H 和 R 都过,因为两家体量摆在那,平台分发和模型站位的话题性够强。但 K 完全不过——没范围、没机制、没时间表、没商业条款,就是一条待补细节的合作声明。所以整体放在 featured 的低线,别被标题骗了,这还不是产品落地信息。

OpenAI News

OpenAI 宣布新任 CFO 和 CPO,分别来自 Nextdoor 和 Planet Labs

OpenAI 在 6 月 10 号发公告,Sarah Friar 加入当首席财务官,Kevin Weil 当首席产品官。Friar 之前在 Nextdoor 做 CEO,更早是 Square 的 CFO;Weil 之前在 Planet Labs 管产品和业务,也做过 Instagram 和 Twitter 的产品 VP。公告里说 CFO 要管投资和扩张...

推荐理由:这条消息的钩子很足,OpenAI 同时端出 CFO 和 CPO,官方信源权威性也高。但信息量其实很薄,正文是空的,连到岗时间和职责范围都没给,所以知识增量要打个折。我会把它放进 featured,因为商业化节奏和组织扩张是大家真正关心的,哪怕现在只有个标题,也值得先标出来让人留意。

2024年5月28日星期二

OpenAI News

OpenAI 董事会成立安全委员会,90 天内要给所有项目定安全规矩

OpenAI 董事会新设了一个安全与安保委员会,由 Bret Taylor 牵头,成员包括 Adam D’Angelo、Nicole Seligman 和 Sam Altman。这个委员会的任务是对公司所有项目的关键安全和安保决策提出建议,第一件事就是在 90 天内重新评估并完善现有的安全流程和防护措施,之后向全体董事会交方案,OpenAI 承诺会公开...

推荐理由:OpenAI 董事会官宣成立安全与安保委员会,动作本身值得关注,因为董事会级的委员会有实权。但正文是空的,没给任何具体信息:谁进委员会、管多宽、向谁汇报、什么时候生效,全不知道。我会先打个折,因为光有个名字说明不了是真治理还是公关动作。安全从业者真正该盯的是这个委员会能不能独立叫停训练或部署,而不是它叫什么。

2024年5月15日星期三

OpenAI News

OpenAI 首席科学家换人:Ilya Sutskever 离职,Jakub Pachocki 接任

OpenAI 在 2024 年 5 月 14 日发了一条简短公告,确认联合创始人兼首席科学家 Ilya Sutskever 将离开公司,由原研究总监 Jakub Pachocki 接任首席科学家。公告里只有 Sam Altman 给全公司的一封告别信和一段 Pachocki 的履历介绍,没有说明 Sutskever 具体哪天离职、交接期怎么安排,也没提...

推荐理由:我会先打个折,因为正文是空的,只有标题能确认两个人事变动。Ilya 作为联合创始人兼首席科学家离职,本身就够重磅,接任者是谁也直接决定后续研究风格。但正文没披露交接时间、过渡安排和职责切分,这些缺口让判断只能停在标题层面。对从业者来说,真正该盯的是研究路线谁说了算,这点目前还没答案。

2024年5月13日星期一

OpenAI News

OpenAI 把 GPT-4o 和更多工具开放给免费用户了

OpenAI 宣布免费版 ChatGPT 也能用上最新的旗舰模型 GPT-4o,同时还会逐步解锁联网搜索、数据分析画图表、上传文件、聊照片、用 GPTs 商店和记忆功能。GPT-4o 在文字、语音和图片理解上都比前代更快,但免费用户有使用次数限制,用完了会自动切回 GPT-3.5。付费的 Plus 用户消息额度是免费用户的 5 倍,还能抢先体验新的实时...

推荐理由:这条消息分量很重,OpenAI 把 GPT-4o 塞进免费套餐,等于重新划了免费 AI 工具的天花板。我会先打个折,因为正文是空的,工具清单、配额、地区、上线节奏全都没披露,实际落地效果还得看后续细节。但光是这个信号就够从业者紧张一阵了,所以分数给到 90,没拉满是因为信息缺口太大。

2024年4月24日星期三

OpenAI News

GPT-4 API 全面开放,旧版补全模型半年后下线

OpenAI 宣布 GPT-4 API 向所有付费开发者开放,同时给旧版 Completions API 模型判了死缓:2024 年 1 月 4 日起,ada、babbage、curie、davinci 等老模型将彻底停用,用户需要迁移到新的替代模型上。官方推荐大家转向 Chat Completions API,说现在 97% 的 GPT API 用量...

推荐理由:这是一次有分量的 OpenAI 平台更新,HKR 的 K 和 R 都很扎实:GPT-4 API 全面开放叠加 Completions 旧模型弃用,对开发者是立刻要面对的事。没给 p1 是因为正文是空的,开放范围、截止日期、受影响模型名单全没披露,实际影响还得等细节。

2024年3月8日星期五

OpenAI News

OpenAI 独立调查结束,Sam Altman 和 Greg Brockman 继续掌舵

OpenAI 董事会宣布,由 WilmerHale 律所完成的独立调查已结案,Sam Altman 和 Greg Brockman 将继续领导公司,Altman 也会重回董事会。调查翻了三万多份文件、做了几十次访谈,结论是去年 11 月那场罢免风波,根源在于前董事会和 Altman 之间信任崩了,跟产品安全、研发速度、公司财务都没关系。前董事会当时觉得...

推荐理由:这条是 OpenAI 官方口径的人事确认,H 和 R 都拉满:它把董事会危机后最大的不确定性给摁住了,对后续产品节奏和商业信任都有实际影响。K 偏低是因为目前只有一句话公告,审查怎么做的、结论怎么来的、治理机制有没有改,全都没披露,所以信息量其实很薄。

2024年2月13日星期二

OpenAI News

ChatGPT 加上了记忆功能,能跨对话记住你的偏好,你也可以随时关掉或让它忘掉

OpenAI 给 ChatGPT 加了一个记忆功能,不再每次对话都像第一次见面。它会记住你主动告诉它的事,也会自己从聊天里抓取细节,比如你喜欢的会议纪要格式、你开的咖啡店、你家小孩喜欢水母。这些记忆会跨对话保留,用越多越懂你。控制权在你手里:可以在设置里关掉整个记忆,也可以直接对话让它忘掉某件事,或者用临时对话模式完全不记。正文提到免费和付费用户都在小...

推荐理由:OpenAI 官方发了个标题,说 ChatGPT 要有记忆和新控制项,但正文是空的。我会先打个折:记忆能让 ChatGPT 记住你的偏好和上下文,用久了会更顺手,这点挺抓人。可真正该盯的是控制机制——用户能不能随时关掉、能不能按会话或按话题设权限,这些全没披露。没有这些信息,标题里的“新控制项”还只是一句口号,产品影响暂时没法判断。

2023年11月29日星期三

OpenAI News

Sam Altman 回任 OpenAI CEO,新初始董事会只有三个人

OpenAI 官方确认 Sam Altman 重新担任 CEO,Mira Murati 回到 CTO 岗位,Greg Brockman 也回来当总裁。新成立的初始董事会只有三个人:Bret Taylor(主席)、Larry Summers 和 Adam D'Angelo。Ilya Sutskever 不再留在董事会,但 Sam 说还在聊怎么让他继续在 ...

推荐理由:这是一条 95–100 分段的治理事件:Sam Altman 回归 CEO,OpenAI 重置初始董事会。HKR 三项全中,靠的是反转力度和行业冲击,但正文没披露董事会成员和生效时间,所以扣一点分,没给满分。

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

推荐理由:这是一次实打实的 OpenAI 产品更新:标题确认了视觉输入、语音输入和语音输出,所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价,我会先打个折,停在 88 分而不是拉满。别被标题骗了,真正要盯的是语音延迟、视觉理解边界和调用入口。