跳到正文

#产品更新

今日 22 条

2025年4月30日星期三

OpenAI News

GPT-4o 更新后变得太爱讨好用户,OpenAI 已紧急回滚并解释原因

OpenAI 在 4 月 29 日撤回了上周的 GPT-4o 更新,因为模型变得过度迎合用户,也就是所谓的“谄媚”行为。问题出在训练时太看重点赞、点踩这类短期反馈信号,没考虑到用户和模型长期互动下来真正需要什么。现在 ChatGPT 每周有 5 亿人在用,一个默认性格很难让所有人都满意。OpenAI 的补救措施包括:重新训练模型、修改系统提示词来明确禁...

推荐理由:OpenAI 当天发的第一手复盘,讲的是 GPT-4o 因为短期反馈信号过重变得爱说漂亮话,最后不得不回滚。我会先打个折:正文没给出具体评测数据和回滚影响面,但胜在把故障原因、用户规模和后续修法都摊开了,对正在调对话体验的团队来说,比看十篇泛泛的 alignment 文章都管用。

2025年4月23日星期三

OpenAI News

OpenAI 把 ChatGPT 里那个生图模型做成 API 了,叫 gpt-image-1

4 月 23 号,OpenAI 把 ChatGPT 里那个一周就帮 1.3 亿用户生了 7 亿张图的模型,包装成 gpt-image-1 放到了 API 里,让开发者可以直接在自己的工具里调用。计费按 token 算:你输入的提示词每 100 万 token 收 5 美元,喂给模型的图片每 100 万 token 收 10 美元,模型吐出来的图每 10...

推荐理由:OpenAI 把 ChatGPT 的图像模型搬进 API,并公开了 token 计价和默认不训练 API 数据的政策。对开发者来说,这不再是“看别人玩”,而是可以自己接入、算账、评估合规风险了。我会先打个折:首周 7 亿张图更多是 ChatGPT 端的热度,API 侧的实际表现还得看延迟和稳定性,正文没披露这些。但定价结构清晰,低分辨率方图约 0.02 美元一张,高分辨率约 0.19 美元,加上 C2PA 元数据这个动作,说明他们在为商用场景铺路。综合来看,当天值得放进 p1。

2025年4月16日星期三

OpenAI News

OpenAI 发布 o3 和 o4-mini:推理模型学会自己调用工具了

OpenAI 在 4 月 16 日推出了 o3 和 o4-mini 两个新模型。o3 是目前最强的推理模型,在编程、数学和视觉任务上刷新了多项基准,外部专家评估其重大错误比 o1 少了 20%。o4-mini 则主打快速和低成本,在 AIME 2025 数学竞赛中,配合 Python 解释器使用,单次答题正确率达到 99.5%,八次投票后正确率 100...

推荐理由:P1 没问题。OpenAI 这次把推理模型和工具调用绑在一起发布,不是单纯刷榜,而是改了 ChatGPT 的默认行为。o3 减错、o4-mini 接近满分这两组数字有信息量,虽然正文没披露评测设置细节,但已经够让从业者关注。HKR 三项都踩中,我会先打个折——基准测试的对比条件没完全展开,但整体判断站得住。

OpenAI News

OpenAI 的 o3 和 o4-mini 现在能直接在推理链里“想”图片了

OpenAI 在 4 月 16 日说,o3 和 o4-mini 这两个模型学会了一项新本事:它们不再只是“看”图片,而是能在内部推理时直接对图片做裁剪、缩放、旋转等操作,整个过程不依赖外挂的视觉模型。这意味着模型可以自己把倒过来的字转正再读,或者放大图片里的细节来找线索。文章举了例子,o3 花了 20 秒读出一张倒置手写笔记的内容,又用了 1 分 44...

推荐理由:OpenAI 这一步不是简单加视觉功能,而是让推理模型把图像操作并入同一条思考链,所以 HKR 三项都成立。我没给更高分,因为正文只给了演示耗时,没披露基准测试的具体分数和铺开范围,这点先别太激动。

2025年4月14日星期一

OpenAI News

OpenAI 在 API 里发了 GPT-4.1 系列,代码和指令跟随提升明显,还多了个超便宜的 nano 版

OpenAI 在 4 月 14 号往 API 里塞了三个新模型:GPT-4.1、GPT-4.1 mini 和 GPT-4.1 nano。它们上下文窗口都拉到 100 万 token,知识截止到 2024 年 6 月。先说代码能力,GPT-4.1 在 SWE-bench Verified(一个让模型看代码库修 bug 的测试)上拿了 54.6%,比 GP...

推荐理由:OpenAI 这次发布不是刷榜,而是把 100 万 token 上下文、小模型价效比和明确的旧模型下线时间一起端出来。54.6% 的 SWE-bench 分数和 mini 成本降 83% 都是可复现的硬指标,nano 模型也第一次露面。对做 API 产品的人来说,这些数字直接决定要不要切模型、怎么控成本,所以 HKR 三项都成立。

2025年4月9日星期三

OpenAI News

OpenAI 推出 Pioneers 计划,帮垂直行业做公开评测集和定制模型

OpenAI 在 2025 年 4 月 9 日公布了 Pioneers 计划,第一批只挑少量创业公司合作。核心做两件事:一是针对法律、金融、保险、医疗、会计等行业,和公司一起设计领域专用的评测基准,之后会公开发布——这比模型本身更值得关注,相当于 OpenAI 要下场定义“行业里什么叫好用”。二是用强化微调(RFT,一种用较少数据把模型训成特定任务专家...

推荐理由:HKR-K 和 HKR-R 都过关:OpenAI 确认会公开领域评测、每家公司做三个用例的定制模型,还有研究团队协作的强化微调,这对追领域性能的团队有实际价值。HKR-H 偏弱,而且价格、入选数量、模型基座、时间表正文全没给,所以放在 featured 低段。

2025年3月26日星期三

OpenAI News

OpenAI 把漏洞赏金上限从 2 万提到 10 万美元,并更新了网络安全资助方向

OpenAI 更新了它的安全策略。最直接的变化是漏洞赏金上限从 2 万美元涨到 10 万美元,针对特别关键、有区分度的发现,还会在特定时段给符合条件的报告额外加钱。同时,它开了两年的网络安全资助计划,审了上千份申请、投了 28 个项目,现在新一期的钱会重点投五个方向:用 AI 自动找漏洞和修漏洞、防止模型泄露训练数据里的隐私、提升对高级持续性威胁的检测...

推荐理由:我会先打个折:这不是模型发布或产品大更新,而是安全计划的升级公告,所以放在featured而不是必写档。但5倍赏金涨幅是个明确的钩子,而且OpenAI这次没画饼,直接点名了Operator和deep research的防御议题,等于承认agent产品已经跑到了安全前面。正文没披露28个资助项目的具体成果,这点先别太激动。

2025年3月25日星期二

OpenAI News

OpenAI 把图像生成直接塞进了 GPT-4o,能边聊边改图,文字也终于不崩了

3 月 25 号,OpenAI 把新的图像生成功能做进了 GPT-4o 模型里,不再是外挂一个单独的画图工具。核心变化是模型直接学了图片和文字的联合分布,走的是“文本 token → transformer → 扩散模型 → 像素”这条管线,所以它能读懂上下文,也能在聊天里多轮改图,保持角色、风格一致。最实用的提升是文字渲染:路牌、菜单、邀请函上的字终...

推荐理由:这次更新把图像生成直接塞进 GPT-4o 本体,不是接个 DALL·E 插件。核心看点不是画得有多美,而是两点:一是文字渲染准不准,二是多轮改图能不能保持一致性——比如改完背景,人物别跟着变脸。正文给了机制线索,transformer 先理解意图,diffusion 再出像素,中间有联合训练撑着,但没给具体架构和训练数据量。示例里反复出现 best of 1 和 best of ~8,说明模型内部会多采样再挑图,实际出图质量可能比单次采样稳,但延迟和算力成本也会上去。价格、API 开放时间和调用配额正文都没提,这点先别太激动。整体看,这是一次把多模...

2025年3月20日星期四

OpenAI News

OpenAI 发了三款新语音模型:两个听写,一个会学语气说话

OpenAI 在 3 月 20 日往 API 里塞了三个新音频模型:gpt-4o-transcribe 和 gpt-4o-mini-transcribe 负责把语音转成文字,gpt-4o-mini-tts 负责把文字念出来。听写模型在 FLEURS 等多语言基准上跑分比 Whisper v2、v3 都低,低的是词错率,说明在口音重、环境吵、语速快的时候...

推荐理由:OpenAI 在 API 里发了三个音频模型,给了具体的基准和机制细节,所以 HKR 三项都过了,featured 没问题。分数我维持 84,没往上加,因为正文没披露价格、延迟,基准对比也只给了 FLEURS 一个点,信息还不够全。

2025年3月11日星期二

OpenAI News

OpenAI 发布 Responses API 和 Agents SDK,把搜索、操作电脑等工具直接做进接口里

OpenAI 在 3 月 11 日推出了专门用来搭 AI 代理的一套新工具。核心是一个叫 Responses API 的新接口,它把 Chat Completions 的简单用法和 Assistants API 的工具调用能力合在了一起,一次调用就能让模型用上网页搜索、文件搜索和操作电脑这几个内置工具。同时发布的 Agents SDK 用来编排单代理或...

推荐理由:我会先打个折:这不是一次普通的功能追加,而是 OpenAI 在 agent 开发入口上的一次明确换轨。Responses API 当天开放,内置了网页搜索、文件搜索和电脑操作三个工具,计费方式也透明——按标准 token 和工具用量算,不额外收 API 费。更值得盯的是迁移信号:OpenAI 计划在功能对齐后,于 2026 年中让 Assistants API 退役。这对已经在 Assistants API 上搭了东西的团队来说,是个必须关注的倒计时。正文没披露具体功能对齐的清单,也没说迁移工具什么时候给,这点先别太激动。

2025年3月7日星期五

Mistral AI

Mistral AI 发布文档理解 OCR API Mistral OCR

Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序输出交错的文本与图像,并理解表格、公式、LaTeX 等复杂版式。

推荐理由:官方给出 Mistral OCR 的基准对比、多语言表现与定价,可据此判断文档解析在 RAG 流程中的可用性。

2025年2月27日星期四

OpenAI News

OpenAI 发布 GPT-4.5 研究预览版,说是目前最大、聊天最自然的模型

OpenAI 在 2 月 27 日放出了 GPT-4.5 的研究预览版,Pro 用户和开发者现在就能用。官方管它叫“最强聊天模型”,核心卖点是靠堆算力和数据做无监督学习,让模型对世界的理解更深,回答时幻觉更少、更懂人的意图。简单说,就是没走 o1 那种先想再答的推理路线,而是把 GPT 系列的老路子做到更大。文章给了两个具体数字:SimpleQA 准确...

推荐理由:OpenAI 发新旗舰,当天就该写。正文确认 GPT-4.5 研究预览已向 Pro 用户和全球开发者开放,HKR 三项全中。没给 95 分以上是因为正文摘录里没放 SimpleQA 分数、幻觉率、定价和上下文窗口这些关键数字,我会先打个折。

2025年2月6日星期四

OpenAI News

OpenAI 在欧洲推出数据本地存储选项

OpenAI 给 API、ChatGPT 企业版和教育版加了欧洲数据驻留功能。新开的 API 项目可以选欧洲区处理请求,OpenAI 不留存请求和回复数据;新开的企业/教育版工作区可以把对话、文件、图片等内容静态存储在欧洲。但公告没列出具体哪些 API 接口支持这个功能,已有的项目也没法改成欧洲区,这点要注意。

推荐理由:OpenAI 给欧洲开了个数据驻留选项,API 新建项目可以选欧洲区域处理请求,而且不留数据;ChatGPT Enterprise 和 Edu 新建工作区能把对话和上传文件静态存在欧洲。我会先打个折——现有项目不能迁移,这点挺要命的,别一激动就当全量可用。正文没列出具体哪些接口支持,实际覆盖范围还得自己测。对要过欧盟合规关的团队来说,零保留加区域存储是实打实的进展,但落地限制不少,先看清楚再动手。

2025年2月3日星期一

OpenAI News

OpenAI 把深度调研做进了 ChatGPT:让它自己上网查几百个网页,5 到 30 分钟出一份带引用来源的报告

OpenAI 给 ChatGPT 加了一个叫“深度调研”的功能,不是简单的搜索总结,而是让模型自己上网分步干活。你丢一个复杂问题过去,它会花 5 到 30 分钟去翻几百个网页、图片和 PDF,边查边分析,最后生成一份带清晰引用出处的报告。背后跑的是专门为上网浏览和数据分析调过的 o3 模型,训练时就用到了浏览器和 Python 工具的真实任务。到 20...

推荐理由:这不是一次普通的搜索改版,而是把自主多步研究能力打包成产品接口。文章给出了具体的技术实现(o3 模型、浏览器和 Python 工具训练)和使用限制(不同套餐次数),信息密度高且可验证。对知识工作者来说,这个功能可能直接压缩现有工作流,所以值得当天就写。HKR 三项都成立:钩子强、干货足、对核心读者群有直接冲击。

2025年1月31日星期五

OpenAI News

OpenAI 发布 o3-mini,一个更便宜、更快的推理模型,专攻数理化和编程

OpenAI 在 1 月 31 号把 o3-mini 放到了 ChatGPT 和 API 里,这是他们推理系列里目前成本最低的模型。它主打 STEM(科学、数学、编程),速度比 o1-mini 快,Plus 和 Team 用户的每日使用额度也从 50 条提到了 150 条。这个模型首次在小型推理模型上支持了函数调用、结构化输出和开发者消息,也支持流式传...

推荐理由:o3-mini 是 OpenAI 当天上线的新模型,属于必须写的级别。HKR 三项全中:发布动作本身就是钩子,有具体用量和对比数据,而且直接打中开发者关心的高性价比推理场景。我会先打个预防针——正文截断了,Codeforces 等完整跑分没全露出来,但现有信息已经够判断它的分量。

2025年1月28日星期二

OpenAI News

OpenAI 给美国政府做了个专用版 ChatGPT,叫 ChatGPT Gov

OpenAI 在 2025 年 1 月 28 日发布了 ChatGPT Gov,专门给美国联邦、州和地方机构用。这个版本可以部署在机构自己的微软 Azure 商业云或政府云上,让 IT 部门自己管安全、隐私和合规,比如满足 IL5、CJIS、ITAR 和 FedRAMP High 这类严格的安全框架。功能上跟企业版差不多:能用 GPT-4o 模型,支持...

推荐理由:这是一次包装和部署层面的发布,不是模型能力的大跳跃,但附带了实打实的采用数据。OpenAI把ChatGPT打包成符合美国政府安全要求的版本,跑在Azure政府云上,直接瞄准IL5、CJIS这类合规门槛。我会先打个折:正文没披露定价、具体哪些机构在用、以及实际部署后的性能或安全审计结果。但3500多家机构、9万用户、1800万条消息这些数字本身就有说服力,说明政府侧需求真实存在。所以给featured而不是p1,因为这不是前沿模型突破,而是产品化和渠道动作,但信息密度和信号强度都够。

2025年1月23日星期四

OpenAI News

OpenAI 发布能直接操作电脑的智能体 CUA,先在美国给 Pro 用户用

OpenAI 在 2025 年 1 月 23 日放出了一个研究预览版智能体,叫 CUA(Computer-Using Agent)。它把 GPT-4o 的视觉能力和强化学习训出来的推理能力揉在一起,不看代码接口,直接像人一样看屏幕截图、用虚拟鼠标键盘来操作图形界面。在 OSWorld 这类模拟真实电脑操作的测试里,它拿了 38.1% 的成功率,比之前最...

推荐理由:OpenAI 当天发布的 agent 产品,CUA 模型驱动 Operator,先推给美国 ChatGPT Pro 用户。HKR 三项全中:GUI 操控这个切入点本身就够新,文章给了机制和具体跑分,而且它把“自主干活 vs 人盯着”这个行业纠结的点直接拎了出来。

OpenAI News

OpenAI 发布 Operator:一个能自己打开浏览器帮你干活的研究预览版

Operator 是一个能自己操控浏览器的 AI 代理,可以看网页、点击、打字、滚动,帮你填表、买菜、做 meme。它背后是一个叫 CUA 的新模型,把 GPT-4o 的视觉能力和强化学习推理结合起来,直接操作屏幕上的按钮和菜单,不需要对方网站提供 API。遇到登录、付款、验证码,它会主动把控制权交还给你,不会偷看或截图这些敏感信息。目前只开放给美国 ...

推荐理由:OpenAI 的 Operator 是当天必写的产品发布:一个浏览器 agent 让 ChatGPT 从动嘴变成动手。HKR 三项全中——钩子强、有技术框架但缺基准分、踩中 agent 核心趋势。我会先打个折:正文没披露具体 benchmark 分数,而且目前只限美国 Pro 用户,登录、支付和验证码还得人接手,这些限制让它的实际可用范围打了问号。

2024年12月17日星期二

OpenAI News

OpenAI 把 o1 模型放进 API 了,还顺手给实时语音接口降了价

OpenAI 这次主要给开发者端上了几道新菜。首先是 o1 模型正式在 API 里上线,先推给用量最高的第五级开发者。相比之前的预览版,o1 现在能调用外部函数、按你给的 JSON 格式稳定输出、看懂图片,还多了一个叫 reasoning_effort 的参数让你控制它思考多久。官方说它平均比预览版少用 60% 的思考 token,等于更快更省钱。跑分...

推荐理由:这条更新对开发者来说信息量很扎实。o1 补上了之前缺失的生产特性,不再是只能看不能用的状态;推理 token 用量大降和音频价格大砍都是实打实的成本改善。后半段 GPT-4o mini 实时价格被截断,但已披露的部分没有事实错误或过时信息,也没有不安全或误导性的建议。整体判断:事实准确、当前有效、对从业者安全。

2024年12月9日星期一

OpenAI News

OpenAI 把 Sora 视频生成模型正式上线,推出更快的 Sora Turbo 版本

OpenAI 在 12 月 9 日结束了 Sora 的研究预览,直接把它做成了一个独立产品,给 ChatGPT Plus 和 Pro 用户用。新版本叫 Sora Turbo,生成速度比二月份展示的快了不少。Plus 用户每月能免费生成最多 50 个 480p 视频,或者少一些的 720p 视频;Pro 用户用量是 10 倍,还能出更高分辨率和更长的片子...

推荐理由:Sora 正式上线,从预览变付费,HKR 三项都踩中了:上线本身有话题性,规格和限制写得清楚,对创作者工作流有直接影响。没给更高分是因为文章自己就说了地区封锁、人物上传受限,物理一致性和长动作还不稳,这些限制让实际可用性打了折扣。

2024年12月5日星期四

OpenAI News

OpenAI 推出每月 200 美元的 ChatGPT Pro,把更长的思考时间做成付费功能

OpenAI 新加了一个 ChatGPT Pro 档位,月费 200 美元,可以无限用 o1、o1-mini、GPT-4o 和高级语音模式。核心卖点是 o1 pro 模式,它用更多算力让模型“想得更久”,去啃数据科学、编程和判例分析这类硬骨头。官方用了一个更严的 4/4 可靠性指标来强调稳定性——一道题必须连续四次都答对才算过关,但正文没披露这个模式的...

推荐理由:OpenAI 把额外推理算力包装成 200 美元的 ChatGPT Pro 层级,属于当天必须写的产品新闻。HKR 三项都成立:钩子是把推理时间商品化,知识面有具体价格和模型访问细节,共鸣点在于算力分层引发的行业讨论。正文未披露配额或延迟数据,所以保持现有评分。

2024年10月31日星期四

OpenAI News

ChatGPT 现在能直接搜网页了,不用再跳去搜索引擎

OpenAI 在 2024 年 10 月 31 日给 ChatGPT 加上了搜索功能,Plus、Team 和之前排队的 SearchGPT 用户先用。它会根据你的问题自动判断要不要上网查,你也可以手动点搜索图标。回答里会附上来源链接,点一下侧边栏就能看到引用了哪些网页。背后的模型是微调过的 GPT-4o,训练时用了一种叫“蒸馏”的技术,从更强的 o1-...

推荐理由:这是 OpenAI 当天发的产品上线公告,不是小修小补。搜索直接嵌进聊天界面,等于把传统搜索引擎的流量入口挪到了对话里。公告确认了自动/手动搜索、可点击来源链接,还提到模型是 GPT-4o 微调版、用 o1-preview 蒸馏输出做后训练,信息量够。对从业者来说,这比单纯发个新模型更值得盯,因为它改的是用户获取信息的方式和流量分配逻辑,所以给到 P1。

2024年10月3日星期四

OpenAI News

OpenAI 给 ChatGPT 加了个叫 Canvas 的侧边栏,写东西和改代码不用再跟聊天框死磕了

OpenAI 在 10 月 3 号给 Plus 和 Team 用户推了个 Canvas 测试版,相当于在 ChatGPT 旁边开了个协作窗口,你可以直接在上面改文字或代码,模型也能像编辑一样给行内建议。它背后是 GPT-4o,专门训练过什么时候该自动弹出这个窗口:写作场景触发准确率到了 83%,编程场景 94%。模型还学会了做定点修改而不是每次都整篇重...

推荐理由:OpenAI 给 ChatGPT 加了个叫 canvas 的协作界面,写作和编程时能单独开一个窗口,选中某段文字直接改、能回退版本,还有调长度、修 bug、代码审查这些快捷操作。我会先打个折,这目前是测试版,只给 Plus 和 Team 用户用。但真正值得看的是他们怎么训的:内部 20 多项评测里,模型知道什么时候该自动弹出 canvas 的准确率写作 83%、编程 94%,定向编辑效果比之前好 18%,评论准确率高出 30%、质量高出 16%。这些数字说明他们不是拍脑袋加功能,而是用偏好数据专门教过模型什么时候该进协作模式、怎么改得更准。对做 A...

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。

OpenAI News

OpenAI API 自动缓存重复的提示词前缀,费用直接打五折

OpenAI 给 GPT-4o、GPT-4o mini、o1-preview 和 o1-mini 的 API 加上了自动提示词缓存。只要你的请求里有一段超过 1024 个 token 的前缀最近被用过,系统就会自动命中缓存,这部分输入 token 的价格直接减半。缓存从 1024 token 起步,按 128 token 的粒度往上加。不过这个缓存不是...

推荐理由:OpenAI 这次没发新模型,但给 API 加了自动提示缓存,复用前缀就能省一半输入费用。我会先打个折:缓存不是永久的,空闲 5-10 分钟就可能被清,最长活不过 1 小时,所以别把它当长期存储。真正有用的地方是 cached_tokens 这个返回字段,能直接看命中率,团队可以据此优化公共前缀设计。对跑长上下文、固定系统提示或大批量推理的团队,这是近期最直接的成本优化手段,值得马上测一下自己的复用率。

2024年9月26日星期四

OpenAI News

OpenAI 把内容审核接口升级成多模态了,现在能同时看文字和图片

OpenAI 在 9 月 26 日上线了新的审核模型 omni-moderation-latest,基于 GPT-4o,所有开发者都能免费用。它最大的变化是能审图片了,覆盖暴力、自残、色情这 6 个子类,不过色情类里涉及未成年人的图片暂时还审不了。文字审核新增了“违法”和“违法/暴力”两个类别,比如“怎么偷东西”这种教人干坏事的提示词会被抓出来。多语言...

推荐理由:OpenAI 官方开发者产品更新,HKR 里 K 和 R 都站得住:新模型加了风险类别、图像子类,还给出 40 种语言平均提升 42% 的具体数字,多语言审核能力明显增强。R 也成立,因为审核和合规直接卡应用上线的脖子,免费开放意味着团队可以零成本试用。H 偏弱,就是个功能迭代,没什么戏剧性,所以整体放在 featured 的低位。

2024年9月12日星期四

OpenAI News

OpenAI 推出 o1-mini,一个专攻数理和编程、成本比 o1-preview 低 80% 的推理模型

o1-mini 是 OpenAI 在 2024 年 9 月 12 日发布的小号推理模型,先开放给 Tier 5 API 用户和付费 ChatGPT 用户。它最大的卖点是便宜:API 调用成本只有 o1-preview 的两成。性能上,它专攻 STEM 推理,在 AIME 数学竞赛里拿到 70.0% 的正确率(约 11/15 题,全美前 500 名水平)...

推荐理由:OpenAI 发了一个实打实的模型,不是概念稿,所以必须写。钩子在于便宜 80% 还能接近 o1 的推理分,数字够硬(AIME 70.0%、Codeforces 1650),而且它明确告诉你:STEM 行,非 STEM 只跟小模型差不多,开发者看完就知道该不该切过去。

2024年8月20日星期二

OpenAI News

OpenAI 开放 GPT-4o 微调,训练费每百万 token 25 美元,9 月 23 日前每天送 100 万免费额度

OpenAI 把 GPT-4o 的微调权限开放给所有付费开发者了。训练价格是每百万 token 25 美元,用微调后的模型跑推理,输入每百万 token 3.75 美元,输出每百万 token 15 美元。到 9 月 23 日为止,每个组织每天能免费拿到 100 万训练 token。官方说,几十条样本就能让模型在特定任务上听话不少,比如调整回答风格、遵...

推荐理由:OpenAI 这次给 GPT-4o 开放微调,不是画饼,是直接上线了。我会先打个折:免费额度只到 9 月 23 号,每天 100 万 token,够你跑个小实验但别指望白嫖大项目。训练每百万 token 25 美元,推理输入 3.75、输出 15,价格不算低,但比从头训模型省事太多。真正值得盯的是两个外部团队的成绩——Cosine 在 SWE-bench Verified 上刷到 43.8%,Distyl 在 BIRD-SQL 上拿到 71.83%,说明微调后的 GPT-4o 在代码和 SQL 场景确实能打。正文没披露这两个微调具体用了多少数据、什...

2024年8月6日星期二

OpenAI News

OpenAI 给 API 加了“结构化输出”,让模型按你给的 JSON 模板回话

OpenAI 在 2024 年 8 月 6 日上线了 Structured Outputs 功能,模型能严格按开发者提供的 JSON Schema 输出,不再只是生成合法 JSON 就完事。新模型 gpt-4o-2024-08-06 在复杂 schema 测试里拿了 100% 的准确率,而老模型 gpt-4-0613 不到 40%。用法上,在函数调用里...

推荐理由:我会先打个折,这不是新模型发布或公司级大事件,但把 JSON 模式从“输出合法 JSON”升级到“严格匹配你的 schema”,并且给出 100% 对不到 40% 的评测对比,对天天跟解析错误搏斗的开发者来说太解渴了。约束解码加模型训练这套组合拳,比旧版 JSON mode 靠谱得多,直接拉高了工具调用的下限。84 分给的是一个高价值的 API 能力更新,不是行业地震,但够实用。

2024年7月25日星期四

OpenAI News

OpenAI 发布 SearchGPT 原型,把实时搜索塞进聊天框里

OpenAI 在 7 月 25 号开始小范围测试 SearchGPT,一个临时上线的 AI 搜索原型。它直接用对话形式返回带实时信息的答案,每条信息都附有内联的出处标注,侧边栏还会列出更多来源链接,方便你点进去核实。这个原型目前只开放给一小部分用户和出版商试用,目的是收集反馈。官方明确说这只是个过渡产品,未来会把好用的功能整合进 ChatGPT 里。正...

推荐理由:我会先打个折:正文没披露模型名、规模、商用时间,所以没法往 90 以上打。但 OpenAI 拿一个带实时网页回答和出版商参与的独立搜索原型出来测试,当天就该写。它用文内引用和侧边栏来源链接解决了一部分可信度问题,连续追问也让搜索更像对话,这些点从业者会关心。不过别太激动,它只是个临时原型,最终要融进 ChatGPT,现在更像 OpenAI 在试探搜索边界和出版商关系。

2024年7月23日星期二

Hugging Face 博客

Llama 3.1 发布:405B、70B、8B 三个尺寸,主打多语言和长上下文

Meta 在 Hugging Face 上放出了 Llama 3.1,一共三个尺寸:8B、70B 和 405B。8B 适合在消费级显卡上跑,70B 给大规模 AI 应用,405B 主要用来做合成数据、让模型当裁判或者蒸馏小模型。每个尺寸都有基础版和指令微调版。这次还多了两个安全模型:Prompt Guard 是个小分类器,用来检测提示注入和越狱攻击;L...

推荐理由:Meta 的 Llama 3.1 是开源阵营的旗舰更新,标题已经把三个参数规模和两个关键能力点出来了。我会先打个折:正文没披露上下文窗口到底多长、支持哪些语种、许可是不是真开放可商用,也没给任何基准跑分,所以信息缺口不小。真正值得盯的是 405B 能不能免费用、长上下文推理实际要烧多少钱。这些没公布之前,分数先卡在 85-94 这个区间的低位。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

OpenAI News

OpenAI 给企业版 ChatGPT 加了合规 API 和自动管人工具

OpenAI 在 2024 年 7 月 18 日推出了企业合规 API,让公司能导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,主要给金融、医疗、法律这些强监管行业做审计和归档用。同时接入了 Forcepoint、Microsoft Purview、Netskope 等八家第三方合规厂商,方便做数据防泄漏和法务留存。用户管理方面,SCIM 自动...

推荐理由:OpenAI 给 ChatGPT Enterprise 加了合规 API、8 个第三方合规集成和 SCIM 用户管理,主要解决企业审计和账号管控的落地问题。我会先打个折:文章没展开“Expanded GPT controls”的具体细节,这部分只能先当占位。能确认的是,API 可以导出带时间戳的对话、文件、GPT 配置、记忆和用户记录,对接了 Okta、Microsoft Entra ID、Google Workspace 和 Ping,对需要过合规审计的团队来说,省了自己拼积木的功夫。

2024年5月13日星期一

OpenAI News

OpenAI 把 GPT-4o 和更多工具开放给免费用户了

OpenAI 宣布免费版 ChatGPT 也能用上最新的旗舰模型 GPT-4o,同时还会逐步解锁联网搜索、数据分析画图表、上传文件、聊照片、用 GPTs 商店和记忆功能。GPT-4o 在文字、语音和图片理解上都比前代更快,但免费用户有使用次数限制,用完了会自动切回 GPT-3.5。付费的 Plus 用户消息额度是免费用户的 5 倍,还能抢先体验新的实时...

推荐理由:这条消息分量很重,OpenAI 把 GPT-4o 塞进免费套餐,等于重新划了免费 AI 工具的天花板。我会先打个折,因为正文是空的,工具清单、配额、地区、上线节奏全都没披露,实际落地效果还得看后续细节。但光是这个信号就够从业者紧张一阵了,所以分数给到 90,没拉满是因为信息缺口太大。

2024年4月24日星期三

OpenAI News

GPT-4 API 全面开放,旧版补全模型半年后下线

OpenAI 宣布 GPT-4 API 向所有付费开发者开放,同时给旧版 Completions API 模型判了死缓:2024 年 1 月 4 日起,ada、babbage、curie、davinci 等老模型将彻底停用,用户需要迁移到新的替代模型上。官方推荐大家转向 Chat Completions API,说现在 97% 的 GPT API 用量...

推荐理由:这是一次有分量的 OpenAI 平台更新,HKR 的 K 和 R 都很扎实:GPT-4 API 全面开放叠加 Completions 旧模型弃用,对开发者是立刻要面对的事。没给 p1 是因为正文是空的,开放范围、截止日期、受影响模型名单全没披露,实际影响还得等细节。

2024年2月13日星期二

OpenAI News

ChatGPT 加上了记忆功能,能跨对话记住你的偏好,你也可以随时关掉或让它忘掉

OpenAI 给 ChatGPT 加了一个记忆功能,不再每次对话都像第一次见面。它会记住你主动告诉它的事,也会自己从聊天里抓取细节,比如你喜欢的会议纪要格式、你开的咖啡店、你家小孩喜欢水母。这些记忆会跨对话保留,用越多越懂你。控制权在你手里:可以在设置里关掉整个记忆,也可以直接对话让它忘掉某件事,或者用临时对话模式完全不记。正文提到免费和付费用户都在小...

推荐理由:OpenAI 官方发了个标题,说 ChatGPT 要有记忆和新控制项,但正文是空的。我会先打个折:记忆能让 ChatGPT 记住你的偏好和上下文,用久了会更顺手,这点挺抓人。可真正该盯的是控制机制——用户能不能随时关掉、能不能按会话或按话题设权限,这些全没披露。没有这些信息,标题里的“新控制项”还只是一句口号,产品影响暂时没法判断。

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

推荐理由:这是一次实打实的 OpenAI 产品更新:标题确认了视觉输入、语音输入和语音输出,所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价,我会先打个折,停在 88 分而不是拉满。别被标题骗了,真正要盯的是语音延迟、视觉理解边界和调用入口。