跳到正文

#多模态

今日 1 条

2025年8月6日星期三

OpenAI News

OpenAI 用 1 美元把 ChatGPT Enterprise 卖给整个美国联邦政府,为期一年

OpenAI 和美国总务管理局(GSA)谈成了一笔象征性收费的买卖:接下来一年,联邦行政分支的机构只要付 1 美元,就能给全员开通 ChatGPT Enterprise。另外还白送 60 天不限量使用高级功能,包括 Deep Research(深度研究)和 Advanced Voice Mode(高级语音模式)。联邦业务数据不会被拿去训练模型。公告里没...

推荐理由:OpenAI 跟 GSA 签的这个单子,相当于用 1 美元把 ChatGPT Enterprise 铺进整个联邦行政系统,为期一年,还白送 60 天不限量用高级功能。我会先打个折:这更像是一次性打通政府采购渠道,不是常规促销。正文没写覆盖多少机构、预算盘子多大、具体哪些模型能用,所以别急着算账。但如果是真的,分发效率确实省了一大笔力气,企业数据也不拿来训练,合规上说得过去。

2025年8月1日星期五

Mistral AI

Mistral 通过微调 Pixtral-12B 提升卫星图像视觉语言模型性能

Mistral 用 LoRA 微调 Pixtral-12B,在 Aerial Image Dataset(AID)卫星图像分类任务上显著优于基座模型。微调通过 Mistral 微调 API 或 LaPlateforme UI 完成,无需大量超参数调优,仅需少量精选样本即可减少基座模型在模糊类别上的误判与幻觉标签。

2025年7月17日星期四

Mistral AI

Mistral 为 Le Chat 推出 Deep Research、语音模式等新功能

Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言思考模式、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。

推荐理由:Mistral 官方一次性公布 Le Chat 五项新功能,读者可据此了解其研究、语音与图像编辑能力的组合方式。

2025年6月1日星期日

OpenAI News

OpenAI 封禁一批中国账号,用 ChatGPT 生成美国对立内容但几乎没人看

OpenAI 根据 Meta 的线索,封掉了一批来自中国的 ChatGPT 账号,内部代号叫“Uncle Spam”。这些账号主要干三件事:一是生成支持和反对关税的帖子,在 X 和 Bluesky 上同时发,故意挑动对立情绪;二是用 AI 生成“退伍军人”之类的假头像,冒充美国老兵批评现任政府;三是让模型写代码去扒 X 和 Bluesky 的用户资料,...

推荐理由:OpenAI 根据 Meta 的线索端掉了一批中国 ChatGPT 账号,代号“Uncle Spam”。文章把具体操作摊开了:用 AI 在 X 和 Bluesky 上同时发正反两种关税帖子,故意制造对立;生成“退伍军人”假头像冒充美国老兵骂现任政府;还让模型写代码去扒两个平台的用户资料。这些细节让事件从“又抓了一批号”变成了一个可拆解的操作案例。我会先打个折,因为这不是产品更新或模型发布,而是一次安全事件通报,所以分数落在值得推荐的区间里。

2025年5月8日星期四

OpenAI News

OpenAI 在亚洲四国上线数据本地存储,但没提推理环节是否也留在本地

OpenAI 宣布在日本、印度、新加坡和韩国为 ChatGPT 企业版、教育版和 API 平台提供数据本地存储。企业可以把聊天记录、上传文件和图片等数据存在当地,满足数据主权要求。API 客户需要新建项目并选择国家,企业版和教育版则是在创建新工作区时设置。官方列了加密标准(AES-256 和 TLS 1.2+)、默认不用客户数据训练模型等安全措施。但有...

推荐理由:OpenAI 给亚太四国开了数据驻留,企业版、教育版和 API 都能把对话、上传文件这类静态内容存在本地。这对被数据主权卡脖子的采购方是个实打实的进展。但我会先打个折:正文只说了“静态存储”,没提推理计算是不是也全程不出境,这点先别太激动。

2025年5月7日星期三

Mistral AI

Mistral AI 发布 Mistral Medium 3,主打低成本与企业部署

Mistral AI 发布 Mistral Medium 3,称其在各项基准上达到或超过 Claude Sonnet 3.7 的 90%,成本为每百万 token 输入 $0.4、输出 $2。

推荐理由:Mistral Medium 3 以更低成本对标 Claude Sonnet 3.7,并给出企业私有化部署与定制路径。

2025年4月23日星期三

OpenAI News

OpenAI 把 ChatGPT 里那个生图模型做成 API 了,叫 gpt-image-1

4 月 23 号,OpenAI 把 ChatGPT 里那个一周就帮 1.3 亿用户生了 7 亿张图的模型,包装成 gpt-image-1 放到了 API 里,让开发者可以直接在自己的工具里调用。计费按 token 算:你输入的提示词每 100 万 token 收 5 美元,喂给模型的图片每 100 万 token 收 10 美元,模型吐出来的图每 10...

推荐理由:OpenAI 把 ChatGPT 的图像模型搬进 API,并公开了 token 计价和默认不训练 API 数据的政策。对开发者来说,这不再是“看别人玩”,而是可以自己接入、算账、评估合规风险了。我会先打个折:首周 7 亿张图更多是 ChatGPT 端的热度,API 侧的实际表现还得看延迟和稳定性,正文没披露这些。但定价结构清晰,低分辨率方图约 0.02 美元一张,高分辨率约 0.19 美元,加上 C2PA 元数据这个动作,说明他们在为商用场景铺路。综合来看,当天值得放进 p1。

2025年4月16日星期三

OpenAI News

OpenAI 发布 o3 和 o4-mini:推理模型学会自己调用工具了

OpenAI 在 4 月 16 日推出了 o3 和 o4-mini 两个新模型。o3 是目前最强的推理模型,在编程、数学和视觉任务上刷新了多项基准,外部专家评估其重大错误比 o1 少了 20%。o4-mini 则主打快速和低成本,在 AIME 2025 数学竞赛中,配合 Python 解释器使用,单次答题正确率达到 99.5%,八次投票后正确率 100...

推荐理由:P1 没问题。OpenAI 这次把推理模型和工具调用绑在一起发布,不是单纯刷榜,而是改了 ChatGPT 的默认行为。o3 减错、o4-mini 接近满分这两组数字有信息量,虽然正文没披露评测设置细节,但已经够让从业者关注。HKR 三项都踩中,我会先打个折——基准测试的对比条件没完全展开,但整体判断站得住。

OpenAI News

OpenAI 的 o3 和 o4-mini 现在能直接在推理链里“想”图片了

OpenAI 在 4 月 16 日说,o3 和 o4-mini 这两个模型学会了一项新本事:它们不再只是“看”图片,而是能在内部推理时直接对图片做裁剪、缩放、旋转等操作,整个过程不依赖外挂的视觉模型。这意味着模型可以自己把倒过来的字转正再读,或者放大图片里的细节来找线索。文章举了例子,o3 花了 20 秒读出一张倒置手写笔记的内容,又用了 1 分 44...

推荐理由:OpenAI 这一步不是简单加视觉功能,而是让推理模型把图像操作并入同一条思考链,所以 HKR 三项都成立。我没给更高分,因为正文只给了演示耗时,没披露基准测试的具体分数和铺开范围,这点先别太激动。

2025年3月25日星期二

OpenAI News

OpenAI 把图像生成直接塞进了 GPT-4o,能边聊边改图,文字也终于不崩了

3 月 25 号,OpenAI 把新的图像生成功能做进了 GPT-4o 模型里,不再是外挂一个单独的画图工具。核心变化是模型直接学了图片和文字的联合分布,走的是“文本 token → transformer → 扩散模型 → 像素”这条管线,所以它能读懂上下文,也能在聊天里多轮改图,保持角色、风格一致。最实用的提升是文字渲染:路牌、菜单、邀请函上的字终...

推荐理由:这次更新把图像生成直接塞进 GPT-4o 本体,不是接个 DALL·E 插件。核心看点不是画得有多美,而是两点:一是文字渲染准不准,二是多轮改图能不能保持一致性——比如改完背景,人物别跟着变脸。正文给了机制线索,transformer 先理解意图,diffusion 再出像素,中间有联合训练撑着,但没给具体架构和训练数据量。示例里反复出现 best of 1 和 best of ~8,说明模型内部会多采样再挑图,实际出图质量可能比单次采样稳,但延迟和算力成本也会上去。价格、API 开放时间和调用配额正文都没提,这点先别太激动。整体看,这是一次把多模...

OpenAI News

OpenAI 发布 GPT-4o 图像生成系统卡附录,说明新能力与边际风险

OpenAI 在 2025 年 3 月 25 日给 GPT-4o 的系统卡打了个补丁,专门讲 4o 图像生成。这次不是 DALL·E 那套老方案,而是把生图能力直接嵌进 GPT-4o 模型内部,所以它能用上模型已有的知识,出图更贴指令、文字也写得准,还能拿一张图当输入去改。官方说它能出照片级画质,但也承认新能力会带进来一些新风险。具体是哪些风险、怎么量...

推荐理由:这是 OpenAI 官方对 GPT-4o 图像生成能力的补充说明,属于产品能力的一次重要更新。HKR 三项都踩中了:原生出图加稳定文字渲染是个抓人的点,能力事实也够硬,对实际工作流有冲击。但正文没给具体评测分数和缓解措施细节,所以重要性到不了顶格,84 分合理。

2025年3月20日星期四

OpenAI News

OpenAI 发了三款新语音模型:两个听写,一个会学语气说话

OpenAI 在 3 月 20 日往 API 里塞了三个新音频模型:gpt-4o-transcribe 和 gpt-4o-mini-transcribe 负责把语音转成文字,gpt-4o-mini-tts 负责把文字念出来。听写模型在 FLEURS 等多语言基准上跑分比 Whisper v2、v3 都低,低的是词错率,说明在口音重、环境吵、语速快的时候...

推荐理由:OpenAI 在 API 里发了三个音频模型,给了具体的基准和机制细节,所以 HKR 三项都过了,featured 没问题。分数我维持 84,没往上加,因为正文没披露价格、延迟,基准对比也只给了 FLEURS 一个点,信息还不够全。

2025年3月17日星期一

Mistral AI

Mistral AI 发布 Mistral Small 3.1,支持多模态与 128k 上下文

Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能、多模态理解,并将上下文窗口扩展至 128k tokens,推理速度达 150 tokens per second,以 Apache 2.0 许可开源。

推荐理由:官方给出 Mistral Small 3.1 的多模态、128k 上下文与 150 tokens/s 推理数据,可对照同量级小模型判断其定位。

2025年3月12日星期三

Hugging Face 博客

谷歌发布 Gemma 3 系列开源模型,最高 270 亿参数,能看图、懂 140 多种语言

Gemma 3 是谷歌最新放出的开放权重模型,有 1B、4B、12B、27B 四个尺寸。4B 及以上的版本能同时处理图片和文字,支持超过 140 种语言,上下文窗口拉到 128k token(1B 是 32k)。官方说 4B 的指令版在跑分上能打赢上一代 27B,27B 则超过了 Gemini 1.5 Pro。模型已经挂在 Hugging Face 上...

推荐理由:标题信息量不小,但正文为空,我会先打个折。Google 新 Gemma 本身自带关注度,多模态和长上下文这两个点又正好打在本地部署和模型选型的痛点上,所以 H 和 R 都站得住。K 完全拿不到分,因为参数、上下文窗口、许可证、基准成绩一概没披露,现在只能当个预告看,不能当评测结论用。整体放在 featured 低位是合理的,等模型卡或技术报告出来再重新判断。

2025年3月7日星期五

Mistral AI

Mistral AI 发布文档理解 OCR API Mistral OCR

Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序输出交错的文本与图像,并理解表格、公式、LaTeX 等复杂版式。

推荐理由:官方给出 Mistral OCR 的基准对比、多语言表现与定价,可据此判断文档解析在 RAG 流程中的可用性。

2025年2月6日星期四

OpenAI News

OpenAI 在欧洲推出数据本地存储选项

OpenAI 给 API、ChatGPT 企业版和教育版加了欧洲数据驻留功能。新开的 API 项目可以选欧洲区处理请求,OpenAI 不留存请求和回复数据;新开的企业/教育版工作区可以把对话、文件、图片等内容静态存储在欧洲。但公告没列出具体哪些 API 接口支持这个功能,已有的项目也没法改成欧洲区,这点要注意。

推荐理由:OpenAI 给欧洲开了个数据驻留选项,API 新建项目可以选欧洲区域处理请求,而且不留数据;ChatGPT Enterprise 和 Edu 新建工作区能把对话和上传文件静态存在欧洲。我会先打个折——现有项目不能迁移,这点挺要命的,别一激动就当全量可用。正文没列出具体哪些接口支持,实际覆盖范围还得自己测。对要过欧盟合规关的团队来说,零保留加区域存储是实打实的进展,但落地限制不少,先看清楚再动手。

2025年1月28日星期二

OpenAI News

OpenAI 给美国政府做了个专用版 ChatGPT,叫 ChatGPT Gov

OpenAI 在 2025 年 1 月 28 日发布了 ChatGPT Gov,专门给美国联邦、州和地方机构用。这个版本可以部署在机构自己的微软 Azure 商业云或政府云上,让 IT 部门自己管安全、隐私和合规,比如满足 IL5、CJIS、ITAR 和 FedRAMP High 这类严格的安全框架。功能上跟企业版差不多:能用 GPT-4o 模型,支持...

推荐理由:这是一次包装和部署层面的发布,不是模型能力的大跳跃,但附带了实打实的采用数据。OpenAI把ChatGPT打包成符合美国政府安全要求的版本,跑在Azure政府云上,直接瞄准IL5、CJIS这类合规门槛。我会先打个折:正文没披露定价、具体哪些机构在用、以及实际部署后的性能或安全审计结果。但3500多家机构、9万用户、1800万条消息这些数字本身就有说服力,说明政府侧需求真实存在。所以给featured而不是p1,因为这不是前沿模型突破,而是产品化和渠道动作,但信息密度和信号强度都够。

2025年1月23日星期四

OpenAI News

OpenAI 发布 Operator 系统卡:一个能替你操作电脑的智能体,但高风险操作会强制让人确认

OpenAI 在 2025 年 1 月 23 日公开了 Operator 的安全评估报告。Operator 是一个能看懂屏幕截图、像人一样点击按钮和菜单的电脑操作智能体,底层结合了 GPT-4o 的视觉能力和强化学习训练出的推理纠错能力。它能帮你在浏览器里订菜、买票、填表,但也会引入新风险,比如被第三方网页里的恶意指令误导(提示注入攻击),或者自己操作...

推荐理由:这篇系统卡不是产品发布稿,而是安全说明书,但信息密度够高。我会先打个折:它只是 Operator 的配套文件,不是主产品公告,所以 featured 定位合理。真正值得看的是两件事:一是 OpenAI 把部署门槛定在缓解后 Medium 以下,这等于公开承诺了一个可验证的安全基线;二是高风险任务的处理很具体——金融交易、发邮件、删日程需要关键步骤确认,买卖股票直接封死。这些细节比泛泛的“安全第一”有用得多。说服力评 Medium 也值得留意,说明模型在影响人的决策上已经有一定能力,但还没到高危。整体事实清楚,没有发现错误或过时信息,对从业者判断 C...

OpenAI News

OpenAI 发布能直接操作电脑的智能体 CUA,先在美国给 Pro 用户用

OpenAI 在 2025 年 1 月 23 日放出了一个研究预览版智能体,叫 CUA(Computer-Using Agent)。它把 GPT-4o 的视觉能力和强化学习训出来的推理能力揉在一起,不看代码接口,直接像人一样看屏幕截图、用虚拟鼠标键盘来操作图形界面。在 OSWorld 这类模拟真实电脑操作的测试里,它拿了 38.1% 的成功率,比之前最...

推荐理由:OpenAI 当天发布的 agent 产品,CUA 模型驱动 Operator,先推给美国 ChatGPT Pro 用户。HKR 三项全中:GUI 操控这个切入点本身就够新,文章给了机制和具体跑分,而且它把“自主干活 vs 人盯着”这个行业纠结的点直接拎了出来。

OpenAI News

OpenAI 发布 Operator:一个能自己打开浏览器帮你干活的研究预览版

Operator 是一个能自己操控浏览器的 AI 代理,可以看网页、点击、打字、滚动,帮你填表、买菜、做 meme。它背后是一个叫 CUA 的新模型,把 GPT-4o 的视觉能力和强化学习推理结合起来,直接操作屏幕上的按钮和菜单,不需要对方网站提供 API。遇到登录、付款、验证码,它会主动把控制权交还给你,不会偷看或截图这些敏感信息。目前只开放给美国 ...

推荐理由:OpenAI 的 Operator 是当天必写的产品发布:一个浏览器 agent 让 ChatGPT 从动嘴变成动手。HKR 三项全中——钩子强、有技术框架但缺基准分、踩中 agent 核心趋势。我会先打个折:正文没披露具体 benchmark 分数,而且目前只限美国 Pro 用户,登录、支付和验证码还得人接手,这些限制让它的实际可用范围打了问号。

2024年12月9日星期一

OpenAI News

OpenAI 把 Sora 视频生成模型正式上线,推出更快的 Sora Turbo 版本

OpenAI 在 12 月 9 日结束了 Sora 的研究预览,直接把它做成了一个独立产品,给 ChatGPT Plus 和 Pro 用户用。新版本叫 Sora Turbo,生成速度比二月份展示的快了不少。Plus 用户每月能免费生成最多 50 个 480p 视频,或者少一些的 720p 视频;Pro 用户用量是 10 倍,还能出更高分辨率和更长的片子...

推荐理由:Sora 正式上线,从预览变付费,HKR 三项都踩中了:上线本身有话题性,规格和限制写得清楚,对创作者工作流有直接影响。没给更高分是因为文章自己就说了地区封锁、人物上传受限,物理一致性和长动作还不稳,这些限制让实际可用性打了折扣。

2024年10月23日星期三

OpenAI News

OpenAI 把一致性模型简化并扩展到 15 亿参数,两步出图,质量追平扩散模型

OpenAI 发了个新方法叫 sCM,把连续时间一致性模型的训练搞稳定了,直接扩到 15 亿参数,在 512×512 的 ImageNet 上跑。它只用两步采样,出图质量就能跟现在最好的扩散模型打平,单张 A100 上 0.11 秒出一张图,比扩散模型快大约 50 倍。论文里对比了有效算力,sCM 花不到 10% 的算力就拿到差不多的 FID 分数。不...

推荐理由:这篇论文把连续时间一致性模型真正做大了,15 亿参数在 ImageNet 512×512 上跑通,两步采样就能拿到跟扩散模型差不多的样本质量,墙钟速度快了大约 50 倍。单张 A100、batch size=1、没做推理优化时 0.11 秒出一张图,这个数对实际部署有参考价值。我会先打个折:正文没披露跟其他快速采样方案(比如蒸馏模型)的直接对比,也没说训练用了多少算力,所以“快 50 倍”是跟谁比、代价多大,还得看后续细节。但能把快采样和大规模训练同时稳住,本身就是一个信号,说明这条路在工程上开始走得通了。

2024年10月1日星期二

OpenAI News

OpenAI 发布 Realtime API 公测版,让开发者直接调用 GPT-4o 做低延迟语音对话

OpenAI 在 2024 年 10 月 1 日推出了 Realtime API 的公测版,所有付费开发者都能用。这个接口通过一个持久的 WebSocket 连接,把音频直接流式传给 GPT-4o,再流式返回语音,省掉了以前那种“先转文字、再生成回复、最后转语音”的串联流程。好处是延迟更低,能保留语气和重音,还能自动处理用户插话。API 支持函数调用,...

推荐理由:OpenAI 把语音交互从多模型拼接改成一条 WebSocket 直连 GPT-4o,延迟和打断处理都内建了,还给了函数调用和明确定价。对做实时语音 agent 的开发者来说,这是可以直接动手试的东西,不是概念稿。我会先打个折:公测阶段稳定性、实际延迟和成本还没大规模验证,但信息量和可操作性已经足够当天写。

OpenAI News

OpenAI 给 GPT-4o 开放了图像微调,开发者可以拿图片和文字一起训练模型了

OpenAI 在 2024 年 10 月 1 日上线了 GPT-4o 的图像微调功能,付费开发者现在能上传图片加文字的数据集来定制模型。最少 100 张图就能看到效果,图越多、数据量越大,提升越明显。Grab 用 100 个样本训练后,车道数量识别准确率提高了 20%,限速标志定位准确率提高了 13%;Automat 把桌面 RPA 机器人的任务成功率...

推荐理由:OpenAI 把视觉微调塞进了正式 API,门槛低到 100 张图,还给了两个有数字的客户案例,HKR 三项都踩实了。对做具体业务的人来说,这比发新模型更直接——能用自己的图片数据把模型掰成自己想要的形状。不过定价那段正文截断了,实际成本还得自己算,这点先别太激动。整体影响面不如旗舰模型发布那么大,但实用度很高,所以重要性给 84、放 featured 是合理的。

2024年9月26日星期四

OpenAI News

OpenAI 把内容审核接口升级成多模态了,现在能同时看文字和图片

OpenAI 在 9 月 26 日上线了新的审核模型 omni-moderation-latest,基于 GPT-4o,所有开发者都能免费用。它最大的变化是能审图片了,覆盖暴力、自残、色情这 6 个子类,不过色情类里涉及未成年人的图片暂时还审不了。文字审核新增了“违法”和“违法/暴力”两个类别,比如“怎么偷东西”这种教人干坏事的提示词会被抓出来。多语言...

推荐理由:OpenAI 官方开发者产品更新,HKR 里 K 和 R 都站得住:新模型加了风险类别、图像子类,还给出 40 种语言平均提升 42% 的具体数字,多语言审核能力明显增强。R 也成立,因为审核和合规直接卡应用上线的脖子,免费开放意味着团队可以零成本试用。H 偏弱,就是个功能迭代,没什么戏剧性,所以整体放在 featured 的低位。

2024年8月8日星期四

OpenAI News

GPT-4o 系统卡:语音响应快过人类,但声音安全是最大隐患

OpenAI 在 8 月 8 号发了 GPT-4o 的系统卡,把安全底牌摊开来看。这个模型能直接吃文本、音频、图片和视频,输出也一样,最快 232 毫秒就能回话,平均 320 毫秒,跟人聊天反应速度差不多。API 价格比 GPT-4 Turbo 便宜一半。在 OpenAI 自己的安全框架里,网络安全、生物威胁、模型自主性三项风险都是低,说服力这项擦边踩...

推荐理由:这不是一篇例行公事的发布。它把 preparedness 四类风险评级、232 毫秒语音延迟和明确的部署门槛都摆出来了。HKR 三项全中,但本质是安全披露而非新模型或重大产品发布,所以放在 featured 而不是 p1。

2024年7月23日星期二

Hugging Face 博客

Llama 3.1 发布:405B、70B、8B 三个尺寸,主打多语言和长上下文

Meta 在 Hugging Face 上放出了 Llama 3.1,一共三个尺寸:8B、70B 和 405B。8B 适合在消费级显卡上跑,70B 给大规模 AI 应用,405B 主要用来做合成数据、让模型当裁判或者蒸馏小模型。每个尺寸都有基础版和指令微调版。这次还多了两个安全模型:Prompt Guard 是个小分类器,用来检测提示注入和越狱攻击;L...

推荐理由:Meta 的 Llama 3.1 是开源阵营的旗舰更新,标题已经把三个参数规模和两个关键能力点出来了。我会先打个折:正文没披露上下文窗口到底多长、支持哪些语种、许可是不是真开放可商用,也没给任何基准跑分,所以信息缺口不小。真正值得盯的是 405B 能不能免费用、长上下文推理实际要烧多少钱。这些没公布之前,分数先卡在 85-94 这个区间的低位。

2024年7月18日星期四

OpenAI News

OpenAI 发布 GPT-4o mini,比 GPT-3.5 便宜六成,API 里首次用上指令层级防越狱

OpenAI 在 7 月 18 日推出了 GPT-4o mini,直接替换掉 ChatGPT 里的 GPT-3.5。价格是输入每百万 token 0.15 美元、输出 0.6 美元,比 GPT-3.5 Turbo 便宜了超过 60%。模型跑分还行,MMLU 82 分、HumanEval 87.2 分,都压过 Gemini Flash 和 Claude ...

推荐理由:这不是小修小补,GPT-4o mini 带着新定价、长上下文、明确的基准成绩和一套新的安全机制出来,直接替掉 GPT-3.5,对开发者的钱包和安全方案都有实际影响。HKR 三项全中,放在 P1 没问题。

2023年9月25日星期一

OpenAI News

ChatGPT 现在能看、能听、能说话了

OpenAI 给 ChatGPT 加了语音和图片功能。语音部分,你对着手机说话它能回你,背后用了一个新的文字转语音模型,拿几秒真人录音就能合成很像人的声音,还接入了自家的 Whisper 做语音识别。图片部分,你可以拍照或截图发给它,让它看图说话,底层是 GPT-3.5 和 GPT-4 的多模态版本。这两个功能会先推给 Plus 和 Enterpris...

推荐理由:这是一次实打实的 OpenAI 产品更新:标题确认了视觉输入、语音输入和语音输出,所以 HKR 三项都踩中了。正文没给版本、推送范围、延迟和定价,我会先打个折,停在 88 分而不是拉满。别被标题骗了,真正要盯的是语音延迟、视觉理解边界和调用入口。