跳到正文

模型发布

新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。

最新精选

第 1–20 条 · 共 88 条

今天 · 9月30日星期三

AI HOT 精选 · 模型

GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分

GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。

推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。

AI HOT 精选 · 模型

OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use

OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。

推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其在智能体编码与 computer use 上的能力升级及缓存输入定价。

TechCrunch · AI

OpenAI 发布 GPT-6.1 Sol,称接近 GPT-6 Astra 且价格更低

OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra 的智能水平,标准输入输出 token 价格仅为后者的五分之一。

推荐理由:读者可了解 GPT-6.1 Sol 在智能体编码与事实准确性上的具体提升,以及 GPT-6.1 Astra 因安全顾虑被搁置的背景。

The Decoder

OpenAI 发布 GPT-6.1 Sol,以五分之一成本接近 Astra

OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近因安全问题未按计划发布的旗舰模型 GPT-6.1 Astra,成本约为后者的五分之一。

推荐理由:原文给出 Sol 与 Astra、Opus 5.5 的定价和多项基准对比,可据此判断低价替代方案的能力边界。

昨天 · 9月29日星期二

OpenAI News

OpenAI 发布 GPT-6.1 Sol 模型

OpenAI 发布 GPT-6.1 Sol,定位为面向编码、计算机操作和专业工作的接近 Astra 级智能。其标准 API 输入与输出 token 价格为 Astra 的五分之一。

推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其面向编码与计算机操作的能力定位及定价变化。

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

8月12日星期三

Google DeepMind

Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,可据此判断手语翻译进入消费级产品的可行边界。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

6月10日星期三

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

6月9日星期二

AI HOT 精选

Cohere 发布 North Mini Code:一个 30B 参数、每次只用 3B 的开源代码模型

Cohere 在 Hugging Face 上开源了 North Mini Code,采用 Apache 2.0 协议。这是一个 30B 参数的混合专家模型,每次推理只激活 3B 参数,专门为让模型在终端里自主写代码、修 bug 这类任务设计。在 SWE-Bench Verified 上,它的 pass@10 跑到了 80.2%,在 Artificia...

推荐理由:HKR-H 来自一个紧凑的 MoE 编码模型加上一个亮眼的 SWE-Bench 成绩;HKR-K 有参数、协议、上下文和基准数据。Cohere 不是前沿实验室,所以这个发布放在 78-84 分的开源编码模型区间比较合适。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。

推荐理由:原文给出模型的语言覆盖、实时翻译机制与多产品上线节奏,可据此判断语音翻译的可用边界。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

6月8日星期一

AI HOT 精选

高德发布 ABot-Earth0.5,用一张卫星图 10 分钟就能生成 3D 城市

高德搞了个叫 ABot-Earth0.5 的模型,号称是全球第一个原生 3D 的城市世界模型。它已经覆盖了 190 多个国家和地区。用起来很简单,你扔给它一张卫星图或者一段文字描述,它就能在普通消费级显卡上,大概 10 分钟给你生成一大片公里级的 3D 城市场景。出来的素材是 3DGS 格式,能直接拖进 Unity、虚幻引擎这些软件里接着用。按他们算的...

推荐理由:高德这个ABot-Earth0.5把3D城市生成的门槛压得很低:消费级显卡、10分钟、公里级、直接出可编辑资产。我会先打个折,正文没披露生成精度和几何一致性有多高,也没给实际案例对比,所以“全球首个原生3D城市世界模型”这个说法先别太激动。但即便只做到七八成,对需要大量3D场景的团队来说也挺省钱。H/K/R三条都踩实了,重要性给80合理。

6月7日星期日

r/LocalLLaMA

Cohere 把还没发布的编程模型 BLS-Mini-Code-1.0 先丢给 LocalLLaMA 社区测试了

Cohere 的员工 Nick Frosst 在 Reddit 上给 LocalLLaMA 社区开了个后门,提前放出还没正式发布的编程模型 BLS-Mini-Code-1.0,权重已经挂在 Hugging Face 上了。这个模型总参数量 30B,但每次推理只激活 3B 参数,属于稀疏模型,跑起来对硬件要求会低一些。Cohere 说它的 token 输...

推荐理由:HKR 三项都踩中了:Cohere 员工私下给社区塞未发布模型,这事本身就有点独家;30B 总参数只激活 3B 的稀疏设计,对本地跑模型的人很友好,硬件要求直接打折。不过信息来自 Reddit 帖子,正文没披露评测成绩、许可证和训练细节,所以先别太激动,给个低 featured 档位刚好。

6月6日星期六

AI HOT 精选

OpenCV 5 发布,换了一套能跑大模型的神经网络引擎

OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...

推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。

AI HOT 精选

Google AI 本周连发六弹:笔记本能跑的多模态模型、帮你读论文的科研助手、还有开源实时音乐模型

Google AI 这周一口气更新了六样东西。Nano Banana 2 和 Pro 版正式上线,走 Gemini 企业平台、API 和 AI Studio 就能用。Co-Scientist 是一个多智能体系统,专门帮科研人员自动生成和优化新假设,相当于有个助手帮你读文献、想点子。Google Labs 出了个 dreambeans,会扒你的 Goog...

推荐理由:HKR 三项都踩中了:帖子一口气打包了 Google AI 六个更新,本地部署和开源这两个点对从业者很实在。正文没给基准测试、授权条款和定价细节,所以分数卡在 76,没往上走。

6月5日星期五

AI HOT 精选

Google 开源了实时音乐模型 MRT2,在 MacBook 上延迟不到 200 毫秒

Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...

推荐理由:HKR 三项都过:Google Magenta MRT2 有实打实的实时音频钩子、开放权重和低于 200ms 的本地延迟。对创意 AI 开发者吸引力很强,但本质上是一封公开信和政策诉求,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高一级。

6月4日星期四

AI HOT 精选

Ideogram 4.0 开源,跑分自称全球最强,文字渲染和排版控制是亮点

Ideogram 发布了 4.0 版本,一个 93 亿参数的开源文生图模型。它把文字和图像信息放在同一条处理流水线上(单流 DiT 架构),并用了 Qwen3-VL-8B 当文本编码器。最突出的能力是能在图里准确写出长段文字,适合做海报和封面。另外,它训练时让模型理解了元素的位置关系,你用提示词就能指定版式和对象布局。在 DesignArena 的人工...

推荐理由:Ideogram 4.0把9.3B参数的文生图模型开源了,架构是单流DiT,在DesignArena人类偏好排名里拿了第4。我会先打个折——正文没披露训练数据规模和具体推理成本,所以实际部署的性价比还不好算。但一个开源模型能在人类评价里挤进前排,说明图像生成的质量门槛又在往下掉,对做应用的人来说是个省钱信号。

AI HOT 精选

Miso One 开源了一个 8B 参数的语音模型,克隆声音只需一小段样本,延迟 110 毫秒

Miso One 放出了一个 8B 参数的开源 TTS 模型,主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms,对实时对话场景算可用。模型权重直接挂在 GitHub 上,你可以自己部署,音频数据不用上传到第三方服务器。官方说 API 之后会出,但正文没提价格和上线时间。

推荐理由:我会先打个折:这是单条推文来源的发布,没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬,放在featured刚好,再往上就缺验证了。