跳到正文

#模型发布

今日 5 条

今天 · 9月30日星期三 · 5 条

AI HOT 精选 · 模型

GPT-6.1 Sol 发布 7 天后接替 GPT-6 Sol,智能指数距 GPT-6 Astra 仅 1 分

GPT-6.1 Sol 在发布 7 天后接替 GPT-6 Sol,智能指数比 GPT-6 Astra 低 1 分,价格仍为每百万输入/输出 token 2 美元/10 美元,缓存读取折扣从 90% 升至 95%。

推荐理由:通过智能指数、成本与 token 效率的横向对比,读者可判断 GPT-6.1 Sol 在价格与能力之间的取舍。

AI HOT 精选 · 模型

GPT-6.1 上线 Arena 的 Agent Arena 评测平台

Arena 宣布 OpenAI 的 GPT-6.1 已上线 Agent Arena,用户投票将影响其评估,分数即将公布。Agent Arena 通过数百万个真实世界、长时程智能体任务评测模型,模型可调用网页搜索、文件系统和终端工具完成复杂工作流,排行榜采用因果追踪方法衡量模型相对平均模型的结果表现。

AI HOT 精选 · 模型

OpenAI 发布 GPT-6.1 Sol,强化智能体编码与 computer use

OpenAI 发布 GPT-6.1 Sol,升级了智能体编码和 computer use 能力,接近 Astra 性能。缓存输入定价为标准输入价格的 95% 折扣,模型面向复杂重构、深度代码库调查和跨应用长时间运行的智能体。

推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其在智能体编码与 computer use 上的能力升级及缓存输入定价。

TechCrunch · AI

OpenAI 发布 GPT-6.1 Sol,称接近 GPT-6 Astra 且价格更低

OpenAI 在 DevDay 上发布 GPT-6.1 Sol,称其在智能体编码、计算机使用和专业工作上接近 GPT-6 Astra 的智能水平,标准输入输出 token 价格仅为后者的五分之一。

推荐理由:读者可了解 GPT-6.1 Sol 在智能体编码与事实准确性上的具体提升,以及 GPT-6.1 Astra 因安全顾虑被搁置的背景。

The Decoder

OpenAI 发布 GPT-6.1 Sol,以五分之一成本接近 Astra

OpenAI 发布 GPT-6.1 Sol,称其在智能体编码、电脑操作和办公任务上接近因安全问题未按计划发布的旗舰模型 GPT-6.1 Astra,成本约为后者的五分之一。

推荐理由:原文给出 Sol 与 Astra、Opus 5.5 的定价和多项基准对比,可据此判断低价替代方案的能力边界。

昨天 · 9月29日星期二

OpenAI News

OpenAI 发布 GPT-6.1 Sol 模型

OpenAI 发布 GPT-6.1 Sol,定位为面向编码、计算机操作和专业工作的接近 Astra 级智能。其标准 API 输入与输出 token 价格为 Astra 的五分之一。

推荐理由:OpenAI 发布 GPT-6.1 Sol,读者可了解其面向编码与计算机操作的能力定位及定价变化。

9月25日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型上加入近实时视频生成,实现带唇形同步、自然表情和流畅轮次切换的动态视觉形象。

推荐理由:原文给出 Live Avatar 的实时视频对话能力、异步工具调用与 97 语言支持,可据此判断企业级多模态交互的落地形态。

9月8日星期二

Ben's Bites

OpenAI 发布 GPT-6 系列首个模型 Astra:跑分高但表现不稳定,作者烧了 40 亿 token 说“啥也没造出来”

OpenAI 推出了 GPT-6 系列的第一个模型 Astra。它在 ARC-AGI-3 和 Zapier 的 AutomationBench 上拿了最高分,定价跟 Fable 5.1 一样。但作者周末烧了 40 亿 token(相当于处理了海量文本),觉得“啥也没造出来”,承认可能是自己不会用。Astra 是个“尖刺型”模型——某些任务很强,但不是稳...

8月12日星期三

Google DeepMind

Google DeepMind 发布 SL2T 手语转文本模型,率先落地 Pixel 11 的 Gboard 与 Live Transcribe

Google DeepMind 发布多语言手语转文本模型 SL2T,首次将手语 AI 带入消费级产品,在 Pixel 11 的 Gboard 和 Live Transcribe 中支持美国手语(ASL)转英文听写,后续将扩展更多设备与语言。

推荐理由:原文给出 SL2T 的训练规模、基准成绩与隐私设计,可据此判断手语翻译进入消费级产品的可行边界。

7月21日星期二

Google DeepMind

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和面向安全的 3.5 Flash Cyber 三款新模型。

推荐理由:原文给出三款新模型的定价、token 效率与多项基准对比,可据此判断智能体工作流的成本与选型变化。

7月17日星期五

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Flash Cyber 网络安全模型

Google DeepMind 发布 Gemini 3.5 Flash Cyber,基于 3.5 Flash 微调,用于快速发现、验证和修补漏洞,在 CyberGym 等基准上以多次调用取得接近更大模型的成绩。

推荐理由:原文给出轻量安全模型在多个基准和 Google 内部代码库的实测结果,可据此判断专用小模型在漏洞发现上的性价比。

6月10日星期三

AI HOT 精选

Anthropic 发布 Claude Fable 5,在高风险领域会自动降级到旧模型

Claude Fable 5 是 Anthropic 目前最强的模型,在编程、知识问答、科研和视觉测试里几乎全面领先,任务越复杂优势越大。但它在网络安全、生物化学和模型蒸馏这些敏感领域做了限制:一旦触及,会自动切回能力更保守的 Opus 4.8,平均每 20 次对话触发一次。另外,Anthropic 把完全版 Mythos 5 开放给了少数可信的网络安...

推荐理由:Anthropic 发新模型,重要性本来就在 85–94 这个区间。HKR 三项全过:安全降级这个钩子够特别,降级对象和触发频率都写清楚了,而且 Claude 用户群对“能力强但可能被安全机制打断”这事很敏感。唯一扣分点是来源只有 X,信息不够硬,所以没给到最高档。

6月9日星期二

AI HOT 精选

Cohere 发布 North Mini Code:一个 30B 参数、每次只用 3B 的开源代码模型

Cohere 在 Hugging Face 上开源了 North Mini Code,采用 Apache 2.0 协议。这是一个 30B 参数的混合专家模型,每次推理只激活 3B 参数,专门为让模型在终端里自主写代码、修 bug 这类任务设计。在 SWE-Bench Verified 上,它的 pass@10 跑到了 80.2%,在 Artificia...

推荐理由:HKR-H 来自一个紧凑的 MoE 编码模型加上一个亮眼的 SWE-Bench 成绩;HKR-K 有参数、协议、上下文和基准数据。Cohere 不是前沿实验室,所以这个发布放在 78-84 分的开源编码模型区间比较合适。

Google DeepMind

Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

Google DeepMind 发布 Gemini 3.5 Live Translate,一款支持 70 多种语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。

推荐理由:原文给出模型的语言覆盖、实时翻译机制与多产品上线节奏,可据此判断语音翻译的可用边界。

AI HOT 精选

Gemma 4 12B 发布:一个模型直接看懂图文和音频,不用外挂编码器

Google DeepMind 开源了 Gemma 4 12B,一个 120 亿参数的多模态模型。它最大的变化是去掉了传统的独立视觉/音频编码器,把所有输入统一交给 Transformer 处理,架构更简单。模型能直接听懂语音,不再需要先转文字。官方说它用 Apache 2.0 协议开源,在 16GB 显存或统一内存的笔记本上就能跑。性能方面,正文没给...

推荐理由:我会先打个折:正文没给性能对比和具体 benchmark,所以没法判断它到底多强。但架构上的变化是实打实的——把视觉和音频编码器都砍掉,统一用 Transformer 处理,等于简化了管线,也降低了工程复杂度。能在 16GB 显存或统一内存的笔记本上跑,对个人开发者和中小企业是个实在的卖点。原生语音输入意味着不用再串一个 ASR 模块,做语音助手或实时对话应用会更轻量。Apache 2.0 协议也扫清了商用顾虑。整体看,这是一个有明确技术亮点的开源发布,但缺少性能验证,激动之前得等实测数据。

6月8日星期一

AI HOT 精选

高德发布 ABot-Earth0.5,用一张卫星图 10 分钟就能生成 3D 城市

高德搞了个叫 ABot-Earth0.5 的模型,号称是全球第一个原生 3D 的城市世界模型。它已经覆盖了 190 多个国家和地区。用起来很简单,你扔给它一张卫星图或者一段文字描述,它就能在普通消费级显卡上,大概 10 分钟给你生成一大片公里级的 3D 城市场景。出来的素材是 3DGS 格式,能直接拖进 Unity、虚幻引擎这些软件里接着用。按他们算的...

推荐理由:高德这个ABot-Earth0.5把3D城市生成的门槛压得很低:消费级显卡、10分钟、公里级、直接出可编辑资产。我会先打个折,正文没披露生成精度和几何一致性有多高,也没给实际案例对比,所以“全球首个原生3D城市世界模型”这个说法先别太激动。但即便只做到七八成,对需要大量3D场景的团队来说也挺省钱。H/K/R三条都踩实了,重要性给80合理。

6月7日星期日

r/LocalLLaMA

Cohere 把还没发布的编程模型 BLS-Mini-Code-1.0 先丢给 LocalLLaMA 社区测试了

Cohere 的员工 Nick Frosst 在 Reddit 上给 LocalLLaMA 社区开了个后门,提前放出还没正式发布的编程模型 BLS-Mini-Code-1.0,权重已经挂在 Hugging Face 上了。这个模型总参数量 30B,但每次推理只激活 3B 参数,属于稀疏模型,跑起来对硬件要求会低一些。Cohere 说它的 token 输...

推荐理由:HKR 三项都踩中了:Cohere 员工私下给社区塞未发布模型,这事本身就有点独家;30B 总参数只激活 3B 的稀疏设计,对本地跑模型的人很友好,硬件要求直接打折。不过信息来自 Reddit 帖子,正文没披露评测成绩、许可证和训练细节,所以先别太激动,给个低 featured 档位刚好。

6月6日星期六

AI HOT 精选

OpenCV 5 发布,换了一套能跑大模型的神经网络引擎

OpenCV 5 最大的变化是换了一套全新的 DNN 引擎,从原来的逐层执行改成基于计算图的架构,能做算子融合,跑 Transformer、视觉语言模型和大语言模型都成了原生能力。ONNX 算子的覆盖率从 4.x 时期不到 23% 一下子拉到 80% 以上,以前很多导不进来的模型现在能直接用了。另外硬件加速层也重新整理了,厂商可以直接插优化后的计算内核...

推荐理由:HKR 三项都站得住:OpenCV 加原生大模型支持是个实打实的跨界信号,计算图引擎和 ONNX 覆盖率暴涨是硬核知识增量,本地推理和兼容性又切中部署痛点。作为大版本更新,重要性够上 featured,但还没到模型实验室发新作那种必写级别。

AI HOT 精选

Google AI 本周连发六弹:笔记本能跑的多模态模型、帮你读论文的科研助手、还有开源实时音乐模型

Google AI 这周一口气更新了六样东西。Nano Banana 2 和 Pro 版正式上线,走 Gemini 企业平台、API 和 AI Studio 就能用。Co-Scientist 是一个多智能体系统,专门帮科研人员自动生成和优化新假设,相当于有个助手帮你读文献、想点子。Google Labs 出了个 dreambeans,会扒你的 Goog...

推荐理由:HKR 三项都踩中了:帖子一口气打包了 Google AI 六个更新,本地部署和开源这两个点对从业者很实在。正文没给基准测试、授权条款和定价细节,所以分数卡在 76,没往上走。

6月5日星期五

AI HOT 精选

Google 开源了实时音乐模型 MRT2,在 MacBook 上延迟不到 200 毫秒

Google AI for Developers 放出了一个叫 Magenta RealTime 2(MRT2)的实时音乐模型,权重开放,推理引擎也开源了。你可以用 MIDI 键盘弹、打字给提示词,甚至用手势控制它来生成音乐。它在 MacBook 上原生跑,延迟压到了 200 毫秒以内,这个速度对实时演奏来说基本跟手。配套还给了应用和插件套件,到手就能...

推荐理由:HKR 三项都过:Google Magenta MRT2 有实打实的实时音频钩子、开放权重和低于 200ms 的本地延迟。对创意 AI 开发者吸引力很强,但本质上是一封公开信和政策诉求,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高一级。

6月4日星期四

AI HOT 精选

Ideogram 4.0 开源,跑分自称全球最强,文字渲染和排版控制是亮点

Ideogram 发布了 4.0 版本,一个 93 亿参数的开源文生图模型。它把文字和图像信息放在同一条处理流水线上(单流 DiT 架构),并用了 Qwen3-VL-8B 当文本编码器。最突出的能力是能在图里准确写出长段文字,适合做海报和封面。另外,它训练时让模型理解了元素的位置关系,你用提示词就能指定版式和对象布局。在 DesignArena 的人工...

推荐理由:Ideogram 4.0把9.3B参数的文生图模型开源了,架构是单流DiT,在DesignArena人类偏好排名里拿了第4。我会先打个折——正文没披露训练数据规模和具体推理成本,所以实际部署的性价比还不好算。但一个开源模型能在人类评价里挤进前排,说明图像生成的质量门槛又在往下掉,对做应用的人来说是个省钱信号。

AI HOT 精选

Miso One 开源了一个 8B 参数的语音模型,克隆声音只需一小段样本,延迟 110 毫秒

Miso One 放出了一个 8B 参数的开源 TTS 模型,主打一次语音克隆——给它一小段音频样本就能模仿那个人的说话风格和节奏。推理延迟标称 110ms,对实时对话场景算可用。模型权重直接挂在 GitHub 上,你可以自己部署,音频数据不用上传到第三方服务器。官方说 API 之后会出,但正文没提价格和上线时间。

推荐理由:我会先打个折:这是单条推文来源的发布,没有跑分对比、没写许可证细节、也没有第三方复现结果。但8B参数、110ms延迟、能自托管的一次语音克隆这几个事实本身够硬,放在featured刚好,再往上就缺验证了。

6月3日星期三

AI 群聊日报

微软发布自研推理模型MAI-Thinking-1,35B参数在编程和数学上追平Opus 4.6

微软首个正式对外发布的自研推理模型MAI-Thinking-1,用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平,AIME 2025数学测试拿到97%,盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏,预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

推荐理由:这条消息的钩子很清晰:微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6,而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报,不是官方公告,正文没披露模型是否开源、API 定价和完整评测设置,所以权威性偏弱。但 H/K/R 三个维度都踩中了:有竞争对标、有硬数字、有平台格局的冲击力。综合来看,值得作为 featured 推给从业者看一眼,但别急着把它当正式发布。

AI HOT 精选

Qwen3.7 发布,重点强化推理和让模型进业务流程干活的能力

Qwen 发了 Qwen3.7,由通义大模型 BU 多模态交互负责人 Steven Hoi 介绍。官方说法是推理能力有重大突破,工具调用、写代码和长链条的 agent 任务都做了升级。正文没披露模型参数量、定价、跑分成绩和开源/闭源条件,我会先打个折——等看到具体数字和实测再判断突破有多大。

推荐理由:HKR-H 和 HKR-R 通过,因为 Qwen3.7 是阿里云旗舰模型更新,从业者会关注。HKR-K 不通过:正文只说了能力方向,没给参数量、价格、跑分或接入方式,信息缺口太大,没法判断实际提升。

AI HOT 精选

微软发布自研推理模型 MAI-Thinking-1,中等规模,没从第三方模型蒸馏

微软在 Build 2026 上掏出了自己的第一款高级推理模型 MAI-Thinking-1。官方说这是个中等尺寸的模型,在一些软件工程基准上能跟一线模型打平。训练数据完全自建,没走知识蒸馏的捷径——也就是没拿别家大模型当老师来教它。这是微软在模型自研上的一次表态,之前它主要靠 OpenAI,最近两家刚重新谈了合作,关系没那么紧了。

推荐理由:微软在 Build 2026 发了 MAI-Thinking-1,说是中等规模推理模型,在软件工程基准上能打平领先模型。我会先打个折——正文没披露具体分数、访问方式和定价,所以没法判断它到底多强、多便宜。这点先别太激动。但这是微软第一个自研高级推理模型,信号很明显:它在试着减少对 OpenAI 的依赖,同时往开发者工具链里塞自己的货。

6月2日星期二

AI HOT 精选

阶跃星辰放出 Step 3.7 Flash,开放权重,主打帮智能体写代码

阶跃星辰发了个新模型 Step 3.7 Flash,把权重开放了,你可以直接下载用。它的定位是给智能体编程场景用,强调工具调用可靠,还能处理多模态输入。同一天 MiniMax 也开源了 M3,两家模型都已经能在 Kilo 平台上跑。正文没披露具体的跑分、参数量或硬件门槛,所以实际快不快、省不省资源还得自己测。

推荐理由:这条消息的钩子在于“开放权重”和“智能体编程”两个点,不是常规发个新版本。我会先打个折:正文没给模型尺寸、跑分、许可证和定价,所以只能算有信息增量但缺关键验证。对开发者来说,能直接下载权重、能调工具、能看懂多模态输入,这几个能力放在一起确实有吸引力,尤其现在大家都在抢智能体编程这条赛道。Kilo 上线也让想试的人有个现成入口。不过没披露性能对比和实际成本,这点先别太激动,等后续数据出来再看值不值得切过去。

6月1日星期一

量子位 · 公众号

招商局狮子山实验室开源 LiOS 架构,把云端大模型延迟压到 30 毫秒,还送了个叠衣服数据集

招商局狮子山人工智能实验室放出了一个叫 LiOS 的边云架构,专门解决机器人怎么用上云端大模型的问题。他们跨机器测下来,从本地摄像头到云端 GPU 显存,单向延迟大约 30 毫秒,这个数字对很多实时控制场景已经够用了。架构里低延迟视频传输模块直接开源,还附带了一个 LeFold 叠衣服数据集。不过正文因为微信环境异常没加载出来,具体用了什么模型、在哪些...

推荐理由:我会先打个折:招商局狮子山实验室不是头部平台,也没看到多源交叉验证,所以影响力止步中等。但这条消息确实给了干货——30ms相机到云端显存的延迟数字,说明端云协同在物理世界干活有戏,不是纯画饼。开源图传模块和叠衣数据集也算实在,同行能直接拿来测。正文没披露具体模型规模、功耗和复杂场景下的抖动,这点先别太激动。

AI HOT 精选

英伟达开源 Cosmos 3:一个能看懂物理世界、还能生成动作的 32B 模型

英伟达把 Cosmos 3 称为第一个完全开放的物理 AI 全能模型,意思是它不只能识别图像,还内置了视觉推理、生成 3D 世界状态和直接输出动作的能力。这次放出两个尺寸:Super 版 320 亿参数,Nano 版 80 亿参数。正文没提训练数据规模、具体跑分和推理成本,所以实际能用多好、跑起来贵不贵还得等实测。

推荐理由:我会先打个折:正文是单篇发布稿,没给基准测试、没提许可证细节,也没说训练数据规模和实际部署条件,所以分数卡在 78–84 区间。亮点在于 NVIDIA 第一次把视觉推理、世界生成和动作生成打包成一个开放物理 AI 模型,并给出两个具体尺寸,这对机器人圈子的信号意义不小。但缺少验证信息,这点先别太激动。

AI HOT 精选

MiniMax 开源 M3 模型:一个模型搞定编程、100 万 token 上下文和原生多模态

MiniMax 把 M3 模型开源了,权重公开可下载。它把三个能力塞进了一个模型里:编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边(SWE-Bench Pro 得分 59.0%),能处理 100 万 token 的超长上下文,还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

推荐理由:MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案,上下文窗口拉到100万token。最实在的点是MSA注意力机制,每token计算成本降到前代的1/20,长文本推理能省不少钱。编码和Agent跑分看着不错,但正文没给出具体对比对象和测试细节,这点先别太激动。整体是一次有诚意的开源发布,信息量够,但验证还缺一环,所以放在featured而不是P1。

5月31日星期日

新智元 · 公众号

复旦系团队发布时空一体世界动作模型 STI-WM,称能同时吃进 RGB、点云和本体感知数据做百秒级任务规划

这篇文章来自微信公众号,但页面被环境验证挡住了,正文内容完全看不到。标题和摘要里提到的“复旦铁三角”和“最优物理 AI 路径”都是原文的说法,具体技术细节、实验数据和模型架构都没法核实。已知信息是:一个叫 STI-WM 的模型,主打时空一体的世界动作建模,用在机器人上,支持 RGB 图像、点云和机器人自身状态感知三种输入,能做上百秒的任务规划。另外还提...

推荐理由:这篇东西我会先打个折——全是公司自己说的,没给公开 benchmark 也没说模型能不能复现。但信息量确实不小:STI-WM 把视觉、点云和机器人自身状态揉进一个模型里,号称一次能规划上百秒的动作,这比现在多数 demo 里几秒的规划长得多。半年融了 5 轮、Pre-A 轮 3 个亿,还拉了 NVIDIA 站台,资本侧的信号比技术侧更实。对做机器人落地的人,这条至少能看出一条技术路线和资源密度,所以放在 featured 门槛上。

量子位 · 公众号

复旦系团队发布机器人世界动作模型 STI-WM,把时空信息揉在一起做长任务

沐神智能搞了个叫 STI-WM 的模型,专门给机器人用的。它把 RGB 画面、深度点云和机器人自身状态(比如关节角度)同时喂进去,首创了时空一体的架构,不再是先看空间再看时间的两段式处理。官方说它能支撑上百秒的长任务推演,中间出错了还能闭环重新规划。不过正文没给出具体的基准测试分数,也没提部署成本,所以实际效果和性价比还得等更多数据。

推荐理由:我会先打个折:正文没披露权重是否开源、有没有标准 benchmark 对比、百秒推演在什么场景下验证的,这些关键信息都缺。但 STI-WM 把 RGB、深度点云和本体输入揉进一个时空一体架构,直接做百秒级推演,这个思路对做机器人世界模型的人有参考价值。眸深智能又是复旦系团队,英伟达也出现在标签里,产业和学术两边都有点关联。综合来看,信息够新、够具体,但验证强度不明,所以放在 featured 门槛附近,不往上拔。

5月30日星期六

AI HOT 精选

OpenAI 放出一个实时翻译语音模型,70 多种语言输入,13 种语言输出

OpenAI 发了 gpt-realtime-translate,一个专门做语音翻译的模型。你对着它说 70 多种语言里的任意一种,它能直接用 13 种目标语言把语音播出来。OpenAI 说大模型虽然强,但特定任务还是得上专用模型。目前这个功能已经在智能眼镜上跑起来了,不过正文没披露延迟、准确率和具体硬件细节。

推荐理由:我会先打个折:正文没提延迟、定价和 API 开放时间,所以实际能不能用、贵不贵还不知道。但 OpenAI 把实时翻译塞进智能眼镜,70多种语言进、13种语言出,这个组合本身是个挺实在的进展,值得从业者看一眼。

5月29日星期五

AI HOT 精选

Google 发布两款图像模型 Nano Banana Pro 和 Nano Banana 2,已接入 Gemini API 可用

Google AI 开发者账号官宣了两个图像模型:Nano Banana Pro(代号 gemini-3-pro-image)和 Nano Banana 2(代号 gemini-3.1-flash-image),现在就能通过 Gemini API 调用,直接上生产环境。帖子贴了一些社区示例展示效果,但正文没披露定价、跑分、并发限制这些关键信息,想评估成...

推荐理由:Google 这次一口气发了两个图像模型,Nano Banana Pro 和 Nano Banana 2,都走 Gemini API,直接面向生产环境。标题和摘要只给了名字和可用性,没提性能对比、价格、安全机制,所以没法判断实际强不强。我会先打个折,不往 p1 放,但作为产品动态值得让关注图像生成和多模态的人知道。

The Verge · AI

Claude Opus 4.8 发布,主打“老实”:不确定时会直说,瞎编的概率降到前代的四分之一

Anthropic 周四放出 Claude Opus 4.8,这次没吹性能天花板,而是强调模型更“诚实”。公司说早期测试者发现它更愿意主动标注自己没把握的地方,而不是硬编一个听起来合理的答案。内部评测给了一个具体数字:Opus 4.8 做出无据论断的概率大约是前代模型的四分之一。不过正文没披露这个评测的具体基准和对比对象,我会先打个折——四倍改善听起来...

推荐理由:我会先打个折:正文只说了“评估中少约 4 倍无依据声明”,但没披露具体用了哪些基准测试、测试规模多大、在什么任务上测的,也没提价格和上下文窗口有没有变。所以这个“4 倍”只能当个方向性信号看,别直接当成绝对指标。不过对从业者来说,模型肯承认自己不确定而不是硬编,本身就是个值得关注的转向,尤其在需要高可靠性的工作流里。整体信息量够上头条,但细节缺口明显,分数给在 85–94 这个区间是合理的。

5月28日星期四

AI HOT 精选

Mistral 推出物理 AI 模型,用一张 GPU 几秒钟预测完整物理场

Mistral 整合了 Emmi AI 团队,发布了一个面向工业工程的物理 AI 基础模型。它能根据几何结构、边界条件或测量数据,在单张 GPU 上用几秒钟预测出完整的物理场(比如温度、应力分布)。正文没披露具体架构、参数量、训练数据规模和实测误差范围,也没给出跟传统数值仿真在精度和速度上的量化对比,所以实际工程可用性还得看后续验证。

推荐理由:Mistral 这次没发新聊天模型,而是直接拿下一个物理 AI 团队,做工业仿真。我会先打个折:正文没披露具体模型名、基准测试、定价和开放方式,所以没法判断它比现有求解器到底准不准、省多少。但方向本身值得关注——如果单 GPU 秒级出完整物理场是真的,对西门子能源这类重工业客户来说,仿真迭代速度会快很多,成本也可能降一截。这点先别太激动,等他们放出可复现的结果再说。

5月25日星期一

r/LocalLLaMA

NuExtract3 发布:一个 4B 开源视觉模型,能把图片和文字转成 Markdown、做 OCR 和按模板抽信息,自己电脑就能跑

Numind 放出了 NuExtract3,一个基于 Qwen3.5-4B 的开源视觉语言模型,用 Apache-2.0 协议。它主要干三件事:把图片或文字转成 Markdown 格式、从图片里直接识别文字(OCR)、以及按你给的 JSON 模板把非结构化内容抽成结构化数据。模型只有 4B 参数,对硬件要求不高,官方说最低 4GB 显存就能在本地部署。...

推荐理由:NuExtract3 把一个 4B 大小的开源视觉模型打包成了文档抽取工具,支持 OCR、转 Markdown 和按你给的 JSON 模板把内容抽出来。最吸引人的是它最低只要 4GB 显存就能在自己机器上跑,这对在意数据不出本地的团队来说省了不少事。模型基于 Qwen3.5-4B,用 Apache-2.0 协议,没有授权上的坑。不过正文没给出具体的抽取准确率或延迟数据,实际效果得自己测一下才知道。

5月22日星期五

AI HOT 精选

智谱发布 GLM-5.1 高速版,API 输出冲到每秒 400 个 token

智谱在 5 月 22 日给部分企业客户开放了 GLM-5.1-highspeed 接口,输出速度标称 400 tokens/s,说是目前大模型厂商里最快的。过去跑得快的模型通常能力会打折,这次智谱声称把旗舰模型的能力和低延迟同时塞进了生产环境。提速主要靠 GLM 团队和 TileRT 团队在三个层面做的系统优化:推理引擎重写了核心路径来提升单卡吞吐;调...

推荐理由:智谱扔出一个 400 tokens/s 的 API 速度数字,说是全球纪录,我会先打个折——正文没披露测试条件、并发数、上下文长度和定价,这些缺口让“纪录”暂时只能当个参考。但 GLM 和 TileRT 联手做系统级优化这件事本身有信息量,说明国产模型在推理加速上开始卷工程落地,不只是卷榜单。对从业者来说,速度快意味着同样任务花钱少、等得短,这点先别太激动,等看到实际压测和价格再判断值不值得切。

5月21日星期四

r/LocalLLaMA

腾讯发布 Hy-MT2 翻译模型,覆盖 33 种语言,最小 1.8B 版压缩后仅 440MB

腾讯放出了 Hy-MT2 系列翻译模型,有 1.8B、7B 和 30B-A3B 三个尺寸,支持 33 种语言互译。1.8B 小模型用上 AngelSlim 1.25-bit 量化后,存储占用压到 440MB,推理速度还快了 1.5 倍,适合本地跑。不过 Reddit 原帖被屏蔽了,正文没披露具体翻译质量评测和更多技术细节,这点先别太激动。

推荐理由:我会先打个折:Reddit 信源比较散,所以分数没再往上拉。但 440MB 这个数字太直观了,比单纯列三个模型尺寸更有传播力,从业者一眼就能算出部署成本。正文没披露量化后的翻译质量损失,这点先别太激动,但“小模型干翻译”这个方向本身值得关注。

r/LocalLLaMA

Cohere 联合创始人亲自回应:Command A+ 是他们第一个 MoE 开源模型,主打在 1-2 张 GPU 上跑得动

Cohere 的 Nick Frosst 在 Reddit 上发帖,正式推出了 Command A+。这是他们第一个混合专家(MoE)模型,用 Apache 2.0 协议开源。帖子里说,这个模型最大的卖点是效率,做了很极限的量化工作,在 1 到 2 张消费级 GPU 上就能跑得很流畅,对个人开发者和小团队比较友好。不过他也直说,模型的顶尖性能还有待打磨...

推荐理由:我会先打个折:正文没披露参数量、基准测试成绩和上下文窗口,这些关键指标全缺,所以重要性只能给到 74。亮点是 Cohere 终于把 Command-A 这条线捡起来,换成 MoE 架构还给了 Apache 2.0,量化后能在 1 或 2 张 GPU 上跑,对想自己部署的人是个实在消息。但信源只有 Reddit 讨论,没有官方技术报告或实测数据,这点先别太激动。