跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 181–200 条 · 共 842 条

5月29日星期五

新智元 · 公众号

Claude Opus 4.8 实测:高级工程师基准冲到 63 分,但高强度任务掉到 42 分,Max 用户几小时就撞速率墙

这篇来自新智元的实测文章目前页面被微信环境验证挡住了,正文内容没抓到。从标题和摘要信息看,Claude Opus 4.8 在 Extra-High 级别的高级工程师基准测试里拿了 63 分,比上一代 Opus 4.7 高出 30 分,这个涨幅挺夸张。但切换到 High 强度任务时分数掉到 42 分,说明模型在持续高压场景下稳定性还有问题。另外,每月 2...

推荐理由:Anthropic/Claude 相关度天然高,加上有实测跑分和配额吐槽,HKR 三项都站得住。钩子是强但贵且 High 档拉胯,K 有基准分和额度细节,R 直接戳中 Agent 场景下的成本焦虑。来源是媒体评测而非官方公告,所以定在 P1 低位。

r/LocalLLaMA

Liquid AI 发布 LFM2.5-8B-A1B,一个 80 亿参数、支持 12.8 万 token 上下文的模型

Liquid AI 放出了新模型 LFM2.5-8B-A1B。它用 380 亿个 token 做预训练,之后又做了大规模强化学习,上下文窗口能塞进 12.8 万个 token。词汇表翻了一倍,对非拉丁语系的 token 切分更友好。模型已经挂在 Hugging Face 上。不过 Reddit 原帖被网络策略挡了,正文没披露具体的基准跑分、推理成本和强...

推荐理由:我会先打个折:正文没给任何跑分、许可证和部署限制,所以别急着下结论。亮点是 8B/A1B 这个尺寸配 128K 上下文,38T token 的预训练量也算扎实,加上大规模 RL 调过,对想在本地跑长文本、又不想烧太多卡的人有吸引力。但没基准测试就没法判断实际水平,这点先别太激动。

AI HOT 精选

OpenAI 推出 Rosalind Biodefense,把最强生物模型交给审查过的开发者和政府做防疫

OpenAI 发布了一个叫 Rosalind Biodefense 的新项目,把 GPT‑Rosalind 这个专攻生命科学的前沿推理模型,开放给经过审查的开发者和美国政府合作伙伴,用来做生物防御和防疫准备。具体来说,开发者可以申请用这个模型去搭建流行病建模、早期检测、筛查、非药物干预等工具;政府侧则扩大了对公共卫生和生物防御任务的访问权限。首批合作方...

推荐理由:OpenAI 推出 Rosalind Biodefense,向审核过的开发者和美国政府伙伴开放 GPT-Rosalind 访问。正文没给模型大小、训练数据、评测基准和定价,所以没法判断实际防护能力有多强,也不知道成本。我会先打个折:这更像一次政策姿态和准入机制的发布,而不是一个能直接评估的技术产品。对从业者来说,值得留意的是生物安全方向的合规门槛和“可信访问”具体怎么落地,但别急着把它当成成熟的防御工具。

r/LocalLLaMA

StepFun 3.7 Flash:196B 总参数、11B 激活的 MoE 模型,带 1.8B 视觉模块,能在 128GB 内存的本地机器上跑

StepFun 放出了 Step 3.7 Flash,一个混合专家(MoE)模型,总参数量 196B,但每次推理只激活 11B 参数,所以对算力要求没那么夸张。它内置了一个 1.8B 参数的视觉 Transformer(ViT),可以直接处理图像输入。官方说这个模型能在配备 128GB 内存的本地环境里运行,不用非得连云端。不过 Reddit 原帖被网...

推荐理由:StepFun 扔了个新模型,196B 参数但只激活 11B,还带了个 1.8B 的视觉模块,最抓眼球的是说能在 128GB 内存的机器上本地跑。我会先打个折:Reddit 上的信源比较散,授权协议、具体评测方法和能不能公开用都没说清楚,所以分数没给太高。但光凭这个规格和本地运行的承诺,对玩硬件和关注成本的人来说已经值得看一眼了。

AI HOT 精选

阶跃星辰开源 Step 3.7 Flash,198B 参数 MoE 模型,活跃参数约 11B,专为智能体工作流做效率优化

阶跃星辰放出了一个开源模型 Step 3.7 Flash,架构是 198B 参数的 MoE(混合专家),实际干活时只激活大约 11B 参数,所以跑起来相对轻量。上下文窗口给到 256K,能读图、读文档,也能直接生成代码或调用工具。它在 ClawEval-1.1 上拿了 67.1 分,SimpleVQA Search 上 79.2 分,这两个榜目前排第一...

推荐理由:这条发布的核心卖点是“大模型的身子,小模型的成本”,198B MoE 只激活 11B 参数,对想把模型塞进智能体流程的人吸引力很直接。256K 上下文和 ClawEval-1.1 的 67.1 分给了可查的硬数字,不是纯宣传。不过正文没提独立评测和实际延迟数据,这点先别太激动。整体信息量够、有记忆点,放在 featured 合适。

彭博科技

三星开始向英伟达等客户寄送下一代 AI 内存芯片样品,声称抢到先发优势

三星电子已经开始向客户寄送其最先进的内存芯片样品,这些芯片将用于英伟达等公司的 AI 加速器。不过,正文因为 Bloomberg 的反爬机制没能抓到具体内容,所以芯片型号、客户名单、样品数量、定价和量产时间这些关键信息目前都看不到。

推荐理由:三星放话说自己先跑了一步,把最先进的 AI 内存样品送到客户手里了,Nvidia 这类加速器厂商是直接相关方。我会先打个折:正文没写具体是哪款芯片、给了谁、什么时候能量产,所以目前只能算一个供应链信号,还不是落地实锤。对关注硬件成本和 HBM 供应的人来说,这条值得看一眼,但别急着当定局。

AI HOT 精选

苹果想把谷歌数万亿参数的 Gemini 模型压缩进 iPhone,给新 Siri 当大脑

苹果正在尝试用模型蒸馏技术,把谷歌那个参数规模大到数万亿的 Gemini 模型缩小,塞进 iPhone 里本地运行,用来驱动新版 Siri。但 Ars Technica 的报道也泼了盆冷水:因为原始模型实在太大,完全在手机本地跑通的可能性很低,大概率还是得搭配云端处理。正文没披露具体的蒸馏方案、参数目标、延迟要求,也没给出发布时间表。

推荐理由:我会先打个折,因为这只是个爆料,不是已发布的产品。文章给了蒸馏方案和“云端大概率必需”的判断,但没披露模型压缩后的具体尺寸、延迟数据或上线时间,所以信息量够上 featured,但别当实锤看。

TechCrunch · AI

Anthropic 发了 Opus 4.8,带了个能调度一群子模型干活的动态工作流工具

Opus 4.8 这次配了一个叫 Dynamic Workflows 的工具,核心作用是让一个主模型像工头一样,协调一堆子模型分头执行任务。正文没提价格、上下文窗口多大、跑分成绩,也没说什么时候能用上。

推荐理由:Anthropic 发新模型还配了个管 agent 群的工具,信息量够上当天重要档位。但价格、窗口大小、什么时候能用全都没说,我会先打个折,等这些补上再往上调。

Hacker News 首页

Claude Code 支持动态工作流,让模型自己决定下一步做什么

Anthropic 给 Claude Code 加上了动态工作流能力,Claude 在写代码时可以自己规划步骤、调用工具,而不是死板地跑预设脚本。博客正文没披露具体的技术实现方式、支持哪些触发条件、会不会增加额外费用,也没说这个功能是默认开启还是需要手动配置。从 Hacker News 上的 70 分和 62 条评论来看,开发者社区关注度不低,但实际效...

推荐理由:这条消息本身信息量很薄,就是 Claude Code 发了一篇讲动态工作流的文章,HN 上讨论热度还行。但 RSS 正文没披露任何机制细节,比如工作流是自动编排还是需要手动配置、支持哪些触发条件、有没有用量限制,这些全不知道。所以我会先打个折,重要性给到 73,放在 featured 低位。好处是标题够直白,目标用户一看就懂,坏处是除了标题和 HN 互动数,没有可验证的事实可以展开。

Hacker News 首页

Anthropic 发布 Claude Opus 4.8,主打代理任务判断力和诚实度,价格不变

Anthropic 推出了 Claude Opus 4.8,直接升级自 4.7,价格没涨。这次的重点不是刷榜,而是让模型在干具体活时更靠谱:多位早期测试者提到它判断力变好,会主动质疑不靠谱的计划、自己揪错,而不是硬着头皮往下编。模型还新增了“诚实”倾向,遇到证据不足时会主动说“不确定”,而不是假装有进展。同时发布的还有几个配套功能:网页版可以控制模型思...

推荐理由:我会先打个折:这条只有标题和 HN 热度,正文没披露任何能力、参数或发布时间,所以别当正式发布来看。但 Claude Opus 4.8 这个名字本身就是信号,Anthropic 的旗舰线更新,从业者一定会盯。HN 139 分、49 条评论说明社区已经在猜了,这种关注度本身就值得推一条。如果是真的,模型选型和工具链可能都要跟着调,这点先别太激动,等官方补信息再说。

The Verge · AI

一部成本2000美元的AI电影将在翠贝卡电影节首映

翠贝卡电影节下月会首映一部75分钟的AI生成电影《Dreams of Violets》,讲的是伊朗政府大规模杀害抗议者的虚构故事,画面和人物全由AI生成。制作成本只花了2000美元,素材来自新闻报道、照片和目击者描述。电影由2019年离开伊朗的Koosha兄弟制作,哥哥Ash是制片公司Fountain 0的CEO,弟弟Pooya是联合创始人。正文没披露...

推荐理由:我会先打个折:这不是模型发布或平台更新,而是 AI 在电影制作上的一个应用案例,所以重要性给到 featured 的低段位。但 2000 美元拍出一部 75 分钟、能进翠贝卡的片子,这个数字本身就够抓眼球——它说明 AI 工具已经把长片制作的门槛拉到极低。文章没披露用了哪些具体模型、后期人工修了多少,这点先别太激动。不过,低成本加老牌影展的组合,对从业者来说,比单纯炫技更有冲击力,因为它直接摆出了“省钱”和“替代”这两个现实问题。

5月28日星期四

AI HOT 精选

Perplexity 的 Computer 功能现在能直接嵌进 Word、Excel、PPT 和 Outlook 的侧边栏用了

Perplexity 把它的 Computer 助手塞进了微软 Office 套件里。你在 Excel、Word、PowerPoint 和 Outlook 的侧边栏就能直接使唤它,让它帮你起草文档、处理数据模型、做演示文稿或者打理邮件。正文没披露具体是哪个版本的 Office 支持,也没提需不需要额外付费。

推荐理由:Perplexity Computer 进了 Excel、Word、PPT 和 Outlook,能在侧边栏帮你起草文档、搭模型、做演示、处理邮件。这事本身有信息量,也戳中了办公 agent 入口的竞争点。但正文没提定价、权限控制、企业部署方案和实际效果数据,所以我会先打个折,不往更高层级推。

TechCrunch · AI

iOS 27 的 Siri 要独立成 App 了,渲染图先流出来,苹果想正面刚 ChatGPT

TechCrunch 拿到了一组新渲染图,显示苹果打算在 iOS 27 里把 Siri 拆成一个独立 App,交互也重新设计了。正文只给了这个信息,没提发布时间、具体功能参数,也没说底层模型是自研还是接别人的。我会先打个折:渲染图不等于最终产品,但独立 App 这个方向说明苹果想把 Siri 从系统助手升级成能跟 ChatGPT 对标的对话入口。

推荐理由:这条消息的看点在于苹果终于不再只把 Siri 当系统功能,而是拆成独立 app 去跟 ChatGPT 抢用户。我会先打个折:正文只说了 iOS 27 会改版、Siri 重设计、有独立 app,但没给发布时间,也没讲能干什么、怎么收费、模型跑在本地还是云端。如果是真的,苹果靠装机量和系统整合确实能省一大笔推广费,但没参数就没法判断能力到底行不行。这点先别太激动,等更多细节出来再下结论。

量子位 · 公众号

DeepSeek V4 用上华为昇腾芯片做训练,国产算力生态开始跑通闭环

这篇文章本身因为微信环境验证失败,正文内容没抓到,只能根据标题和摘要信息来聊。标题里提到的“芯模协同”,指的是 DeepSeek V4 在训练时直接跟华为昇腾芯片做适配优化,不是先拿英伟达跑完再移植。摘要里说 CANN(华为的 AI 计算框架)一口气开源了 65 个代码仓库,并且支持 70 多个主流模型“开箱即用”,不用等适配。另外 AIGCode 在...

推荐理由:这条主要讲的是国产算力生态的进展,不是 DeepSeek V4 本身发了什么新能力。但里面给的仓库数、适配模型数、MFU 这些数字比较具体,比一般的合作通稿有信息量。我会先打个折,因为正文没披露 V4 在昇腾上的完整训练规模或成本对比,MFU 也只给了 AIGCode 一个点,验证还不够全。不过对关心国产替代进度的人来说,这几个数字已经够拿来判断方向了,所以放在 featured 里。

r/LocalLLaMA

Zai 把 GLM-5.1 推理集群的网络架构换了,吞吐量提了 15%

Zai 在一个千卡规模的 GLM-5.1 代码推理集群上,把原来的 ROFT 网络拓扑换成了自研的 ZCube。硬件、软件栈和模型都没变,但交换机与光模块成本降了 33%,GPU 推理吞吐量提升了 15%。在把输入理解(prefill)和内容生成(decode)拆开跑的部署模式下,首个 token 的 P99 尾部延迟也砍掉了 40.6%。不过帖子正文...

推荐理由:HKR 三项都踩中了:GLM-5.1 推理集群的成本、吞吐和延迟数字都很具体,40.6% 的延迟降幅是个强钩子。不过来源只有 Reddit 单帖,且话题偏 infra 细分,所以定在 78 分。

AI HOT 精选

Mistral 开源了一套搜索工具包,把数据灌入、检索和评测拆成可替换的模块

Mistral 发布了 Search Toolkit 的公开预览版,一个开源框架,把搜索系统拆成数据接入、检索和效果评估三层,每层都定义了统一接口。你可以把它部署在云上、本地机房或者边缘设备上,按需替换里面的组件。官方说这样能省掉重复造轮子的时间,但正文没给出具体的性能基准或延迟数据,实际效果还得自己测。

推荐理由:Mistral AI 把数据喂入、检索和效果评估打包成一个开源框架,叫 Search Toolkit,现在开放公共预览。我会先打个折:这不算大新闻,但信息量够。它支持云端、本地和边缘部署,意味着你可以在自己机器上跑,不用被绑在某个云上。正文没披露具体性能对比和延迟数据,所以别太激动,但开源加评估环节这点对想自己搭资料库的团队挺实用。

Mistral AI

Mistral 将 Le Chat 升级为统一智能体 Vibe,覆盖办公与编码

Mistral 把 Le Chat 升级为统一 AI 智能体 Vibe,一个许可同时覆盖办公与编码,原有对话、设置和套餐全部保留。Work Mode 支持企业知识搜索、结构化数据分析、文档报告生成、多步任务定时调度和可复用技能,可连接 Google Workspace、Outlook、SharePoint、Slack、GitHub 等。

推荐理由:原文完整披露了 Vibe 的工作模式、编码模式与 CLI 更新,可据此判断它如何接入现有工作流。

AI HOT 精选

Mistral 在 AI Now 峰会上公布工业 AI 路线图,Vibe 升级,并在巴黎郊区建推理数据中心

Mistral 在自家峰会上主要说了三件事。第一,他们和空客、宝马、ASML 合作搞工业 AI,让模型进到设计、制造这类业务流程里干活,但具体怎么落地、效果如何正文没细讲。第二,Vibe 这个能处理长周期任务的 AI 助手迎来升级,具体能力变化也没展开。第三,他们要在巴黎南边的 Les Ulis 建一个 10 兆瓦的推理数据中心,计划 2026 年第三...

推荐理由:我会先打个折:这次没发新模型能力,也没给定价细节,所以重要性卡在 featured 门槛上。但 Mistral 把数据中心规格(10 MW)和时间表(2026 Q3)都摊出来了,还绑定了空客、宝马、ASML 这些实打实的工业客户,比纯概念发布实在。正文没披露推理成本的具体数字,这点先别太激动。整体看,对做工业 AI 和关注欧洲算力布局的人值得扫一眼。

The Verge · AI

YouTube 上线 AI 自定义信息流:输入想看的内容描述,主页直接生成专属推荐

YouTube 开始在美国推一项新功能,让用户用自然语言描述想看什么,AI 会根据兴趣、心情或话题生成一个定制视频流,并可以固定在主页顶部方便回看。目前只支持英文,登录后的美国用户在手机 App 和桌面端都能用,入口在主页顶部的“Your custom feed”标签。正文没披露这个 AI 具体用了什么模型、怎么平衡推荐算法和用户主动描述,也没提生成速...

推荐理由:YouTube 这次不是微调推荐,而是让用户自己写提示词来拼一个视频流,交互上往前走了一步。我会先打个折:正文没提背后用了什么模型、怎么排序、效果数据也没有,所以暂时只能当一次产品实验看。上线范围限美国、英语、已登录用户,说明还在试探阶段,别急着当成全面开放。如果是真的能稳定跑通,对内容分发逻辑的冲击不小,但现在信息缺口还很大。

FT · 科技

律所 Kirkland & Ellis 要花 5 亿美元自建 AI 平台

这家顶级律所计划投入 5 亿美元,把全所律师的“集体智慧”做成一个内部 AI 平台。正文没披露具体用哪家模型、是自己从头训还是拿现成模型调优,也没说什么时候上线。5 亿这个数字说明他们打算把这件事当成核心基础设施来搞,不是小范围试点。不过,没看到技术细节和验证指标之前,这笔钱到底能省多少人工、提多少效率,还不好判断。

推荐理由:FT 的信源加上 5 亿美元这个数,让这条消息在律所 AI 应用里算个大新闻,所以 H/K/R 都给了肯定。但正文没披露任何技术细节,连用的是大模型还是传统 NLP 都没说,我会先打个折。整体判断是:话题性够强,信息量偏弱,适合放在企业应用动态里让人留意,别当技术突破看。