跳到正文

产品更新

AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。

842 条精选相关主题模型发布行业动态AI 编码

最新精选

第 161–180 条 · 共 842 条

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。

量子位 · 公众号

英伟达、微软、Arm 同发预告,传老黄自研 CPU 笔记本 N1X 要来了

三家公司在同一天发了同一张“PC 新纪元”的预告图,指向一台传闻中由英伟达主导设计的笔记本 N1X。目前流出的配置是 20 核 Arm 架构 CPU、Blackwell GPU、6144 个 CUDA 核心和 128GB LPDDR5X 统一内存,听起来像一台给 AI 开发者准备的移动工作站。不过正文没披露具体跑分和实测数据,内存带宽和 x86 转译效...

推荐理由:我会先打个折:这目前是三家同一天发暗示拼出来的硬件传闻,发布日期、价格、量产计划正文都没给。但“英伟达自研 CPU 塞进笔记本”这个组合拳,加上 128GB 统一内存这种能跑大模型的规格,确实值得当一条强信号来看。先别太激动,等实锤。

AI HOT 精选

特斯拉 FSD V14.3.3 用 4 天 21 小时横穿加拿大,6051 公里全程没让人碰方向盘

一群电动车爱好者开着搭载 FSD V14.3.3 的特斯拉,从温哥华一路跑到哈利法克斯,6051 公里零接管、零退出。变道、过施工路段、甚至每次进超充站自动倒车泊车,全是系统自己干的。这个版本放宽了对驾驶员盯路的判定,长途开下来没那么累。不过得说清楚,这仍是 L2 级辅助驾驶,法规上要求人随时准备接管。正文没提途中遇到的极端天气具体有多糟,也没交代是否...

推荐理由:我会先打个折:这是特斯拉自己放出来的单次行程,没有第三方验证,也没说清路线里高速和城市比例、天气变化、有没有施工路段这些容易翻车的细节。但 6051 公里零干预这个数字本身够硬,版本号也明确,对从业者来说是个可复现可质疑的靶子。分数停在 82 是因为它给了结果却没给边界条件,没法判断这到底是常态水平还是挑了个好天气跑出来的。

AI HOT 精选

Simon Willison 把 Python 网页应用直接跑在了浏览器里,不再需要后端服务器

Simon Willison 用 Pyodide(把 Python 编译成浏览器能跑的 WebAssembly)加上 Service Worker,让 Python 的 ASGI 网页应用完全在浏览器里运行。他让 Claude Opus 4.8 帮忙写了代码,做了两个能用的演示:一个基础 FastAPI 例子,另一个是他自己的 Datasette 1....

推荐理由:Simon Willison 用 Claude Opus 4.8 辅助开发,把 Python ASGI 应用搬进了浏览器,已经跑通了 Datasette 的演示。这件事的钩子在于:浏览器不再只是前端沙箱,可以直接当应用服务器用。技术栈交代得清楚,Pyodide、Service Worker、ASGI FastCGI 每一步都有据可查,不是概念图而是能跑的代码。我会先打个折,这目前还是个开发者实验,离生产环境还有距离,但思路对无服务器和边缘部署的人有启发。

AI HOT 精选

NVIDIA 用 DynoSim 给推理部署做模拟器,一次能跑几千种配置,速度是实时的 1500 倍

NVIDIA 给自家推理服务框架 Dynamo 配了个仿真工具 DynoSim,用 Rust 写成。它把部署测试变成“先在虚拟时间线上模拟、再挑最好的上真机”的流程,不用一个个试。测试里它能跑到实时速度的 1500 倍,一次筛几千种配置。正文没披露具体硬件环境、支持哪些模型和实测延迟数据,所以这个 1500 倍先打个折看——快是真的快,但省多少时间还得...

推荐理由:HKR 三项都成立:钩子是 1500 倍实时仿真,机制是虚拟时间线批量试配置,共鸣点打在推理成本和延迟上。单信源 NVIDIA 产品更新,信息量有限,放在 featured 低段合理。

AI HOT 精选

GitHub Copilot 改按 token 收费,开发者直接骂“开玩笑吧”

GitHub Copilot 把计费方式从订阅制改成了按 token 算钱,开发者社区炸了。token 就是模型处理文本的最小单位,用多少收多少,但正文没披露具体单价、生效时间,也没说免费额度还在不在。我会先打个折——如果单价定得高,写代码时每补一行都可能肉疼,这对重度用户影响不小。

推荐理由:HKR 三项都踩中了:计费模式切换本身是实打实的机制变化,开发者骂“开玩笑吧”自带冲突感,而按 token 收费直接关系到每个用 Copilot 写代码的人的钱包。我会先打个折——正文没给价格、token 单价和生效时间,这些关键信息全是缺口,所以重要性只能停在 75 这一档。对从业者来说,这条消息值得看一眼,但别急着算账,等官方把数字放出来再说。

5月30日星期六

TechCrunch · AI

我让谷歌的 24 小时 AI 助手 Gemini Spark 干了一天活,它确实挺有用

TechCrunch 的编辑实测了谷歌新推出的 Gemini Spark,把它当成一个全天候 AI 助手来用,主要干了整理邮件摘要和规划本地活动这两件事。体验下来觉得确实能帮上忙,但文章没搞懂谷歌为什么要把这个功能单独做成一个产品,而不是直接塞进现有的 Gemini 里。正文没披露这东西什么时候正式上线、要不要另外收费。

推荐理由:我会先打个折:正文没披露价格和发布时间,所以不能当产品发布看。但亮点在于,这是一篇上手实测,不是通稿。编辑用“actually pretty useful”收尾,说明 Gemini Spark 在收件箱摘要和本地活动规划这两个场景里跑通了,没翻车。对做 agent 的人来说,这种“替你干活”的体感比跑分重要。信息缺口明显,但反转叙事和具体场景撑住了 featured 的分数。

AI HOT 精选

Google 把两个新图像模型 Nano Banana Pro 和 Nano Banana 2 挂上了 Gemini API

Google AI Developers 发推说 Nano Banana Pro(对应 gemini-3-pro-image)和 Nano Banana 2(对应 gemini-3.1-flash-image)已经正式发布,可以直接通过 Gemini API 调用。推文里贴了一些社区示例展示效果,但正文没披露定价、跑分、单次生成耗时或调用频率上限,想上...

推荐理由:我会先打个折:这就是个产品更新,不是技术突破。Google 把两个图像模型挂上 Gemini API 标成生产可用,对想用的人是个信号,但正文没披露价格、没给跑分、也没说调用限制,所以没法判断性价比。名字叫 Nano Banana,听着像玩梗,但背后就是 gemini-3-pro-image 和 gemini-3.1-flash-image,别被名字带偏。

新智元 · 公众号

Anthropic 内部流出一份 Claude 流畅度评分表,最高 11 分,优秀人类能拿 7.5

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分,满分 11 分。背后的研究用了 9830 组匿名多轮对话,发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节,目前只能看到评分框架,所以这个 7.5 分到底怎么算出来的还不清楚,先别太激动。

推荐理由:这篇的切入点是把 AI 和人的关系倒过来,用评分卡的形式讲 Claude 怎么分析用户行为,标题自带传播力。内容有具体的行为列表和样本量,不是空谈。我会先打个折:这不是模型发布或重大能力更新,所以放在 featured 档位刚好,不用拔到 breaking。对从业者来说,能从中看到 Anthropic 对“高质量使用”的定义,也能反推自己用 Claude 的方式在什么水平。

新智元 · 公众号

Opus 4.8 算了一夜,把 1170 亿人的投胎概率做成了模拟器

这篇文章的正文被微信环境异常页挡住了,实际内容没抓到。从标题和已有英文摘要看,沃顿商学院教授 Ethan Mollick 用 Claude Opus 4.8 生成了一个叫“历史之幕”的网站,把人类历史上约 1170 亿次出生做成加权随机模拟,跑了 4000 轮蒙特卡洛来估算你投胎到不同地区和时代的概率。但具体怎么算的、模型代码怎么写的、有没有幻觉或偏差...

推荐理由:HKR 三项都成立:Mollick 的投胎模拟器是个有梗的钩子,不是常规的“模型又变强了”;1170亿人口和4000轮模拟给了可验证的数字;对开发者来说,这种一夜搭出复杂原型的效率比跑分更有说服力。这不是 Anthropic 官方发布,所以留在 featured 低位没问题。

AI HOT 精选

xAI 放弃 JAX GPU,改用自研 C 语言训练框架

SemiAnalysis 爆料 xAI 已经不用 JAX 在 NVIDIA GPU 上训练模型了,转而用 Grok Build 写了一套 C 语言训练框架。报道说 xAI 的 JAX 方案模型浮点利用率(MFU)不到 10%,这个数字很低,意味着大部分算力都浪费在调度和通信上,没真正花在训练上。NVIDIA 的 JAX 团队过去两年几乎全员扑在支持 x...

推荐理由:xAI 换训练框架是个强钩子,MFU 不到 10% 这个数字够扎眼,但来源是单条推文,复现条件也没给,所以定在 80 分,不上 P1。我会先打个折看后续:如果真有实锤,这事对训练成本的讨论会很大。

AI HOT 精选

Codex 现在能自己管自己的聊天线程和并行任务了

OpenAI 的 Codex 界面新增了对话线程管理能力,可以自己创建、搜索、整理和固定聊天线程,还能为并行任务启动工作树。这条信息来自 X 上的用户分享,正文没披露具体实现方式、准确率或延迟数据,我会先打个折——目前看起来更像一个便利功能,而不是底层模型能力的升级。

推荐理由:HKR 三项都过:Codex 拿到了具体的线程管理和并行工作树机制,对编码 Agent 用户有实际价值。正文没披露适用范围、定价和性能数据,所以我会先打个折,放在 featured 偏低的位置。

AI HOT 精选

Codex 现在能远程操控你的 Windows 电脑了,目前还是早期体验

OpenAI 给 Codex 加上了 Windows 支持,你可以在手机上用 ChatGPT 应用启动、查看和指挥 Codex 在你 Windows 电脑上干活。官方说这是早期体验,正文没披露收费方式和具体开放范围,我会先打个折——稳定性、权限控制和延迟都还没经过大规模验证,别急着把重要任务全交给它。

推荐理由:OpenAI 给 Codex 加了 Windows 计算机使用功能,通过 ChatGPT 手机 App 来操控。正文交代了工作流程和早期体验状态,但没提权限、定价和推送范围,所以先放在 featured 这一档。

The Verge · AI

想拍你干家务,AI 公司开始用免费保洁换训练数据

一家叫 Shift 的 AI 训练初创公司说,可以免费给纽约人打扫房子,条件是允许他们拍摄保洁员干活的全过程:洗碗、擦台面、掸灰、拖地。这些视频会被用来训练家用机器人。公司还计划扩展到伦敦等城市。但正文没披露用户隐私条款、数据保留期限、后续收费模式,也没说具体什么时候进新城市。我会先打个折:免费保洁听着不错,但等于拿你家当机器人训练场,值不值得自己掂量。

推荐理由:我会先打个折:正文没披露视频拍到什么程度、数据保留多久、会不会扩到别的城市,所以别急着说这是机器人数据的灵丹妙药。但 Shift 这个做法确实戳到了一个真问题——教机器人做家务,缺的就是人在真实厨房里刷碗擦台面的视频。用免费保洁来换,比花钱买数据便宜,也比实验室摆拍更像真活。对从业者来说,看点在于这种采集方式能不能规模化,以及用户到底愿不愿意让陌生人架着相机看自己家。这点先别太激动,等他们公布授权条款和隐私处理再说。

AI HOT 精选

OpenRouter 加了个服务器端工具,让模型直接生成文件补丁

OpenRouter 在 Responses API 里上线了 apply_patch 工具,模型可以生成 V4A 格式的 diff 来创建、修改或删除文件。服务器端会先校验 diff 语法,不用客户端自己折腾。正文没披露这个校验具体能拦住哪些错误,也没说支持哪些模型。

推荐理由:HKR 三项都过了:OpenRouter 这次更新给 coding agent 搭了条跨模型的补丁通道,用 V4A diff 加服务端校验,实用性很强。但它属于基础设施层面的改进,不是模型能力本身的突破,所以分数压在 72–77 这个区间。

AI HOT 精选

xAI 把 Grok Build 0.1 放出来公测了,主打帮 AI 写代码

xAI 通过 API 放出了 grok-build-0.1 的公测版,就是驱动 Grok Build CLI 的那个模型,定位是让 AI 去干编程的活儿。价格是输入每百万 token 1 美元,输出每百万 token 2 美元。官方说它便宜、聪明还快,但正文没给出具体的跑分、延迟数据或跟其他编程模型的对比,所以“极具成本效益”这点先别太激动,得自己上手...

推荐理由:HKR 三项都过了,但文章本身很薄:只有公测、CLI、定价和智能体编程的定位,没有跑分、上下文窗口大小或实际使用反馈。这更像一个中等体量的产品更新,先别急着下结论说它有多强。

5月29日星期五

The Verge · AI

Shift 用免费上门打扫换机器人训练数据,清洁工会全程被录像

一家叫 Shift 的 AI 训练数据公司说,可以免费帮你打扫家里,条件是让他们录下清洁工擦窗、吸尘、整理的全过程,拿这些视频去训练机器人。他们觉得这些数据的价值足够覆盖服务成本,网站上写的是“你得到干净屋子,我们拿到训练数据,双赢”。宣传片里清洁工戴着一顶有点奇怪的帽子干活。不过正文没提服务覆盖哪些城市、怎么处理隐私和知情同意,也没说已经收集了多少数...

推荐理由:HKR-H 和 HKR-R 都很实在:Shift 把家政服务直接变成机器人数据采集管道,话题性够强。HKR-K 有明确机制,但城市范围、隐私条款、数据集规模正文都没披露,所以先别太激动,暂时放在低曝光位。

The Verge · AI

Adobe 的对话式 AI 助手像个平庸的设计实习生

The Verge 提前试了 Adobe Firefly AI 助手的测试版。它不像常规 AI 工具那样直接生成图片或视频,而是充当一个中间人,用对话的方式替你操作 Adobe 的设计软件。作者说,助手解释每一步编辑思路时讲得很清楚,但最终做出来的效果并不让人满意。正文没提定价、正式上线时间,也没列出完整支持哪些软件。

推荐理由:我会先打个折:这是 The Verge 编辑亲自上手 Adobe Firefly AI Assistant 测试版的体验文,不是官方通稿。它能在 Adobe 设计软件里听指令改图,解释流程挺清楚,但成品确实一般,所以标题才叫“平庸的设计实习生”。这点先别太激动,正文没披露定价、什么时候正式上线、具体支持哪些应用,信息有缺口。不过它踩中了设计工作自动化的敏感点——能不能用、好不好用、会不会抢活,所以给到 featured 门槛的分数是合理的。

量子位 · 公众号

腾讯放出 AI 游戏创作平台“Code Craft”,说句话就能生成 2D 或 3D 游戏

腾讯游戏公开了一个叫 Code Craft 的 AI 游戏创作平台,主打用自然语言描述就能直接生成可玩的 2D 或 3D 游戏。平台内置了一套规划知识库和技能系统,可以帮 AI 拆解复杂的游戏设计指令,还提供了可视化调参面板和超过两万个免费云端素材。官方说法是“下限零基础,上限肝大作”,意思是完全不会写代码的人也能上手,有经验的开发者也能用它搭出更完整...

推荐理由:HKR 三项都过了。标题和摘要给的信息够硬:自然语言生成可运行游戏、2D/3D 都支持、2 万多免费资产,对开发者来说省原型成本是实打实的吸引力。正文没披露收费方式、开放范围和模型能力上限,所以分数压在 featured 低段,不往上拔。