跳到正文

#产品更新

今日 22 条

6月3日星期三

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

AI HOT 精选

Google DeepMind 放出 Co-Scientist:让多个 Gemini 智能体组队,自己辩论、自己迭代科学假设

Google DeepMind 发了个叫 Co-Scientist 的系统,核心是用多个 Gemini 智能体搭成一个科研小组:有的负责生成假设,有的负责挑刺辩论,再让假设在内部迭代进化。官方说法是能帮科学家在复杂问题上找新思路。不过正文没披露具体用的是哪一版 Gemini、有没有跑过基准测试、开放方式是什么、什么时候能用上,这些关键信息目前都还是空白。

推荐理由:我会先打个折:正文没披露模型版本、评测结果和开放时间,所以目前只能当一次研究发布来看,别太激动。但 Gemini 被架成多智能体科研系统这个动作本身,说明 DeepMind 在认真推“AI 做科学假设”这件事,不是单次推理,而是让多个 agent 互辩、演进想法,思路比单纯刷榜有意思。对从业者来说,这更像一个方向信号,离能用的产品还有距离。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

AI HOT 精选

OpenAI Codex 出了 Python SDK,一行命令就能把编程 Agent 塞进自己应用里

OpenAI Codex 发布了 Python SDK,安装命令是 pip install openai-codex。这意味着开发者可以直接在自己的代码里调用 Codex 的编程和生图能力,不用再单独打开 Codex 界面。更省事的是,SDK 能复用你已经在 Codex 上的登录状态,省去再搞一套鉴权的麻烦。不过正文没提 API 怎么收费、用的是哪个模...

推荐理由:我会先打个折:正文只说了怎么装和怎么登录,没给 API 价格、模型版本或限流条件,所以别急着算账。但这件事本身挺实在——Codex 不再只是个聊天窗口,而是能当零件用,pip 一装就能集成。对开发者来说,复用登录态省了一步鉴权麻烦,但没写清楚调用上限,真上生产还得自己测。整体是实用的产品更新,信息有缺口但不妨碍它值得关注。

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

TechCrunch · AI

Anthropic 把 Claude 的安全工具 Mythos 铺到 15 国的关键基础设施,覆盖电力、水务、医疗和通信

Anthropic 正在把自家的安全漏洞项目 Project Glasswing 和模型 Mythos 开放给 15 个国家的 150 家机构,专门盯电力、水务、医疗和通信这些命脉系统。按他们的说法,这些系统一旦被攻击,可能影响上亿人。正文没具体说 Mythos 是直接部署在本地还是通过 API 调用,也没披露这 150 家机构是免费试用还是付费签约,...

推荐理由:HKR 三项全中:规模有、行业有、安全痛点也有。没给更高分是因为正文只说了铺开范围,Mythos 具体怎么控、怎么评、出过什么问题都没提,所以先打个折。

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。

Ben's Bites

Claude Opus 4.8 发布,Claude Code 学会写脚本派子任务并行干活

Anthropic 发了新模型 Claude Opus 4.8,主要卖点是 Claude Code 现在能先写一个调度脚本,再同时拉起多个子代理并行处理复杂任务。不过有开发者提醒,这并不证明松散的 multi-agent 架构靠谱,反而是围绕小代理循环的确定性工作流更稳。模型本身被 Simon Willison 评价为“温和但有用的升级”,更诚实、更少...

推荐理由:HKR 三项都成立,因为这是一次有实质内容的 Anthropic/Claude 发布和 Claude Code 代理更新。文章没给基准测试、定价和上下文窗口数据,所以分数压在 85–94 这个区间。

AI HOT 精选

Anthropic 扩大 Project Glasswing 计划,新增约 150 家关键基础设施机构

Anthropic 把 Project Glasswing 的合作范围从约 50 家扩到约 150 家新机构,覆盖超过 15 个国家,新增了电力、水务、医疗、通信和硬件等关键基础设施行业。这些机构都有一个共同点:一旦代码库被攻破,影响可能超过 1 亿人。前期合作方用 Claude Mythos Preview 已经扫出超过 1 万个高危或严重漏洞,现在...

推荐理由:Anthropic把Project Glasswing铺到约150个新组织,横跨15个以上国家,HKR三项都有实打实的数字和行业支撑。不过正文没披露具体的安全机制或模型能力变化,所以分数就停在featured低段,先别太激动。

The Verge · AI

我试了 Google 的 AI 管家 Gemini Spark,它规划行程的方式让我又惊又怕

过去四年所有 AI 产品演示都说能帮你规划旅行,但实际用起来只会推荐每个城市最俗套的六件事。我用 Spark 的体验完全不同——它是 Google 一个野心很大的常驻 AI 管家。不过这篇报道只放了开头,正文没披露 Spark 什么时候上线、怎么收费、有没有跑分,也没说测试条件能不能复现,所以它到底多能打,我会先打个折。

推荐理由:我会先打个折:这篇是 The Verge 的上手体验,不是产品发布稿,所以别当官方公告看。标题的情绪冲击力够强,能勾住人,但正文只披露了旅行规划这一个场景的差异,发布时间、定价、可复现的测试条件一概没提,信息密度其实不高。不过它踩中了两个从业者会关心的点:一是 agent 常驻系统带来的自主性和安全边界问题,二是 Google 在这个方向上给竞品施加的压力。综合来看,有话题性但缺硬信息,放在 featured 级别是合适的。

r/LocalLLaMA

NVIDIA 在 Hugging Face 上放出 Cosmos 3 世界模型,能同时吃文字、图片、视频并生成视频、音频和动作指令

NVIDIA 把 Cosmos 3 系列模型挂上了 Hugging Face,这次发了两个尺寸:Nano 版 160 亿参数,Super 版 640 亿参数。它是个全模态世界模型,输入可以混着来——文字、图片、视频甚至动作轨迹都行,输出也不止视频,还能直接吐图片、音频和下一步的动作指令。不过 Reddit 原帖的正文被网络策略挡了,实际跑起来的硬件门槛...

推荐理由:我会先打个折:正文没披露 benchmark 分数、许可证和训练细节,所以不能直接断定它比现有方案强。但 NVIDIA 把 16B 和 64B 两个规格的世界模型公开放在 HF 上,这件事本身就值得从业者看一眼——至少多了一个能本地跑、能接动作输出的多模态基座选项。对做机器人仿真和视频生成的人来说,输入支持动作轨迹、输出能直接给动作指令,说明它不只是生成漂亮画面,而是想往物理交互方向靠。这点先别太激动,因为没看到在真实机器人任务上的验证,但方向对,且开源降低了试错成本。

量子位 · 公众号

老黄带着英伟达 CPU 杀进 PC 赛道

英伟达要在今年秋天把一台叫 RTX Spark 的 Windows 电脑推向市场。这台机器把一块 Blackwell 架构的 RTX 显卡和一颗 20 核 Arm 架构的 Grace CPU 焊在一起,通过 NVLink-C2C 高速互联,共享 128GB 统一内存。官方给出的 AI 算力是 1 petaflop,号称能在本地跑起 1200 亿参数、上...

推荐理由:英伟达把RTX Spark搬进Windows PC,不是发新模型,而是给开发者一台能本地跑120B模型的机器。1 petaflop算力和128GB统一内存这些数字,说明它想解决本地跑大模型内存不够、上下文装不下的痛点。对从业者来说,这意味着可以省掉一部分云端推理成本,延迟也更可控。不过正文没提具体功耗和价格,实际性价比还得等上市再看。整体是硬件产品更新,不是基础模型发布,所以分数落在78到84之间。

AI HOT 精选

阶跃星辰发了 Step 3.7 Flash,一个 196B 参数的 MoE 模型,主打推理省钱

这个模型用了多矩阵分解注意力,把 KV-cache 的占用压到 DeepSeek 同类模型的 22% 左右,显存压力小很多。另外还把注意力和前馈网络解耦,方便在硬件上跑得更顺。模型走 Apache 2.0 协议,已经在 Fireworks AI 上可用,官方说能用来搭智能体应用。不过正文没给出具体跑分和延迟数据,实际效果还得看第三方实测。

推荐理由:HKR 三项都站得住:Step 3.7 Flash 有 196B MoE 和约 22% KV-cache 成本的具体数字,不是纯宣传稿。不过它还没到一线旗舰模型的体量,所以给 78 分放在 featured 里。

Latent Space

英伟达连发三弹:Cosmos 3 世界模型、Nemotron 3 Ultra 大模型,还有一台叫 Spark 的个人超算

英伟达在台北电脑展上放出了一波开源模型和硬件。Cosmos 3 是一个能同时处理文字、图片、视频、音频和动作的“世界模型”,用了混合 Transformer 架构,把负责推理和负责生成的两个模块拼在一起。它分 Nano(16B)和 Super(64B)两个尺寸,其中 Super 微调后的文生图和图生视频能力,在开放权重模型里直接冲到了第一。Nemotr...

推荐理由:这次发布把视觉世界模型、大语言模型和本地推理硬件捆在一起推,信息密度高。Cosmos 3 的 MoT 架构和两个具体尺寸(16B/64B)给了明确的技术锚点,Nemotron 3 Ultra 的 550B-A55B 开放权重对想自己部署大模型的人是个实在消息。不过正文没给出具体 benchmark 对比或价格,实际效果和性价比还得等上手。整体影响面广,但还没到前沿实验室发新基础模型那种震动级别。

AI HOT 精选

Google AI Studio 现在能直接搭 Gmail、Drive 应用,不用跳出去

Google AI Studio 上线了应用构建功能,可以直接在里面连接 Gmail、Drive 和 Sheets 等 Google 自家服务,不用再切到别的网站。目前支持在 AI Studio 内部添加测试人员,但正文没披露完整的公开分享功能具体什么时候上线,只说“即将推出”。

推荐理由:这是个中等体量的产品更新:Workspace 连接和测试人员支持已确认,但分享机制、权限细节和定价都没披露。我会先打个折,因为目前更像内部测试能力,离正式开放还有信息缺口。

Hacker News 首页

OpenAI 把自家最强模型和 Codex 搬上了 AWS

OpenAI 宣布,它的前沿模型和 Codex 编程助手已经在 AWS 上正式开放使用。这意味着企业可以直接在自己熟悉的 AWS 环境里调用 GPT-5.5 等模型,走现有的安全、合规和采购流程,省去另起炉灶的麻烦。Codex 也一并上线,这个每周有超过 500 万人用的编程智能体,现在能在 AWS 里帮团队写代码、做审查和修 bug。正文没披露具体定...

推荐理由:这条消息本身挺有意思,OpenAI 上 AWS 意味着企业多了一个不用 Azure 也能用前沿模型的选择,对多云策略和采购谈判都有影响。但正文实在太薄,只给了个链接和 56 分、17 条评论,没写可用区域、价格、模型清单,也没说清楚是 Bedrock 里的托管版还是别的接入方式。所以我会先打个折:信息缺口太大,没法判断实际落地程度和性价比,这点先别太激动。

TechCrunch · AI

英伟达联手微软、戴尔和惠普,想用 AI 代理 PC 抢 2000 亿美元 CPU 市场的蛋糕

英伟达要把 AI 代理(能自主干活的软件助手)装进消费级 PC,合作方是微软、戴尔和惠普。他们瞄准的是价值 2000 亿美元的 CPU 市场。不过正文没披露具体配置、价格、上市时间,也没说怎么保证这些代理在个人电脑上安全运行不出乱子。如果真解决了易用、安全和实用这三个问题,这事儿确实不小,但现在只能先打个折看。

推荐理由:我会先打个折:正文没给任何规格、价格或上市时间,所以这更像一次生态站队宣示,不是产品发布。但“2000亿美元市场”这个钩子和微软/戴尔/惠普三家站台,足够让它进featured的低位。对从业者来说,知道Nvidia拉着OEM三巨头在铺AI agent PC的局就够了,具体能跑什么模型、卖多少钱,现在还没法判断。

The Verge · AI

Gemini Spark 上手:演示里能做的,实测基本也能做,但成本和隐私还是笔糊涂账

The Verge 的编辑用了一周 Gemini Spark,这个能 24 小时在后台跑多步骤任务的 AI 代理,干活能力确实和谷歌演示的差不多。但文章没提具体价格,也没说清楚隐私条款,只透露 Spark 会在执行大动作前先跟你确认。编辑觉得它替你办事时偶尔好得让人意外,可一想到要付出的钱和可能交出去的数据,就不太确定值不值了。

推荐理由:我会先打个折:正文没披露价格、隐私条款和完整测试结果,所以判断只能基于已有信息。The Verge 用了一周,结论是 Gemini Spark 确实能后台执行多步骤任务,但表现也就跟 Google 自己演示的差不多,没有超出预期。这点先别太激动,因为缺了成本和隐私细节,实际能不能在生产环境用还不好说。整体看,这是一次有参考价值的实测,但信息缺口明显,所以分数放在 72–77 这个区间。

r/LocalLLaMA

英特尔在 Computex 2026 发布 Crescent Island GPU,最高 480GB 显存

英特尔在 Computex 2026 上推出了新显卡 Crescent Island,用的是 Arc Xe 3P 架构。最抓眼球的配置是最高能堆到 480GB 的 LPDDR5X 显存,这对想在本地跑大模型的人来说,意味着能塞进更大的模型,不用频繁地往硬盘里倒腾数据。整卡功耗标了个 350W 风冷,不算低,但还在单卡能压住的范围。它支持的数据格式从原生...

推荐理由:HKR 三项都成立:480GB 显存这个数字本身就是强钩子,硬件细节够具体,而且精准踩中了推理成本和显存焦虑。不过价格、上市时间和实际性能跑分正文都没提,所以分数就停在 78–84 这个区间,先别太激动。

AI HOT 精选

Perplexity 把搜索流程写成代码,让 AI 代理直接调接口,不再绕函数循环

Perplexity 公开了一套叫 Search as Code 的搜索架构。它的做法是让 AI 代理直接写 Python 代码去调用自家的搜索栈,而不是像以前那样一步步循环调用函数。这套东西已经上线 Perplexity Agent API,并且成了 Computer 功能的默认选项。正文没披露具体性能对比数据,但思路很直接:省掉中间环节,让搜索更快...

推荐理由:我会先打个折:这篇只有 Perplexity 自己的公告,没给性能对比、定价细节和实际铺开范围,所以只能算一个低配版的产品更新。但亮点很实在——Perplexity 把搜索从“调 API 拿结果”变成了“让模型写代码操作搜索栈”,并且已经接进 Agent API,这对正在搭 agent 的团队来说是个省事的信号。正文没披露延迟和成本数据,这点先别太激动。

AI HOT 精选

Gemini Omni 能生成你的数字分身,放进视频里

Gemini App 发帖演示了用 Gemini Omni 捏一个长相和声音都像你的数字分身,然后直接塞进视频创作里。帖子没提这个功能什么时候上线、要不要付费,也没说怎么防止别人拿你的形象乱用。

推荐理由:我会先打个折:正文只说了 Gemini Omni 能做个人数字分身,没披露上线范围、价格、安全机制或授权流程,所以信息缺口不小。但官方账号自己放出这个功能点,说明产品方向已经定了,对做视频创作和虚拟人业务的人是个明确信号。HKR 三项都踩中:钩子够强,事实够新,风险够直接。因为细节太少,重要性只能给到 74,放在 featured 里当个产品更新提醒,别当成熟方案看。

6月1日星期一

Latent Space

视频智能体是下一个方向:Ethan He 谈 xAI Grok Imagine 的三个月从零到一

Ethan He 在 NVIDIA 做完 Cosmos 世界模型后跳到了 xAI,带着一个小团队三个月就做出了 Grok Imagine。他有个很直接的观点:视频模型现在的智能主要来自语言模型,不是靠堆视频数据训练出来的。下一个 Sora 级别的突破不会是更好的视频生成模型,而是能规划、生成、修改、反复打磨一个完整创意任务的视频智能体。这期播客聊了从零...

推荐理由:我会先打个折:这篇是访谈级别的信号,不是论文或产品发布。它给了“三个月小团队从零搭建”这个事实,也点出了视频 Agent、音视频对齐和推理加速这几个方向,但正文没披露任何基准分数、具体成本数字或可复现的测试方法。所以它更像一份来自 xAI 内部的路线图预告,能帮你判断他们在往哪使劲,但暂时没法拿来做技术选型。对关注视频模型和多模态 Agent 的人来说值得扫一眼,别当结论用。

AI HOT 精选

OpenAI 在密歇根州动工开建 1GW 数据中心,属于 Stargate 计划

OpenAI 联合 Oracle 等伙伴,在密歇根州 Saline 市破土动工一个叫“The Barn”的数据中心园区,总供电容量 1GW。官方承诺电费不会转嫁给当地居民,冷却系统用的是闭环设计,耗水量跟一栋普通办公楼差不多。项目预计带来超过 2500 个工会建筑岗位和 450 个长期现场岗位,还会向当地娱乐中心捐 1000 万美元,并在租期内产生约 ...

推荐理由:这条消息的钩子够硬:OpenAI 直接亮出 Stargate 在密歇根的 1GW 数据中心。1GW 这个数字说明供电规模很大,对推理和训练都有想象空间。但正文没给投资额、没给工期、也没说里面塞什么 GPU,信息缺口很明显。我会先打个折,因为缺的这些关键参数让实际落地时间表和成本结构都悬着,不能直接当投产新闻看。对从业者来说,这更像一个信号——OpenAI 在自建算力底座上继续加码,但离真正跑起来还有多远,正文没交代。

AI HOT 精选

Apache RocketMQ 出了个 AI 专用版,专门解决多智能体协作时状态丢失和流量打崩的问题

阿里云给 RocketMQ 加了一套 AI 场景的适配,叫 RocketMQ for AI。它主要干三件事:用 Lite-Topics 减少资源开销,靠有序消息防止多智能体协作时上下文乱掉,再通过流量整形避免突发请求把系统打挂。官方说已经在阿里云大规模跑过,代码也开源了,但正文没披露具体版本号和性能对比数据,实际省多少资源还得自己测。

推荐理由:这条更新把 RocketMQ 往 AI 场景推了一步,提的几个机制——轻量级主题、有序消息、流量整形——听着像是给多 agent 协作和长任务链路做减法,减少排队打架和资源争抢。我会先打个折,因为正文没给版本号、性能对比和实际落地案例,没法判断是已经能用的东西还是路线图上的规划。但方向本身不虚,agent 之间通信乱、调度不公正是真痛点,所以分数给到 74,放在 featured 里提醒一下做 agent 架构的人可以关注。

新智元 · 公众号

阶跃星辰发布 Step 3.7 Flash,196B 参数的 MoE 模型每次推理只激活 11B,速度冲到 400 tokens/秒,跑 Agent 任务...

阶跃星辰这次放出的 Step 3.7 Flash 是个混合专家模型,总参数量 196B,还挂了一个 1.8B 的视觉编码器,但每次推理实际只动用 11B 参数,所以能跑到每秒 400 个 token。官方说在 Agent 任务上,它的成本只有 Claude 的零头。不过正文因为微信环境验证没抓到具体内容,实际跑分、具体任务对比和定价细节都没披露,这点先...

推荐理由:速度和参数数字都摆出来了,标题里那个成本对比很抓人。但正文没披露具体定价、基准测试的细节和开源条款,所以分数只能停在 82 这个质量更新档位。

机器之心 · 公众号

VAST 发布 Project Eden,世界模型第一次能像游戏一样“存档”了

VAST 推出了一个叫 Project Eden 的三层世界模型架构,把场景的持久状态和画面渲染拆开了。简单说,就是给 AI 生成的 3D 世界加了个“存档”功能,你改过的东西下次打开还在,不用每次都重新生成。文章还提到 VAST 在 A+ 和 A++ 轮一共融了将近 2 亿美元。不过正文因为微信页面环境异常被屏蔽了,具体技术细节和效果演示都没看到,这...

推荐理由:我会先打个折:VAST 不是一线基础模型实验室,正文也没披露具体基准测试结果或开放接入方式,所以分数落在 78–84 区间。但 Project Eden 把世界状态推演和视觉渲染拆成三层,还给了“存档”这个产品钩子,加上近 2 亿美元的融资规模,对关注仿真基础设施的从业者来说信息量够硬。

AI HOT 精选

腾讯混元给智能体做了个长期记忆插件,叫 Hy-Memory

这个插件是给 OpenClaw 这类需要长期协作的智能体用的,相当于给它们装了个“第二大脑”。它用了一套六层记忆框架,还分了快慢两个系统来处理信息,目的是把零散的记忆整理成更有用的经验。官方给的数据是,记忆数量能砍掉 70% 以上,单条记忆的信息密度反而提升了 45% 多。在要处理超长文本的场景下,消耗的 token 能省下 35%,记忆更新速度也快了...

推荐理由:腾讯混元给OpenClaw这类长期协作智能体做了个记忆插件,思路是把记忆分层管理,再用快慢双系统决定什么时候调用什么记忆,目标是少记、记准、省 token。我会先打个折:目前只有官方一篇短文,没有可复现的测试、没提开源协议、也没有第三方对比,所以分数卡在 featured 门槛上。但给出的70%记忆缩减和35% token 节省这两个数,如果实测能复现,对跑长期 agent 的人来说确实挺省钱。

AI HOT 精选

NVIDIA 发布工厂运营蓝图 FOX,让 AI 智能体接管产线管理

NVIDIA 在台北 GTC 上推出了一个叫 FOX 的工厂运营蓝图,相当于给工厂装了一套能自主管产线的“AI 大脑”。富士康已经用它搭了一个叫 MoMClaw 的多智能体系统,把摄像头、传感器和产线数据喂给多个 AI 智能体,让它们协同干活。官方说,这套系统能把查找产线故障根因的时间缩短 80%,但正文没披露这个数字是在什么规模的产线、什么类型的故障...

推荐理由:英伟达在 GTC 台北丢出一套工厂运营蓝图 FOX,让多个 AI 智能体组团进产线干活。富士康已经拿它搭了 MoMClaw 系统,号称能把找问题根因的时间砍掉 80%。我会先打个折——这是厂商博客放出来的预期数字,不是实测报告,正文也没披露具体产线、样本量和对比基准。但方向本身踩中了现在企业最关心的:智能体能不能真进业务流程降本,所以还是值得看一眼。

AI HOT 精选

NVIDIA 发布 RTX Spark 本地 AI 电脑,1 petaflops 算力跑智能体,llama.cpp 优化让 Qwen 27B 吞吐翻倍

NVIDIA 在 Computex 上发了台叫 RTX Spark 的 Windows 电脑,专门在本地跑 AI 智能体。配置给得挺足:1 petaflops AI 算力、128GB 统一内存,意思是大模型不用来回倒腾显存。安全方面,他们和微软合作搞了个 OpenShell 运行时,用 Windows 新的安全接口把智能体锁在设备本地跑,数据不出机。性...

推荐理由:HKR 三项都踩中了:NVIDIA 把 RTX Spark 定位成本地智能体机器,给了 1 petaflops、128GB 统一内存和 llama.cpp 上 Qwen 27B 吞吐最高 2 倍的硬数字。因为是厂商博客发布,我会先打个折,分数落在 78–84 区间合理。

AI HOT 精选

英伟达发布 PC 芯片,正式杀入 Windows 笔记本市场

英伟达推了一款面向 PC 的新芯片,要跟英特尔和 AMD 抢 Windows 笔记本的生意。不过这篇报道正文没披露具体规格、定价、上市时间,也没提 AI 算力指标,所以性能到底怎么样、卖多少钱、什么时候能买到,现在都还不清楚。

推荐理由:Bloomberg 的信源让消息可信,Nvidia 杀进 Windows 笔记本这件事本身就够有话题性,所以 H 和 R 都成立。但文章几乎没给任何硬指标,K 完全站不住。我会先打个折:这条更像一个信号,不是一份能拿来评估的发布,别太激动。

AI HOT 精选

Qwen3.7-Plus:一个能看图、写代码、操作界面的多模态智能体模型

Qwen 发布了 Qwen3.7-Plus,把视觉理解和语言能力塞进同一个模型里,让它能直接看懂屏幕、操作手机 App、根据截图写前端代码,还能在命令行和图形界面之间来回切换干活。在 Terminal Bench 2.0 终端任务上拿了 70.3 分,比 Opus 4.6 Max 和 DeepSeek-V4-Pro Max 都高;在 Deep-Plan...

推荐理由:我会先打个折:正文只给了功能清单,没给任何硬指标。7 类能力听着挺全,聊天、看图、读文档、搜网页、调工具都塞进去了,但没参数、没价格、没上线日期,等于只看了个目录。这点先别太激动。不过 Qwen 这条线每次更新都会牵动国内从业者的注意力,尤其是把多模态和智能体绑在一起推,说明他们想在应用层抢身位。信息虽然薄,但话题本身够热,放在 featured 里提醒大家盯后续是合理的。

5月31日星期日

AI HOT 精选

苹果 WWDC 要拿 Gemini 蒸馏出的小模型跑在 iPhone 上,复杂问题还是会甩给谷歌云

下个月 WWDC 苹果会展示 Siri 和端侧 AI 的升级,核心思路是把谷歌 Gemini 模型“蒸馏”成一个小号版本,直接在 iPhone 芯片上本地跑,主打隐私和省 token 费。但整个技术栈对外依赖很重:本地模型源自 Gemini 蒸馏,手机处理不了的复杂请求会路由到谷歌云,还用了英伟达的机密计算。苹果之前承诺的 Private Cloud ...

推荐理由:这条消息我会先打个折,因为目前只有单一信源,正文没披露模型参数量、延迟、成本或合同细节。但它的信息量对从业者来说很实在:苹果在 WWDC 前被曝出用 Gemini 蒸馏模型救急,本地跑小模型保隐私,重活还是得走 Google 云和 Nvidia 机密计算,等于承认自研大模型没跟上。这个技术栈组合本身就说明苹果在端侧 AI 上选择了外部依赖,跟它一贯的全栈控制路线反差很大,所以给了 82 分,放在 featured 位置。

r/LocalLLaMA

不用改代码,让 OpenAI Codex 桌面客户端接任意模型和供应商

Reddit 用户 thibautrey 分享了一个三步走的方法:编辑 Codex Desktop 的 config.toml 配置文件,存好 API 密钥,再用一个叫 multicodex 的代理别名把 gpt-5.3-codex 这个模型名映射到 MiniMax-Latest。代理跑在本地 127.0.0.1:1455,会把返回的模型名伪装成 gp...

推荐理由:这是一条可复现的开发者操作流,不是官方发布。我会先打个折:正文没披露 MiniMax-Latest 的具体成本和延迟,也没说 proxy 稳定性如何,所以别急着在生产环境照搬。但 hook 很直接——不改代码就能在 Codex 桌面端用别的模型,配置细节也够落地,对想省钱或换模型的人有实际参考价值。

量子位 · 公众号

英伟达、微软、Arm 同发预告,传老黄自研 CPU 笔记本 N1X 要来了

三家公司在同一天发了同一张“PC 新纪元”的预告图,指向一台传闻中由英伟达主导设计的笔记本 N1X。目前流出的配置是 20 核 Arm 架构 CPU、Blackwell GPU、6144 个 CUDA 核心和 128GB LPDDR5X 统一内存,听起来像一台给 AI 开发者准备的移动工作站。不过正文没披露具体跑分和实测数据,内存带宽和 x86 转译效...

推荐理由:我会先打个折:这目前是三家同一天发暗示拼出来的硬件传闻,发布日期、价格、量产计划正文都没给。但“英伟达自研 CPU 塞进笔记本”这个组合拳,加上 128GB 统一内存这种能跑大模型的规格,确实值得当一条强信号来看。先别太激动,等实锤。

AI HOT 精选

特斯拉 FSD V14.3.3 用 4 天 21 小时横穿加拿大,6051 公里全程没让人碰方向盘

一群电动车爱好者开着搭载 FSD V14.3.3 的特斯拉,从温哥华一路跑到哈利法克斯,6051 公里零接管、零退出。变道、过施工路段、甚至每次进超充站自动倒车泊车,全是系统自己干的。这个版本放宽了对驾驶员盯路的判定,长途开下来没那么累。不过得说清楚,这仍是 L2 级辅助驾驶,法规上要求人随时准备接管。正文没提途中遇到的极端天气具体有多糟,也没交代是否...

推荐理由:我会先打个折:这是特斯拉自己放出来的单次行程,没有第三方验证,也没说清路线里高速和城市比例、天气变化、有没有施工路段这些容易翻车的细节。但 6051 公里零干预这个数字本身够硬,版本号也明确,对从业者来说是个可复现可质疑的靶子。分数停在 82 是因为它给了结果却没给边界条件,没法判断这到底是常态水平还是挑了个好天气跑出来的。

AI HOT 精选

Simon Willison 把 Python 网页应用直接跑在了浏览器里,不再需要后端服务器

Simon Willison 用 Pyodide(把 Python 编译成浏览器能跑的 WebAssembly)加上 Service Worker,让 Python 的 ASGI 网页应用完全在浏览器里运行。他让 Claude Opus 4.8 帮忙写了代码,做了两个能用的演示:一个基础 FastAPI 例子,另一个是他自己的 Datasette 1....

推荐理由:Simon Willison 用 Claude Opus 4.8 辅助开发,把 Python ASGI 应用搬进了浏览器,已经跑通了 Datasette 的演示。这件事的钩子在于:浏览器不再只是前端沙箱,可以直接当应用服务器用。技术栈交代得清楚,Pyodide、Service Worker、ASGI FastCGI 每一步都有据可查,不是概念图而是能跑的代码。我会先打个折,这目前还是个开发者实验,离生产环境还有距离,但思路对无服务器和边缘部署的人有启发。

AI HOT 精选

NVIDIA 用 DynoSim 给推理部署做模拟器,一次能跑几千种配置,速度是实时的 1500 倍

NVIDIA 给自家推理服务框架 Dynamo 配了个仿真工具 DynoSim,用 Rust 写成。它把部署测试变成“先在虚拟时间线上模拟、再挑最好的上真机”的流程,不用一个个试。测试里它能跑到实时速度的 1500 倍,一次筛几千种配置。正文没披露具体硬件环境、支持哪些模型和实测延迟数据,所以这个 1500 倍先打个折看——快是真的快,但省多少时间还得...

推荐理由:HKR 三项都成立:钩子是 1500 倍实时仿真,机制是虚拟时间线批量试配置,共鸣点打在推理成本和延迟上。单信源 NVIDIA 产品更新,信息量有限,放在 featured 低段合理。

AI HOT 精选

GitHub Copilot 改按 token 收费,开发者直接骂“开玩笑吧”

GitHub Copilot 把计费方式从订阅制改成了按 token 算钱,开发者社区炸了。token 就是模型处理文本的最小单位,用多少收多少,但正文没披露具体单价、生效时间,也没说免费额度还在不在。我会先打个折——如果单价定得高,写代码时每补一行都可能肉疼,这对重度用户影响不小。

推荐理由:HKR 三项都踩中了:计费模式切换本身是实打实的机制变化,开发者骂“开玩笑吧”自带冲突感,而按 token 收费直接关系到每个用 Copilot 写代码的人的钱包。我会先打个折——正文没给价格、token 单价和生效时间,这些关键信息全是缺口,所以重要性只能停在 75 这一档。对从业者来说,这条消息值得看一眼,但别急着算账,等官方把数字放出来再说。

5月30日星期六

TechCrunch · AI

我让谷歌的 24 小时 AI 助手 Gemini Spark 干了一天活,它确实挺有用

TechCrunch 的编辑实测了谷歌新推出的 Gemini Spark,把它当成一个全天候 AI 助手来用,主要干了整理邮件摘要和规划本地活动这两件事。体验下来觉得确实能帮上忙,但文章没搞懂谷歌为什么要把这个功能单独做成一个产品,而不是直接塞进现有的 Gemini 里。正文没披露这东西什么时候正式上线、要不要另外收费。

推荐理由:我会先打个折:正文没披露价格和发布时间,所以不能当产品发布看。但亮点在于,这是一篇上手实测,不是通稿。编辑用“actually pretty useful”收尾,说明 Gemini Spark 在收件箱摘要和本地活动规划这两个场景里跑通了,没翻车。对做 agent 的人来说,这种“替你干活”的体感比跑分重要。信息缺口明显,但反转叙事和具体场景撑住了 featured 的分数。