跳到正文

全部动态

今日 25 条

6月4日星期四

机器之心 · 公众号

谷歌放出 Gemma 4 12B,120 亿参数模型能在 16G 显存的笔记本上跑

谷歌发了 Gemma 4 系列的新成员,一个 120 亿参数的中等尺寸模型。它主打本地运行,16GB 显存或统一内存的笔记本就能带起来。架构上没走传统多模态那套编码器路线,直接原生支持音频输入,还带了一个叫 MTP 的推测解码模块来压延迟。模型用 Apache 2.0 协议开源。不过正文因为环境验证没加载出来,具体跑分、训练数据、实际推理速度这些关键信...

推荐理由:Gemma 4 12B 的卖点很直给:一个不算小的模型,能在普通笔记本上跑,还用了 Apache 2.0 协议。这对想自己折腾、又不想被云服务绑住的开发者来说,是个实在的更新。我会先打个折,正文没提具体推理速度和实际任务表现,光看参数和硬件门槛还不够,得等实测。但就凭“16G 笔记本能跑”这个钩子和宽松的开源协议,值得推给关注本地部署和成本控制的读者。

机器之心 · 公众号

办公室都在用嘴打字,敲键盘快成老手艺了

这篇文章本身没加载出来,微信页面显示环境异常需要验证,所以正文内容我没看到。从标题和已有的英文摘要看,讲的是 AI 语音输入工具正在进入办公和开发场景。Wispr Flow 这个产品全球下载量超过 250 万,12 个月留存率 70%,年用户增长 100 倍,说明用的人确实在猛增,而且用了就回不去。OpenAI 的 gpt-4o-transcribe ...

推荐理由:HKR 三项都站得住,但这是一篇带数据的工作流趋势观察,不是模型发布或平台级更新,放在 featured 里属于门槛线附近的那一类。我会先打个折,不把它当硬核技术突破看,但“打字正在变古老技艺”这个判断加上 250 万下载和 70% 留存,确实能让人重新想一遍语音交互的落地速度。

The Verge · AI

亚马逊给仓库机器人 Proteus 加了语音交互,工人可以直接用自然语言派活

亚马逊发布了新版 Proteus 仓库机器人,核心变化是工人不用再通过专用软件下指令,直接说话就能给它派任务,像跟同事沟通一样。Proteus 最早在 2022 年亮相,外形像个大号扫地机,负责在仓库里搬重货、推大车。这次升级主要是交互方式从代码/软件切到了自然语言,但正文没披露具体部署了多少台、单台成本多少,也没说语音指令在嘈杂仓库里的准确率怎么样。...

推荐理由:我会先打个折:Amazon 只说了 Proteus 能听懂人话,没给任何规模数据,所以重要性卡在 featured 门槛附近。亮点是交互方式从编程界面直接跳到口语对话,对一线工人上手门槛降得明显;但没披露部署量,效果和稳定性都还是未知数。如果是真的跑通了,省培训成本、提响应速度都说得通,这点先别太激动。

AI HOT 精选

ChatGPT 推出 Dreaming 记忆系统,能自动从聊天记录里提炼你的偏好,不用每次都重新自我介绍

OpenAI 给 ChatGPT 换了一套叫 Dreaming 的记忆架构,核心变化是模型会在后台自动翻看你的历史对话,把零散信息合成一个关于你的“记忆摘要”,而不是只靠你手动让它“记住”某件事。官方说这能解决旧版记忆容易过时、记不全的问题,让 ChatGPT 在跨对话时更懂你的偏好和长期项目。目前这个更新只对美国的 Plus 和 Pro 用户开放,免...

推荐理由:OpenAI 给 ChatGPT 加了个叫 Dreaming 的记忆系统,核心是跨对话记住你的偏好,让聊天更连贯。这事有热度,因为名字和“长期记住你”这个点本身就自带话题,隐私这根弦也绷着。但正文没披露默认开关状态、保留周期和推送范围,这些关键信息缺了,所以重要性先打个折,定在 84。

AI HOT 精选

OpenJarvis:斯坦福开源了一个本地优先的个人 AI 框架,把推理、工具、记忆都塞进设备里跑

斯坦福的研究人员放出了 OpenJarvis,一个开源的本地优先框架,目标是让个人 AI 助手直接在手机或电脑上跑,不用把数据传到云端。他们把个人 AI 拆成了五个基础模块:推理、工具调用、记忆、学习,还有一个叫“自我”的模块来协调这些能力。实测下来,在设备端用小模型跑这套流程,效果只比顶尖云端模型差 3.2 分,但每次调用的边际成本直接砍了约 800...

推荐理由:HKR 三项都站得住:本地优先加 800 倍成本下降是个好钩子,数字具体且能说明问题,话题本身也切中 agent 落地时大家最在意的成本和隐私。信息源深度一般,所以分数放在 78–84 这个区间,不往上拔。

AI HOT 精选

Hugging Face 改造命令行工具,让 Claude Code 这类编码智能体调用时省下 6 倍 token

Hugging Face 把自家的 hf 命令行工具重新设计了一遍,让它能同时服务人类和编码智能体。工具会通过环境变量自动识别是不是 Claude Code、Codex 等智能体在调用,如果是,就输出紧凑、不截断的 TSV 格式,而不是给人看的表格。在复杂多步任务测试里,没用这个 CLI 的智能体(比如自己拼 curl 或调 Python SDK)消耗...

推荐理由:我会先打个折:token 降到六分之一是官方说法,正文没给出测试场景和对比基准,实际省多少要看具体任务。但思路很清晰——传统 CLI 输出对人类友好,对智能体却是噪音,切成结构化 TSV 能减少大量解析和截断开销。自动检测智能体身份这一点也实用,不用手动切模式。整体是工具链层面的务实改进,不是模型或平台级发布,所以放在 featured 档合理。

r/LocalLLaMA

有人把折叠屏手机改成了跑本地模型的节点,用 Vulkan 加速

Reddit 用户 GsxrGuy80s 拿一台 Z Fold 6 当 GGUF 推理节点,走 Vulkan 加速,搭配 LiteLLM 和 Tailscale 组网。帖子公开了 gpu_layers=89 这个关键参数,说明把 89 层模型计算都扔给了手机 GPU。节点对外暴露 OpenAI 兼容接口,还设了 fallback 路由,请求搞不定就自动...

推荐理由:一个 Reddit 用户把折叠屏手机改成了本地大模型推理节点,用 Vulkan 驱动 GPU 加速,跑 GGUF 格式的模型,再通过 LiteLLM 统一接口、Tailscale 组网,让其他设备也能调用。帖子给了 gpu_layers=89 这个关键参数,还说明了模型崩了怎么自动切到备用路由。我会先打个折:这只是个人分享,没做压力测试,也没披露实际推理速度和功耗,稳定性存疑。但如果是真的,这种把闲置手机当推理节点的玩法挺省钱,也避开了云服务的隐私顾虑。对想自己折腾本地推理的从业者来说,这套组合拳(Vulkan+GGUF+LiteLLM+Tails...

AI HOT 精选

Anthropic 用 Claude 把 95% 的业务取数需求自动化了,准确率约 95%

Anthropic 公开了他们内部用 Claude 做自助数据分析的整套方案。核心思路是让非技术同事直接用自然语言问业务数据问题,系统自动查表、写 SQL、出结果。他们搭了一个三层架构:底层是数据基础层,负责把分散的业务指标统一成模型能读懂的语义;中间是验证工作流,专门处理模糊提问、过期数据和查不到的情况;上层是技能模块,让 Claude 学会按公司规...

推荐理由:我会先打个折,这是官方博客,数字肯定挑好看的讲。但 95% 自动化加约 95% 准确率,配上数据层、验证和 skills 这套 agentic analytics stack,确实把怎么做说清楚了。没有新模型或产品发布,所以分数在 72–77 这个区间。正文没披露错误类型的具体分布和延迟数据,这点先别太激动。

Latent Space

微软 CEO 纳德拉对谈:把 AI 做成生态,别只盯着一两个模型

纳德拉在 Build 大会的播客里聊了微软的 AI 思路,核心是把 AI 当成一个生态平台来做,而不是押注单个模型。他举了比尔·盖茨那条老原则:平台创造的价值得远超平台自己赚走的。微软这次主推的 MAI 系列模型,强调从预训练阶段就保证数据干净、可追溯,因为现在很多开源模型在榜单上看着漂亮,实际用起来不行。有意思的是他们拿一个 50 亿参数的小模型做“...

推荐理由:HKR 三项都踩中了:Satya 本人就是流量钩子,文章给出了微软企业级多模型平台的具体组件名,还透露了 5B 小模型用 traces 做 hill climbing 的机制,对从业者判断技术路线有参考价值。不过它终究是 Build 大会的访谈,不是独立模型发布,所以 78 分合理。

Hacker News 首页

谷歌发布 Gemma 4 12B:一个去掉独立图像编码器的多模态模型

谷歌在官方博客宣布了 Gemma 4 12B,主打“统一、无编码器”的多模态设计。简单说,它不再像传统模型那样给图片单独配一个视觉编码器,而是让同一个模型直接处理文字和图像。博客里没给架构细节、训练数据、基准跑分、定价和开源协议,只提了一句“能在笔记本上跑高性能多模态智能”。这点先别太激动——12B 参数在笔记本上跑通常需要量化或剪枝,但正文没披露用了...

推荐理由:Google 发了 Gemma 4 12B,说它是统一的无编码器多模态模型,意思是不再单独接一个视觉编码器,结构上更省事。但这条消息目前只有标题和 HN 讨论热度,正文没披露参数量怎么分配、训练用了什么数据、推理成本降了多少,也没给任何跑分。我会先打个折,把它放在 80 分上下,因为钩子够强,但事实太少,不值得冲太高。

6月3日星期三

r/LocalLLaMA

谷歌放出 Gemma 4 系列,12B 模型能看图文、听音频,上下文窗口拉到 256K

谷歌 DeepMind 把 Gemma 4 系列的开源权重挂上了 Hugging Face,一共五个尺寸。其中 12B 这个版本支持文本、图片和音频三种输入,同时放出了指令微调版和预训练版。它原生支持系统提示词和函数调用,上下文窗口最长能到 256K token,意味着一次可以塞进很长的文档或对话记录。不过 Reddit 原帖被网络策略拦截,正文没披露...

推荐理由:Gemma 4 这次把开放权重、多模态和 256K 长上下文一起端上来,比常规版本更新更有看头。我会先打个折:正文没给具体 benchmark 和 license 细节,官方博客也没同步,所以判断先停在 83 分。如果是真的,12B 这个尺寸能跑图、能听音频,对本地玩家挺省钱。

AI HOT 精选

Meta 把 AI 客服机器人推到了全球 WhatsApp Business 商家手里

Meta 正式在全球上线 WhatsApp Business 的 AI 客服机器人,叫 Meta Business Agent。它能自动回消息、推商品、约时间、筛销售线索,搞不定再转人工,Instagram 私信里也能用。收费按模型 token 消耗算,但具体价格和用的哪个模型,正文没披露。另外还在小范围测一个功能,让机器人每天早上给你总结前一晚的聊天重点。

推荐理由:Meta 把 AI 智能体塞进 WhatsApp Business 并全球铺开,等于让商家直接在聊天里接客、推销、处理售后。收费按 token 算,说明 Meta 想从对话量里抽成,但具体多贵、用的什么模型、哪些国家能用,正文全没写。我会先打个折:全球上线听着热闹,没价格和模型细节,商家算不了账,从业者也判断不了实际成本。这点先别太激动,等单价出来再看是不是真省钱。

OpenAI News

OpenAI 给 GPT-Rosalind 加了新能力,专攻药物研发和基因组学

GPT-Rosalind 是 OpenAI 为生命科学做的模型,这次更新接入了 GPT-5.5 的编程和工具调用能力,重点强化了药物化学、基因组学这些方向的推理。OpenAI 还专门搞了个叫 LifeSciBench 的评测,从证据处理、实验设计到结果验证六个环节打分,说新版模型在行业专家出的题上表现有提升。但正文没披露具体参数量、定价和普通用户能不能...

推荐理由:OpenAI 这次更新把 GPT-Rosalind 往生物和药物化学方向推,垂直落地的意图很清楚,所以重要性和行业信号都够。但正文没披露任何硬指标——参数多少、评测怎么做的、开放给谁用,全是空白,这点先别太激动。实验室场景天然带安全和合规风险,加上垂直模型抢地盘的话题,话题性也拉满了。综合看,信号强但证据弱,维持 featured 门槛没问题。

AI HOT 精选

微软 Build 2026:生图超谷歌,推理还在追

微软在 Build 2026 一口气发了七个自研模型,头一回做推理模型 MAI-Thinking-1。这是个万亿参数、每次激活 350 亿的大家伙,上下文窗口 12.8 万 token,专啃多步指令和代码。内部盲测说比 Anthropic 的 Sonnet 4.6 更受偏爱,但看公开跑分,大概跟 DeepSeek V3.2 打个平手。微软强调模型是从干...

推荐理由:微软在 Build 2026 上发了 7 个自研模型,图像生成直接对标 Google 并声称超越,推理模型则明确说还在追赶。同时公布了一种新调优方法和一个后台自主智能体。正文没披露具体模型名称、基准分数和开放时间,所以信息有冲击力但缺验证细节,重要性给到 84 是合适的,先别急着当定论。

Latent Space

微软一口气发了7个新模型,MAI-Thinking-1是主打,还附了109页技术报告

微软在Build大会上发布了7个MAI系列模型,覆盖文本推理、代码、图像、语音转文字和语音合成。主角是MAI-Thinking-1,一个35B活跃参数的混合专家模型,支持256K上下文窗口。它被定位为微软首个推理模型,训练数据链条干净,没有用任何第三方模型做蒸馏。随模型一起公开的109页技术报告在圈内评价很高,因为透明度给得足。报告里写明,模型的推理能...

推荐理由:我会先打个折:微软这次没公开模型权重、定价,也没给第三方评测结果,所以没法验证它实际有多强。但光凭 7 个模型、35B 激活参数的 MoE、256K 上下文和 109 页技术报告这几个硬数字,信息密度已经够高。加上这事发生在 Build 大会,直接摆在微软自家模型和 OpenAI 依赖的交叉点上,话题性拉满。正文没披露具体 benchmark 分数,这点先别太激动,但作为当天新闻,重要性给到 87 是合理的。

量子位 · 公众号

Papers with Code 复活了,Hugging Face 用 AI 代理把论文和排行榜重新串了起来

Hugging Face 的开源团队在 2026 年 5 月上线了 paperswithcode.co,用 AI 代理自动解析论文,把原来平台超过 9300 个基准测试的 SOTA 排行榜恢复了出来。这次复活正好赶上 CVPR,首页直接整理了会议论文和对应代码。正文没披露解析准确率和代理的具体工作流,但能看出他们想用自动化方式解决原平台长期停更的问题。

推荐理由:Hugging Face 把 Papers with Code 重新做回来了,这次用 AI 智能体自动解析论文,一口气恢复了 9300 个基准相关的排行榜。对做研究的人来说,这比手动翻论文找 SOTA 省事太多。我会先打个折:正文没披露智能体解析的准确率有多高,也没说排行榜更新频率和覆盖范围的具体边界,所以别急着当完全体用。但光是 CVPR 期间能一站式查代码和榜单,实用价值就摆在那。

量子位 · 公众号

扣子3.0实测:手机能远程遥控你电脑上的智能体干活

扣子3.0把智能体协作搬到了项目里,支持iOS、安卓、Mac、Windows和网页端。你可以把本地跑的Claude Code、Codex CLI这类命令行智能体导进去,在手机上授权后直接让它读你电脑里的PDF。正文没披露具体延迟和资源占用数据,实际体验得自己跑一遍才知道稳不稳。

推荐理由:HKR 三项都踩中了:扣子 3.0 让手机能远程指挥电脑里的 Agent,还支持导入 Claude Code 这类命令行工具,等于把 Agent 协作和跨设备控制绑在一起。不过它本质上还是一个产品更新,正文没提定价、推送范围和本地文件读取的安全边界,所以先放在 featured 这一档。

r/LocalLLaMA

微软在 Build 2026 发了两个端侧模型 Aion 1.0:一个管推理和调工具,一个管总结改写

微软在 Build 2026 大会上发了两个能在设备本地跑的模型,都叫 Aion 1.0。一个是 Aion 1.0 Plan,140 亿参数,专门做推理和调用工具,上下文窗口 3.2 万 token,会直接预装在配置够的 Windows 设备里。另一个是 Aion 1.0 Instruct,定位是总结、改写、理解意图、无障碍功能,会集成进 Edge 浏...

推荐理由:微软在 Build 2026 发了 Aion 1.0 Instruct 和 Plan 两个端侧模型,其中 Plan 是 14B 参数、32K 上下文的规划模型,会直接跟着 Windows 推给符合条件的设备。我会先打个折:文章没提许可证、跑分、具体硬件门槛,所以实际落地效果还得观望。但 Windows 内置这件事本身,分发优势和生态卡位就很明显,对做端侧 AI 和 agent 的人来说值得盯一下。

AI HOT 精选

ChatGPT 月活用户突破 10 亿,成为史上增长最快的应用

Sensor Tower 估算,ChatGPT 在 5 月全球月活用户跨过 10 亿,只用了大约三年,比 Google Maps、TikTok 和 YouTube 当年冲到这个数字的速度都快。不过,Claude 的增长势头更猛:2026 年第二季度月活 5600 万,同比涨了约 640%,而 ChatGPT 同期增速是 62%。一个值得注意的信号是,在...

推荐理由:这条消息的核心价值在于 Sensor Tower 提供了两个关键产品的用户规模估算,让行业能直观对比 OpenAI 和 Anthropic 的采用速度。我会先打个折,因为这是第三方估算,不是官方数据,但 10 亿月活和 640% 的同比增长仍然是很强的信号。正文没披露统计口径和误差范围,所以不能当精确财报看,但作为竞争格局的参考已经足够。

AI HOT 精选

xAI 发布 Grok Imagine 1.5 预览版,一张静态图就能生成 720p 视频

xAI 在 API 里放出了 grok-imagine-video-1.5-preview 模型,能把单张静态图片变成一段动态视频。你给它一张起始帧,再用自然语言描述想要的镜头运动、节奏和音效,它就会按你的指令生成一段最高 720p 的短片。官方说模型会尽量保留原图的光影和细节,让视频像是原图的延续,而不是重新画了一遍。它也支持把多段生成视频串起来,拼...

推荐理由:xAI 放出了一个能用的图像转视频 API 预览版,720p 输出加上用自然语言调镜头和音效,功能点很实在。我会先打个折,因为这只是个预览版,不是完整的基础模型发布,所以重要性停在 82 分。

AI HOT 精选

OpenAI 给 Codex 加了个 Sites 功能,能把你的想法直接变成能交互的网页

OpenAI 在 6 月 3 日上线了 Codex Sites 的预览版,目前只给 Business 和 Enterprise 用户用。你可以把想法、表格或计划扔进去,它会生成一个带托管链接的交互式网站,比如仪表盘、项目看板或规划器。生成的网站可以通过 URL 分享给团队里的指定成员,一起看、一起改。文章举了个例子:财务主管能把静态表格变成一个实时调整...

推荐理由:这是个产品更新,不是模型或底层能力发布。Codex 能直接吐网站确实实用,但先别太激动——目前只对企业版用户预览开放,正文也没说清楚生成的网站能复杂到什么程度、能不能接真实数据。我会先打个折,把它放在中等权重的产品更新档位。

AI HOT 精选

NVIDIA 发布 NemoClaw 蓝图,让工业软件能跑通自主 AI 工程师

NVIDIA 在 COMPUTEX 上放出了一个叫 NemoClaw 的开放蓝图,专门用来构建能长时间自主干活的 AI 智能体。十几家工业软件厂商已经用它来打造“自主 AI 工程师”,主要用在 CAE 仿真和 EDA 芯片设计流程里。按官方说法,以前要跑好几周的仿真和设计任务,现在能压缩到几小时内完成。不过正文没给出具体的测试基准、客户实测数据或错误率...

推荐理由:我会先打个折:这是 NVIDIA 官方博客发的,没有第三方验证,技术细节也基本没给。但它的核心信息够硬——NemoClaw 这个新平台专门瞄准 CAE 和 EDA 场景,让模型像工程师一样自主跑仿真和设计任务,而且已经拉了十多家工业软件厂商在用了。它抛出的“数周变数小时”虽然没讲清楚是怎么算出来的,但哪怕打个对折,对工业仿真这种重计算场景也是实打实的吸引力。这点先别太激动,正文没披露具体架构、模型规模和实测对比,后续得看有没有论文或客户案例放出来。

AI HOT 精选

Google DeepMind 在 GitHub 开源了一个给科研智能体用的工具包,叫 Science Skills

这个工具包专门用来搭科学发现场景里的自主智能体,让模型能跑科研流程。官方说它有两个好处:一是针对科学任务做了基础能力封装,二是 token 效率更高,也就是调用大模型时可能更省 token、更省钱。不过正文没披露开源协议、具体跑分数据,也没给出 token 节省量的数字,所以实际能省多少、效果怎么样,还得自己跑跑看。

推荐理由:这条消息有明确的开源动作和落地载体,对做智能体的人有参考价值。我会先打个折:正文没写许可证、没给基准测试结果,也没提 token 效率或成本数字,所以没法判断实际好用程度和复用门槛。这点先别太激动,等后续有实测数据再看。

AI HOT 精选

Claude Code 现在能自己派活给多个子模型,并行干活

Claude Code 新增了动态工作流,核心是让它在运行时执行 JavaScript 文件,按需创建并协调多个子代理(subagent)。每个子代理有自己的上下文窗口,互不干扰,可以同时跑研究、安全分析和代码审查这些任务。官方举的例子是让一个子代理查漏洞、另一个审代码逻辑,主代理最后汇总结果。正文没披露子代理数量上限和额外费用怎么算,这点先别太激动。

推荐理由:HKR 三项全中:Claude Code 用运行时 JS 编排带独立上下文的子代理,这是个实打实的新功能。Anthropic 的品牌有加分,但这次是功能更新而非模型或平台级发布,所以分数落在 78–84 区间。正文没提具体性能数据和价格变化,这点先别太激动。

AI HOT 精选

Claude Code 能按任务自动生成专属工作流了,用 JS 脚本调度子智能体干活

Claude Code 加了一个动态工作流功能,你给它一个任务,它会现场写一段 JavaScript 来指挥多个子智能体分工协作。你可以指定用哪个模型、工作区隔离到什么程度,适合做研究、安全分析、代码审查这类复杂活,写好的工作流还能共享和复用。不过正文没提具体会多烧多少 token,也没说这个功能现在是不是所有人都能用,这点先别太激动。

推荐理由:HKR 三项都过,但文章只给了机制层面的细节,token 增量、推送范围和定价都没提。因为跟 Claude Code 直接相关,所以放在中量级产品更新里偏高的位置。

AI HOT 精选

Runway 把 Aleph 2.0 视频编辑放上 API,最长能改 30 秒 1080p 多镜头片段

Runway 的 Aleph 2.0 视频编辑功能现在可以通过 API 调用了,你可以把它直接嵌进自己的应用或产品里。它支持对最长 30 秒、1080p 的多镜头视频做局部修改,只动你想改的那部分,其他画面不变。正文没提价格、调用频率限制、处理延迟和地区可用性,这些实际落地要用的信息都还没给。

推荐理由:Runway 是视频生成的核心玩家,Aleph 2.0 把局部视频编辑能力开放成 API,上限拉到 30 秒和 1080p。这是个实用的产品更新,不是模型级大版本发布,重要性中等偏上。

TechCrunch · AI

微软开源新工具,用文字描述就能给 AI 模型出考卷

微软发布了一个叫 ASSERT 的开源框架,让开发者直接用自然语言写测试要求,就能自动生成一套评估 AI 行为的考题和回归测试。正文没披露它具体支持哪些模型、打分指标怎么算,也没提使用限制。

推荐理由:我会先打个折:正文没披露这个框架支持哪些模型、具体用什么指标、以及跑起来的硬件或环境要求,所以实际能省多少事还不好说。但方向本身挺对——让开发者用自然语言写测试意图,而不是手搓脚本,确实能降低回归测试的门槛。微软把它开源出来,至少说明不是内部玩具。这点先别太激动,等看到跑分和兼容性再判断值不值得集成。

Hacker News 首页

微软发布 MAI-Thinking-1,一个主打复杂推理的中等成本模型

微软一口气发了七款 MAI 系列模型,这篇公告只重点介绍了 MAI-Thinking-1。官方说它擅长解决复杂问题,在 SWE-Bench Pro(一个测代码修改能力的榜单)上拿了高分,价格定在“中等权重”档位。但正文没披露参数量、具体跑分、定价细节和上线时间,所以实际性价比和落地表现还得等更多信息。

推荐理由:HKR 三条都踩中了:微软给模型起名 Thinking,又放出 7 个 MAI 模型,正好打在它和 OpenAI 若即若离的关系上,话题性够。但正文只说了发布,没参数、没评测、没时间表,信息密度很低,所以分数卡在 76 这个 featured 门槛上,没往上拉。

AI HOT 精选

Claude Platform 推出命令行工具,终端里直接跑 API 和托管智能体

这个 CLI 工具把 Claude Platform 的所有 API 端点都搬到了终端里。你可以直接在命令行调用 Messages API、启动 Claude 托管的智能体,然后把返回结果用管道传给 shell 做后续处理。官方提到,用 Claude Code 这类编码智能体来理解这个 CLI 也没问题。正文没披露性能开销或额外费用,实际用起来会不会增...

推荐理由:Claude Platform CLI 在 HKR 三项上都站得住,是个实用的开发者工具更新。不过公告只给了能力范围,安装流程、权限控制、安全限制和定价都没提,我会先打个折——实际落地好不好用,还得看这些缺口怎么补。

FT · 科技

Anthropic 要把网络安全模型 Mythos 推到 15 个以上的国家

Anthropic 计划将 Mythos 这个专门做网络安全的模型开放给更多地区,覆盖超过 15 个国家,大约 150 家机构会用上。正文被付费墙挡住了,没披露具体是哪些国家、什么时候开始、以及模型本身的技术细节或效果数据。

推荐理由:HKR 三项都过。Mythos 扩张有具体数字和地缘安全话题性,但正文只给了接入范围,没提能力细节、具体国家名单或使用条款,所以放在 featured 低分段。

TechCrunch · AI

微软给开发者发了份说明书,让 AI 代理的行为能按规矩来

微软发布了一份 AI 代理的行为规范说明书,让开发、合规和安全团队能把想让代理遵守的规则,写进可移植的策略文件里。正文没提版本号、开源协议、支持哪些开发框架,也没说什么时候正式上线。

推荐理由:我会先打个折:正文没披露版本号、开源协议和具体支持的框架,所以没法判断落地有多顺滑。但“可移植策略文件”这个机制本身是实在的,它让开发、合规、安全三拨人能用同一份文件定规矩,不用各说各话。对正在搭 Agent 的团队来说,规则能不能跨栈迁移是个真需求,这点先别太激动,但值得放进 featured 里提醒大家关注。

AI HOT 精选

微软推出 Scout 个人助手,基于 OpenClaw,能常驻在 Outlook 和 Teams 里干活

微软发了 Microsoft Scout,一个能一直挂在 Outlook、OneDrive、Teams 里的 AI 助手。企业可以把它分给员工,让它帮忙管日历、处理报销、起草邮件。微软副总裁 Omar Shahine 说这是他们第一次给客户一个真正的个人助手,功能比应用内嵌的 Copilot 更宽。不过正文没提 OpenClaw 具体是什么、怎么跟现有...

推荐理由:这篇就是微软 workplace agent 的产品更新,给了集成范围和任务类型,但没给定价、上线时间,也没技术细节。信息量够上 featured 低段,但别指望从这篇看出落地节奏。

The Verge · AI

微软在 Build 2026 上发了 Project Solara,一个给 AI 硬件跑智能体的安卓系统

微软在 Build 2026 大会上公布了 Project Solara,一个专门为跑 AI 智能体的硬件设计的操作系统。它底层是安卓,不是 Windows。现场展示了两个概念机:一个是类似 Echo Show 的桌面设备,用人脸识别解锁后可以直接调用各种 AI 智能体;另一个是可穿戴工牌,带摄像头和指纹扫描,能唤醒 AI 智能体。正文没披露具体上市时...

推荐理由:我会先打个折:正文没给发货时间、开发者接口和定价,所以别当产品发布看。亮点是微软在 Build 2026 上拿出的 Project Solara,一个跑在 Android 上的 AI 硬件系统,不是 Windows。现场有两台概念机,一台放桌上的带人脸识别,一台可佩戴的徽章带摄像头和指纹,说明微软在试探 agent 硬件长什么样。系统层面用 Android 意味着生态借力,但也绕开了自家系统,这点挺有意思。隐私那块正文没展开,只提了人脸和指纹,具体怎么处理数据没说。

AI HOT 精选

Google DeepMind 放出 Co-Scientist:让多个 Gemini 智能体组队,自己辩论、自己迭代科学假设

Google DeepMind 发了个叫 Co-Scientist 的系统,核心是用多个 Gemini 智能体搭成一个科研小组:有的负责生成假设,有的负责挑刺辩论,再让假设在内部迭代进化。官方说法是能帮科学家在复杂问题上找新思路。不过正文没披露具体用的是哪一版 Gemini、有没有跑过基准测试、开放方式是什么、什么时候能用上,这些关键信息目前都还是空白。

推荐理由:我会先打个折:正文没披露模型版本、评测结果和开放时间,所以目前只能当一次研究发布来看,别太激动。但 Gemini 被架成多智能体科研系统这个动作本身,说明 DeepMind 在认真推“AI 做科学假设”这件事,不是单次推理,而是让多个 agent 互辩、演进想法,思路比单纯刷榜有意思。对从业者来说,这更像一个方向信号,离能用的产品还有距离。

Latent Space

GitHub COO 聊怎么让平台接住 AI 代理的代码洪流

GitHub COO Kyle Daigle 说,2026 年 AI 驱动的代码提交量涨了 14 倍,这给原本按人类节奏设计的 GitHub 基础设施带来了很大压力,公开的宕机问题也跟这有关。他聊了 Copilot 的演变:从代码补全到命令行工具、桌面应用、云端代理和 SDK,以及 WorkIQ、MCP 这些让模型接入 Slack、邮件等公司上下文的方...

推荐理由:HKR 三项都成立:GitHub 高管给出 14 倍 AI 代码提交这个具体数字,把 Copilot、Actions、MCP、WorkIQ 和云端 agent 串成一条线来讲,信息量够。不是重大产品发布,所以重要性停在 80 分。

AI HOT 精选

OpenAI Codex 出了 Python SDK,一行命令就能把编程 Agent 塞进自己应用里

OpenAI Codex 发布了 Python SDK,安装命令是 pip install openai-codex。这意味着开发者可以直接在自己的代码里调用 Codex 的编程和生图能力,不用再单独打开 Codex 界面。更省事的是,SDK 能复用你已经在 Codex 上的登录状态,省去再搞一套鉴权的麻烦。不过正文没提 API 怎么收费、用的是哪个模...

推荐理由:我会先打个折:正文只说了怎么装和怎么登录,没给 API 价格、模型版本或限流条件,所以别急着算账。但这件事本身挺实在——Codex 不再只是个聊天窗口,而是能当零件用,pip 一装就能集成。对开发者来说,复用登录态省了一步鉴权麻烦,但没写清楚调用上限,真上生产还得自己测。整体是实用的产品更新,信息有缺口但不妨碍它值得关注。

AI HOT 精选

OpenAI 给 Codex 加了 Sites 功能,能把想法直接变成团队可用的网页或小应用

Codex 现在可以把你的工作内容、想法和计划直接转成一个交互式网站或应用,团队通过一个链接就能打开、使用和分享。这个功能会先推给 Business 和 Enterprise 用户,正文没提价格,也没说什么时候开放给其他套餐。

推荐理由:我会先打个折:正文没披露定价、权限边界,也没给实际效果案例,所以别急着把它当成成熟的生产力工具。但 Codex 从写代码延伸到直接出可交互站点,这个方向本身挺省钱——省掉了从代码到可演示原型中间的那一步。对企业和团队用户来说,一个 URL 就能让非技术人员上手试用,协作摩擦会小很多。这点先别太激动,等看到具体质量表现和计费方式再说。

TechCrunch · AI

OpenAI 在 Codex 里塞了六个白领岗位插件,覆盖数据分析、创意、销售、产品设计、股票研究和投行

OpenAI 给 Codex 应用上线了六个新插件,分别瞄准数据分析、创意产出、销售、产品设计、股票投资和投行业务。每个插件都打包了工具集成、操作指令和上下文,让 Codex 能模拟特定岗位的工作流。正文没提定价和开放范围,我会先打个折——没看到实际跑通的效果和成本之前,别急着把它当正式员工用。

推荐理由:OpenAI 把 Codex 从程序员工具扩成白领插件包,六个方向覆盖了数据、创意、销售、产品、股票和投行,动作不小。但正文没提定价、实际效果和推送范围,所以我会先打个折,把它放在中等权重的产品更新档。

6月2日星期二

TechCrunch · AI

Anthropic 把 Claude 的安全工具 Mythos 铺到 15 国的关键基础设施,覆盖电力、水务、医疗和通信

Anthropic 正在把自家的安全漏洞项目 Project Glasswing 和模型 Mythos 开放给 15 个国家的 150 家机构,专门盯电力、水务、医疗和通信这些命脉系统。按他们的说法,这些系统一旦被攻击,可能影响上亿人。正文没具体说 Mythos 是直接部署在本地还是通过 API 调用,也没披露这 150 家机构是免费试用还是付费签约,...

推荐理由:HKR 三项全中:规模有、行业有、安全痛点也有。没给更高分是因为正文只说了铺开范围,Mythos 具体怎么控、怎么评、出过什么问题都没提,所以先打个折。

AI HOT 精选

Holo3.1 发布:一套能在本地快速跑起来的电脑/手机操作模型

H公司把他们的电脑操作模型升级到了 Holo3.1,这次主打的是“哪里都能跑”。模型基于 Qwen 系列,一口气放出 0.8B、4B、9B 和 35B-A3B 四个尺寸,并且首次提供了 FP8、Q4 GGUF 和 NVFP4 这些压缩版本,方便直接在个人设备上做本地推理。35B-A3B 的旗舰版在 AndroidWorld 测试里拿到了 79.3% 的...

推荐理由:Holo3.1 把电脑操作智能体做成了本地可跑的版本,而且最小模型只有 0.8B 参数,对想在个人设备上试水的开发者来说门槛很低。四个尺寸加三种量化格式一起发,部署灵活度拉满,不是只给一个玩具。我会先打个折:正文没披露具体任务成功率或延迟数据,所以实际效果还得自己测。但就凭本地运行和量化支持这两点,已经够让做私有化部署的人点进去看了。