跳到正文

全部动态

今日 25 条

6月10日星期三

AI HOT 精选

Google Gemini 3.5 实时翻译开放公测,支持 70 多种语言、2000 个语言对

Google 把 Gemini 3.5 的实时翻译功能放出来了,现在通过 Gemini API 就能用。它做的是语音到语音的低延迟翻译,覆盖 70 多种语言,能组合出 2000 个语言对,冷门小语种也包含在内。开发者可以把它接进实时对话、客服、直播或跨国会议里。主推文提到这消息被 Anthropic Fable 5 的声量盖过去了,还顺带提了阿里 Qw...

推荐理由:HKR 三项都成立:Google 把实时语音翻译做成 API 公开预览,对开发者有直接吸引力,也给了语言覆盖和语言对的具体数字。但文章只提了功能开放,没写价格、延迟基准和可用区域,信息有缺口,所以重要性停在 78。

AI HOT 精选

Claude 托管智能体新增定时运行和环境变量保险库

Claude 的托管智能体(Managed Agents,让模型进业务流程干活的工具)现在支持用 cron 表达式设定时任务,到点自动跑,不用人守着。同时上线了 Vaults 功能,用来存 API 密钥、数据库密码这类敏感信息。智能体跑任务时能调用这些变量,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Va...

推荐理由:Claude 的托管智能体现在能设 cron 定时任务,到点自己跑,不用人盯。同时上了 Vaults 功能存 API 密钥、数据库密码这些敏感信息,智能体跑任务时可以调用,但模型本身读不到明文——密钥只在网络边界上才被替换成真实值。正文没披露定时任务的最小间隔和 Vaults 的访问控制粒度,这点先别太激动。整体是给智能体补运维能力,不是模型升级,所以分数就卡在这个位置。

AI HOT 精选

OpenRouter 的 Advisor 工具页面 404 了,正文没披露任何细节

OpenRouter 原本要介绍一个叫 Advisor 的工具,让 GPT-4o Mini 这类便宜模型在生成过程中可以随时去问 Claude Fable 等更强模型。但博客页面直接返回 404,文章不存在。定价、延迟、路由策略这些关键信息全都没公开,目前只能看到标题和摘要里的概念,没法判断实际效果和成本。

推荐理由:我会先打个折:OpenRouter 这篇博客直接 404,正文没披露定价、延迟、路由策略和实际效果,目前只有标题和摘要里的概念。概念本身有意思——让便宜模型在生成中途去问强模型,相当于给低成本模型配了个随时可叫的顾问,不是简单的 fallback 或静态路由。这点先别太激动,因为没数据验证到底省不省钱、延迟高不高、强模型被调用的频率和策略全都不清楚。对正在搭模型路由栈的团队来说,这个方向确实踩中了成本与质量的平衡点,但信息缺口太大,只能当产品信号看。

AI HOT 精选

上手 Claude Fable:Anthropic 的新模型让 AI 自己干活儿了

Ethan Mollick 提前试用了 Anthropic 的 Mythos 级模型 Claude 5 Fable。他的结论是,这模型比他用过的所有公开模型都强出一大截,而且人和 AI 的关系可能要变了。Fable 能自己连续跑十几个小时,执行好几页纸的指令。Mollick 让它从零做一个等时线地图,模型自己派了一堆子 AI 去查了 2200 多个航班...

推荐理由:Ethan Mollick 提前摸了 Claude Fable,说它比所有公开模型都强一截,能自己连续跑十几个小时、执行好几页纸的指令,甚至自己派子 AI 去查 2200 多个航班做地图。听着像模型能当项目经理使了,但正文没披露参数量、跑分、成本和什么时候能用,这点先别太激动。H 和 R 分高是因为新模型名加推理/代码定位确实抓眼球,K 分低是因为除了一个用例,关键信息全是缺口。Anthropic 光环有加成,但缺价格和基准测试,所以没到必写级别。

AI HOT 精选

Claude Fable 5 和 Mythos 5 发布:编程最强、能打游戏,但安全限制会误拦 5% 的对话

Anthropic 发了两个新模型:Claude Fable 5 和 Claude Mythos 5。Fable 5 是面向普通用户的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只通过美国政府合作项目开放。Fable 5 在软件工程、知识工作和视觉任务上都是新标杆——Stripe 测试时,它一天干完了原本一个团队两个月的代码迁移活;在...

推荐理由:Anthropic 一次发了两个模型,Fable 5 是普通用户能用的安全版,Mythos 5 是给网络安全防御方用的无限制版,目前只走美国政府合作渠道。Fable 5 在软件工程、知识工作和视觉任务上都刷了新纪录——Stripe 拿它做代码迁移,一天干完原本一个团队两个月的活。药物设计速度也快了 10 倍,这个数字挺夸张,但正文没披露具体测试条件和对比基线,先打个折看。定价方面,Fable 5 每百万 token 输入 10 美元、输出 50 美元,比前代贵了不少,得算算性价比。整体看,这是一次 Claude 主线模型的实质性更新,有定价、有基准...

AI HOT 精选

Cohere 发了第一个编程模型 North Mini Code,免费开源,上下文窗口 256K

Cohere 在 OpenCode 上放出了他们的第一个编程模型 North Mini Code,完全开源,上下文窗口能塞进 256K token,相当于一次能读很长的代码库。目前免费可用,正文没披露具体跑分、支持哪些语言和推理速度,实际编码能力得自己测一下才知道。

推荐理由:Cohere 终于出了编程模型,免费开源这点挺实在,256K 上下文意味着一次能吞下大半个代码库,省得来回切文件。但正文没给跑分、没提支持哪些语言、也没说推理快慢,实际好不好用得自己跑一遍才知道。我会先打个折,等有实测数据再往上调。

Hacker News 首页

Claude Fable 5 与 Mythos 5 系统卡:一个模型,两套安全锁

Anthropic 发了份 319 页的系统卡,讲的是同一个新模型拆成了两个版本:Fable 5 给大众用,但加了安全锁,不让它在生物、网安这类高危领域干活;Mythos 5 则把相关限制解开了,只开放给 Project Glasswing 等少数受信合作伙伴。先说能力,Mythos 5 是他们训过最强的模型,在漏洞开发这类网安测试里把 Opus 4....

推荐理由:Anthropic 在同一天发了 Claude 5 的两个版本和配套系统卡,Mythos 5 自称最强、但只给受信伙伴用,Fable 5 则在高危领域加了限制。这种能力分级和透明披露的做法,对关注模型安全与能力边界的从业者来说是个重要信号。放在 85–94 这个区间没问题,因为信息够新、够具体,而且直接关系到 Claude 用户和开发者的实际使用。

AI HOT 精选

GitHub Copilot CLI 现在能建自定义 AI 智能体,把一次性终端指令变成可重复跑的工作流

GitHub Copilot CLI 新增了自定义智能体功能,让模型能读懂你团队的技术栈和常用流程,把以前在终端里零散敲的提示词变成一套可复用的自动化工作流。正文没披露具体的配置方式、推送范围和是否额外收费,所以实际落地成本还不清楚。

推荐理由:GitHub 官方产品更新,HKR 拿到 H 和 R:自定义 Copilot CLI 智能体对开发者工作流有实际影响。K 偏弱,因为配置方式、推送范围和是否额外收费都没披露,所以定在 featured 门槛。

6月9日星期二

AI HOT 精选

Google 放出 Gemini 3.5 Live Translate,话没说完就开始翻,支持 70 多种语言

Google 发了 Gemini 3.5 Live Translate,一个实时语音转语音翻译模型。它不等对方把整句话讲完,边听边翻,用流式更新把结果推出来,延迟压到几秒,还能保留原声的语速、音高和语调。支持 70 多种语言,目前通过 Gemini Live API、Google Meet 预览版和 iOS/Android 的 Google 翻译 Ap...

推荐理由:HKR 三项都成立:Google 把实时语音翻译绑定了 70+ 语言和说话人未结束就开始的流式输出。分数留在 82,因为正文没披露具体上线范围、定价和基准测试结果,实际效果和可用性还得等验证。

AI HOT 精选

一位开发者用 GPT-5.5 替代 OCR 流程,把 2.3 万篇 ChinaRxiv 论文免费开放并配上更完整的英文翻译

这件事的起点很简单:有人觉得传统的 OCR(光学字符识别)管道太复杂,直接用 GPT-5.5 来读论文、做翻译,结果把 23,000 多篇 ChinaRxiv 上的论文免费放出来了,还带了比之前更完整的英文翻译。正文没披露具体成本、延迟和翻译质量对比,所以没法判断这套方案在准确率和开销上到底比 OCR 好多少。如果是真的省钱又省事,对需要批量处理中文论...

推荐理由:我会先打个折:这不是 OpenAI 官方模型发布,而是一个开发者用例,所以推荐分在 78–84 这个区间。HKR 三项都踩中了——用 GPT-5.5 砍掉 OCR 管道是个很具体的钩子,23,000+ 篇论文的规模也给了实感,对做文档处理和研究的人确实有用。但正文没披露成本、延迟和翻译质量对比,这点先别太激动,没法判断准确率和开销到底比 OCR 好多少。如果是真的省钱又省事,那对批量处理中文论文的场景挺有参考价值。

r/LocalLLaMA

苹果在 WWDC 发布了 CoreAI,一个给自家芯片用的端侧推理引擎,用来替代 CoreML

苹果在 WWDC 上公布了 CoreAI,定位是 CoreML 的继任者,专门在苹果芯片上跑模型推理。模型得先用 Python 脚本转一道才能用,目前支持的模型列表主要是 2025 年年中左右的版本。帖子正文没给出任何性能数据,速度、内存占用、功耗这些关键指标一概没提,所以实际跑起来快不快、省不省资源还不好说。另外原帖链接返回了 403,说明 Redd...

推荐理由:帖子本身信息很薄:CoreAI 接棒 CoreML、需要 Python 转换脚本、模型支持范围有限,这些是事实。但吞吐量、延迟、功耗一概没提,原帖链接还返回了 403,说明来源本身就不完整。苹果的本地推理引擎变动确实值得关注,但这点先别太激动,因为验证不了实际省不省资源。

AI HOT 精选

一个编程 Agent 串起两个 HuggingFace Space,自动生成了一个巴黎地标 3D 画廊

作者让一个编程 agent 自己动手,把 ideogram-ai/ideogram4 和 VAST-AI/TripoSplat 这两个 Space 串了起来。流程是:先用 ideogram4 生成巴黎地标的图片,再把图片喂给 TripoSplat,从单张图片重建出 3D 高斯泼溅文件(.ply),接着转成体积小约 3 倍的 .ksplat 格式,最后用...

推荐理由:我会先打个折:这不是模型或平台发布,而是一篇 Hugging Face Spaces 的实操教程。但作者把两个现成 Space 串起来,让 agent 自己跑通从文字到 3D 场景的流程,还给出了约 3 倍的压缩数据,对做 agent 编排和轻量 3D 管线的人挺实用。正文没披露生成质量和延迟的具体测试,这点先别太激动。整体放在 featured 档位合适。

AI HOT 精选

Qwen3.7-Max 靠一份 15 万字文档,4 小时做出能跑的手机和网页应用

实验里 Qwen3.7-Max 不看设计稿、不接后端,只读一份约 15 万字的产品调研文档,在隔离环境里分别生成了安卓 APK 和一个 Web 应用,单端耗时约 4 小时,中间没人插手。模型本身看不懂图,它是通过像素坐标反推布局来还原界面。做法是把任务拆成规划、架构、编码等阶段,每步做完就检查——静态检查、编译自检(0 error)、Web 端 34 ...

推荐理由:我会先打个折:正文没披露失败率、重试次数、人工介入点,也没说这15万字文档本身质量如何。但亮点在于它把模型看不懂图这个短板说清楚了——靠像素坐标反推布局,不是真懂设计。任务拆成规划、架构、编码并逐段自检的做法,让4小时出双端这件事有了可复现的骨架。如果是真的挺省钱,但没给对比基线,先别太激动。

AI HOT 精选

Cursor 把欧洲总部放在伦敦,计划招 200 人;SpaceX 手里攥着 600 亿美元收购它的选择权

Cursor 是做 AI 编程助手的,你告诉它想开发什么功能,它能自动生成代码。这次它把欧洲总部定在伦敦,主要是看中当地技术人才多、语言多元,方便服务整个欧洲市场。公司计划年底前把欧洲团队从现在的七八十人扩到 200 人左右,还会在巴黎、慕尼黑等城市设小办事处。一个关键背景是,很多欧洲客户(尤其是金融、医疗这类强监管行业)要求数据必须留在欧洲境内,所以...

推荐理由:Cursor 把欧洲总部放在伦敦,年底前团队要翻倍到 200 人,这本身是常规扩张。但 SpaceX 手里那个 600 亿美元的收购选择权让整件事变味了——一个做代码助手的公司被这种量级的选项挂着,估值想象力直接拉满。正文没披露触发条款和行权条件,这点先别太激动。另外提到 100 亿的合作伙伴数字,也没说清是收入口径还是 GMV,我会先打个折看。整体信息密度高,但信源单一,所以停在 77 分不进 78 那档。

AI HOT 精选

小米 MiMo 1T 模型跑出每秒超 1000 token,靠混合量化和并行解码把速度提了 10 倍

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式,输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化,只量化 MoE 的 Expert 部分,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下平均一次能接受 6.30 个 token,相当于猜对的命中率不低。系...

推荐理由:我会先打个折:正文没提硬件配置、batch size、并发数,也没说测试用的 prompt 长度和具体环境,所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分,不是全模型瞎压,搭配 DFlash 的块级 masked 并行推测解码,coding 场景下一次能猜对 6.30 个 token,命中率不低,说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式,还定了三倍 Pro 版的价格,摆明了是要在推理速度和 API 商业化上抢个身...

AI HOT 精选

SpaceX 要把 AI 数据中心搬上近地轨道,单颗卫星持续算力约 120 kW,延迟 6-8 毫秒

马斯克公布了 SpaceX 的 AI1 轨道 AI 数据中心卫星方案。每颗卫星峰值功率 150 kW,持续计算功率约 120 kW,大致相当于一个 NVIDIA GB300 机架的算力。卫星跑在 600-800 公里高的近地轨道,通过激光链路互联,带宽约 1 Tbps,往返延迟 6-8 毫秒。散热靠双面散热器,排热能力 1,400 W/m²;太阳能板效...

推荐理由:我会先打个折:发射时间、单颗卫星成本、实际跑过什么推理任务,正文都没提,所以别急着把它当成马上能用的方案。但亮点是实打实的——150 kW峰值功率、120 kW持续算力,直接对标一个GB300机架,散热靠双面散热器做到1,400 W/m²,这些数字说明散热和供电在工程上是认真算过的。激光链路1 Tbps、往返6-8毫秒的延迟,对近地轨道来说算低,但跟地面数据中心比还是高出一截,适合对延迟不那么敏感的大批量推理任务。整体看,这是个有硬核参数支撑的轨道算力方案,不是画饼,但离落地还差关键信息。

AI HOT 精选

GitHub 12.2 万星项目 Skills 加了个 Teach 技能,把工作目录变成能记住你学到哪的学习空间

Skills 仓库新出的 Teach 技能,核心是把一个普通文件夹变成有状态的学习环境。它用四个文件来追踪学习进度:MISSION.md 写目标,lessons/ 放课程,learning-records/ 记你已经掌握的东西(不是记“讲了什么”),reference/ 自动生成速查手册。五个机制里比较有意思的是 ZPD,会根据你的学习记录动态调整难度...

推荐理由:这条更新来自 Skills 仓库(GitHub 122K 星),核心是把一个目录变成带记忆的学习环境,靠四个文件追踪进度,ZPD 机制会根据你已掌握的内容动态调难度。对做 agent 记忆和可复现学习流程的人有直接启发。但信息源只有一篇 X 上的总结,没有基准测试、维护者细节或用户反馈,所以我会先打个折——概念扎实,落地效果还得看实际跑起来怎么样。

FT · 科技

苹果发布 Siri AI,想跟其他聊天机器人掰手腕

苹果终于把拖了很久的 Siri 大改版拿出来了,叫 Siri AI。FT 这篇报道的正文被付费墙挡住了,只返回了安全验证页面,所以具体改了啥、模型细节、什么时候能用、功能清单这些,正文都没披露。从标题看,苹果是直接冲着 ChatGPT 这类对手去的,但 RSS 摘要里只提了一句用户隐私承诺,别的信息全是空白。我会先打个折:光看标题像是个大动作,但没看到...

推荐理由:FT 的信源权威性加上 Siri 大改版这个动作,H 和 R 都站得住,所以能进 featured。但 K 过不了,因为正文除了隐私承诺什么都没给,模型规格、发布时间、功能清单全是空白,我会先打个折:光看标题像是个大动作,没看到实质内容之前别太激动。

r/LocalLLaMA

Apple 放出 MLX LM Server,让多台 Mac 通过雷电网口搭伙跑大模型

这篇 Reddit 帖子本身被屏蔽了,正文内容看不到,只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理,能同时处理多个子代理的请求,不会一个一个排队干等。它还支持分布式推理,可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型,相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

推荐理由:这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要拼出信息,所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理,多个子代理的请求不用排队干等;还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理,相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动,正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间,验证很弱。但思路本身对关注本地推理成本的人有参考价值,所以给到 featured 门槛以上。

AI HOT 精选

把 GitHub 的自动测试搬到 Hugging Face Jobs 上跑,Trackio 项目 CPU 任务快了约 30%

Hugging Face 发了篇博客,手把手教你怎么用 huggingface/jobs-actions 把 GitHub Actions 的 CI 流程搬到他们的 Jobs 服务上执行。核心思路是让 GitHub 把任务派给一个在 HF Jobs 里临时启动的“自托管运行器”,跑完就销毁。他们拿 Trackio 项目试了水,CPU 任务耗时缩短了约 ...

推荐理由:HKR 三项都站得住。H 靠的是“用 HF Jobs 当自托管运行器跑 CI”这个具体操作,不是空谈概念。K 有明确的产品名、Trackio 实测数据和约 30% 的提速数字,信息量够。R 切中的是 ML 团队常遇到的 CI 贵、GPU 不好找的问题。整体属于工具链层面的实用更新,不是平台级大发布,放在 featured 档位合适。

AI HOT 精选

Anthropic 发了个 Swift 包,三行代码就能在苹果 App 里调用 Claude

Anthropic 给苹果开发者送了个新工具:一个 Swift 包,让 Claude 直接接入苹果的 Foundation Models 框架。开发者写三行代码就能调用,返回的是 Swift 原生类型,不用自己解析 JSON。支持多步推理、代码生成、联网搜索和数据分析,跑在 iOS 27、macOS 27 这些新系统上。说白了,就是苹果在自己的 AI ...

推荐理由:HKR 三项都成立:Anthropic 确实发了一个让 Claude 接入苹果 Foundation Models 框架的 Swift 包,但这是开发者工具层面的集成,不是新模型发布,所以放在 featured 档里偏高的 82 分。正文没提这个包是否开源、有没有延迟或成本数据,我会先打个折,别把它当成 Claude 在苹果端全面铺开的信号。

The Verge · AI

苹果用 AI 让 Safari 用户自己“说”出浏览器扩展

苹果演示了 Safari 结合 Apple Intelligence 的新玩法:你只要用大白话描述需求,比如“把网上的菜谱存下来并加备注”,浏览器就能当场生成一个叫 Recipe Keeper 的扩展。这招是想解决 Safari 扩展数量一直追不上 Chrome 等对手的老问题,因为苹果对扩展开发的要求比较严。不过报道没提这个功能什么时候上线、需要哪个...

推荐理由:苹果演示了用自然语言让 Safari 自己写扩展,比如喊一嗓子“把网上菜谱存下来加备注”,浏览器就当场生成了一个 Recipe Keeper。这招是想解决 Safari 扩展一直比 Chrome 少的老问题,因为苹果对扩展开发卡得比较严。我会先打个折:正文只给了一个演示案例,没提什么时候上线、需要哪个系统版本、对开发者有什么限制,所以目前还只是一张饼。信息缺口明显,先按中等偏上的产品更新处理,给 73 分。

彭博科技

苹果 WWDC 2026 发布新智能系统,底层用了谷歌的技术

苹果在 WWDC 2026 上展示了一套新的智能系统,核心能力由谷歌的技术驱动。具体用了谷歌的哪款模型、系统什么时候上线、收不收费、开发者怎么接入,正文都没说——因为 Bloomberg 的原文被反爬机制挡住了,只留下 RSS 摘要里这点信息。我会先打个折:这更像一个合作信号,不是一份能评估的产品发布。

推荐理由:我会先打个折:Bloomberg 原文被反爬挡了,RSS 摘要只留下苹果在 WWDC 2026 展示了一套智能系统、核心能力由谷歌技术驱动这两句话。具体用了哪款模型、什么时候上线、收不收费、开发者怎么接入,正文都没说。所以这条更像一个合作信号,不是一份能评估的产品发布。H 和 R 能过,是因为苹果在自家开发者大会上把智能系统的底牌交给谷歌,这个动作本身就够反常,也直接踩在苹果 AI 追赶进度和平台竞争的敏感点上。K 过不了,信息缺口太大,没法判断技术实质。

彭博科技

苹果推迟在欧盟上线 Siri AI,称监管机构拒绝沟通

苹果说目前没法在欧盟地区的 iPhone、Apple Watch 或 iPad 上推出 Siri AI 功能。公司把原因归结为欧盟监管机构“拒绝沟通”,但正文没披露具体是哪些法规卡住了、双方谈了什么、以及有没有预计的解决时间。

推荐理由:这条消息有冲突、有事实、有共鸣,HKR 三项全中。苹果点名欧盟监管“拒绝沟通”,但正文没写具体是哪条法规卡了、双方到底谈没谈、以及有没有解禁时间表,信息缺口很明显。我会先打个折:没有技术细节和合规路径,只能算一条有话题性的产品/政策动态,放在 75 分的中等权重位置刚好,别因为苹果牌子就往上拔。

彭博科技

苹果回应隐私担忧,称用谷歌模型不会破坏数据保护

苹果对外解释,他们改造后的 AI 平台虽然部分用了谷歌的技术,但隐私保护机制还在。不过这篇报道的正文被 Bloomberg 的反爬机制挡住了,看不到具体用了谷歌哪个模型、是本地跑还是云端调、有没有第三方审计,以及隐私条款到底怎么写的。

推荐理由:HKR-H 和 HKR-R 都成立,因为苹果用谷歌模型这件事天然会冲击它自己的隐私人设。HKR-K 不成立:报道正文被 Bloomberg 反爬机制挡住了,模型名、部署边界、审计机制全都没披露,信息缺口太大,只能落在 72–77 这个区间。

Hacker News 首页

苹果公开了一套以 Google Gemini 模型为核心的新 AI 架构

苹果在 MacRumors 的报道里提到了一套新 AI 架构,明确说它是围绕 Google Gemini 模型搭的。正文没披露具体架构机制、用的是哪个版本的 Gemini,也没说什么时候上线。目前只有标题和 Hacker News 上的讨论链接,51 个赞、6 条评论,信息量很少,这点先别太激动。

推荐理由:HKR-H 和 HKR-R 都成立:苹果用 Gemini 搭架构,是平台竞争里一个高反差信号。HKR-K 不成立,因为正文没给任何机制、版本或上线时间,信息量太少,所以只放在 featured 这一档。

TechCrunch · AI

苹果给 iPhone 加了 AI 补全:帮你写完句子、修好照片、跑通快捷指令

苹果在 Safari、快捷指令和密码 App 里塞了 AI 功能,能自动补文字、修图和串流程。正文没提什么时候推送、支持哪些 iPhone 机型,也没说背后用的是哪款模型。

推荐理由:我会先打个折:正文只说了功能方向,没给时间表、机型范围和模型细节,所以不能当正式发布稿来读。但苹果在 Safari 里补文字、在快捷指令里串流程、在密码 App 里修图,这三个落点都是系统级入口,一旦铺开对 agent workflow 和端侧分发的冲击不小。这点先别太激动,等具体推送和模型信息出来再调判断。

TechCrunch · AI

苹果要给快捷指令加 AI:用一句话描述需求,它帮你搭好自动化流程

苹果在快捷指令 App 里塞进了一个 AI 功能,你直接用大白话告诉它想干什么,它就能自动生成对应的自动化流程。目前只放出了一小段 RSS 摘要,正文没披露具体上线时间、哪个系统版本会支持、收不收费,也没说背后用的是本地模型还是云端模型。这点先别太激动,等苹果自己把细节补上再说。

推荐理由:我会先打个折:正文只放了一段 RSS 摘要,没写上线时间、系统版本、收费模式,也没说背后是本地模型还是云端模型。能确认的是苹果让快捷指令听懂人话并自动生成自动化流程,这对从业者来说是个系统级 agent 的实锤信号。但细节全缺,先别太激动,等苹果自己把机制和限制补上再判断实际分量。

AI HOT 精选

苹果说欧盟《数字市场法》卡住了 Siri AI,iOS 27 和 iPadOS 27 在欧盟地区没法按时上线

苹果发了一篇简短声明,把锅甩给了欧盟的《数字市场法》(DMA),说因为监管要求,Siri 的新 AI 功能不会随 iOS 27 和 iPadOS 27 一起在欧盟推出。具体哪些功能被拦、什么时候能在欧盟上线,正文一个字都没提。

推荐理由:苹果这篇声明很短,核心就一句话:因为 DMA,Siri 的新 AI 功能不会跟着 iOS 27 和 iPadOS 27 在欧盟上线。我会先打个折——正文没列出具体受影响的功能,也没给任何时间表,信息缺口不小。但这件事本身信号够强:大厂的产品节奏被法规直接打断,不是技术问题,是政策问题。对做全球化产品的 AI 从业者来说,这是个实打实的案例,提醒你分区合规可能比模型训练还难搞。所以虽然细节少,还是值得放在 featured 位置。

TechCrunch · AI

苹果憋了很久的 AI 版 Siri 终于来了,想从语音助手变成 AI 伙伴

苹果发布了新版 Siri AI,想把 Siri 从听指令的语音助手升级成能陪你聊天、能干更多活的 AI 伙伴。不过 TechCrunch 这篇正文很短,没写具体用了什么模型、什么时候推送、要不要付费、到底多了哪些功能,这些关键信息都还没披露。

推荐理由:HKR-H 和 HKR-R 都过了,因为苹果拖了很久的 Siri AI 大改版本身就是个高关注度的产品故事。HKR-K 没过:正文没给模型、没给推送时间、没给具体能力,信息太虚,只能卡在 featured 门槛上。

The Verge · AI

苹果在 WWDC 发布 Siri AI,语音可调语速和口音,能读屏、跨应用操作

苹果在 WWDC 上公布了 Siri AI,说是“全新版本”,比旧版更会聊天、能力更强。语音可以自己调语速、表现力和口音。Siri AI 会做成系统级,能看懂屏幕内容,也能直接操作你的应用。软件工程高级副总裁 Craig Federighi 做了介绍,但正文没披露具体上线时间和支持哪些设备。

推荐理由:苹果在 WWDC 上把 Siri 重新包装成 Siri AI,核心变化是让它能看懂你屏幕上的内容,并且直接跨应用帮你操作,不再是以前那个只回答问题的助手。Craig Federighi 出来站台,但正文没给出具体上线日期,也没说哪些设备能跑。我会先打个折:功能听着挺实用,但没时间表就是画饼,所以重要性停在 86 分,没往上走。

AI HOT 精选

ChatGPT 现在能直接把数据变成图表,手机和网页端都上线了

ChatGPT 新增了图表生成功能,你给它数据或对比信息,它直接吐图表给你。官方说移动端和网页端都已经支持,但正文没披露具体支持哪些图表类型、数据量上限,也没说图表能不能二次编辑或导出。如果是真的挺省钱,不用再切到其他工具画图了。

推荐理由:HKR-K 和 HKR-R 都成立:这是 ChatGPT 一个具体的产品更新,能在手机和网页上生成图表。HKR-H 偏弱,正文也没说支持哪些图表类型、数据上限、能不能二次编辑或导出,所以放在 featured 这一档刚好。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

AI HOT 精选

NotebookLM 升级:对话里能直接干活,推理更强,但新格式和价格都没说

Google 给 AI Ultra 订阅用户推了个 NotebookLM 大更新。现在你在对话里就能让它执行多步骤任务,不用自己来回倒腾,相当于把 agent 塞进了聊天窗口。推理能力也升了级,处理复杂研究问题会更顺。官方说新增了一批输出格式,但正文没列具体是哪些,也没提价格会不会变、什么时候推给普通用户。我会先打个折:功能听着实用,但信息缺口不小,别...

推荐理由:HKR 三项都踩中:Google 确认 NotebookLM 给 AI Ultra 用户加了 in-chat agent、高级推理和多输出格式。但正文没列出具体格式、没提价格变动、也没说普通用户什么时候能用,信息缺口不小,所以停在中等权重的产品更新档位。

The Verge · AI

NotebookLM 换上 Gemini 3.5,能帮你搜资料,还塞了个云端电脑进去

Google 给笔记工具 NotebookLM 换了新模型 Gemini 3.5,官方说回答会更准更靠谱。现在你不用先丢一堆笔记或 YouTube 链接进去,直接问一个话题,它就能用 Google 搜索帮你找相关材料,等于把研究起点又往前挪了一步。另外还提到了一个“云端电脑”功能,但正文没展开讲具体能干什么、怎么用,这点先别太激动。

推荐理由:这是一次中等体量的产品更新,亮点是“云端电脑”和搜索式研究入口,但定价、铺开范围和实际效果正文都没给,所以别急着下结论。HKR 三项都踩中了:概念有钩子、功能有干货、场景够贴地,但信息缺口也明显。

6月8日星期一

r/LocalLLaMA

小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token

小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed,说他们在单台8卡的标准服务器上,把一个1万亿参数的混合专家模型(MoE)跑出了每秒超过1000个token的输出速度。这个速度如果属实,确实挺夸张,因为它没用Cerebras那种整块晶圆做的定制芯片,也没用Groq那种靠大量片上内存堆出来的硬件,就是普通GPU服务器。不过帖子正文...

推荐理由:小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度,没用Cerebras那种整晶圆芯片,也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的,确实挺省钱,但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数,也没给可复现的测试环境,所以我会先打个折,等更多细节出来再判断。

AI HOT 精选

Runway 发布 Aleph 2.0 视频编辑模型,上传视频后一键改横竖比例

Runway 在桌面网页版上线了 Aleph 2.0 编辑模型。你上传一段已有的视频,选一个想要的宽高比,模型会自动把多出来的画面区域补上,让视频看起来就像原本是按这个比例拍的。正文没披露生成分辨率、处理时长和收费方式,实际效果得自己试。

推荐理由:Runway Aleph 2.0 是个中等体量的视频产品更新,机制讲得清楚,但没给定价、画质评测和铺开范围。HKR 三项都踩中了,放在 featured 门槛的低位。我会先打个折:正文没披露生成分辨率、处理时长和收费方式,实际省不省时间、效果自不自然,得自己上手试。

Hacker News 首页

小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token

小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...

推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

r/LocalLLaMA

OpenEnv 改由多家公司共同管理,包括 Hugging Face、PyTorch、Prime Intellect 等

OpenEnv 这个用来给 AI 智能体创建终端、浏览器等执行环境的工具,现在不再由单一团队控制,而是转交给一个委员会来协调。初始成员有 9 家,包括 Meta 的 PyTorch、Unsloth、Modal、Prime Intellect、Nvidia 和 Mercor。不过 Reddit 原帖内容被屏蔽了,正文没披露具体的治理规则、各家出钱出力的比...

推荐理由:这条消息本身信息量不大,但动作很实在——OpenEnv 不再是一家说了算,而是拉了个委员会来管,初始成员有 PyTorch、Unsloth、Modal 等 9 家。对做智能体训练的人来说,执行环境归谁管、会不会突然改协议或停更,是选型时很实际的风险点。我会先打个折:正文没披露各家出钱出力的比例、决策机制和后续路线图,所以现在只能说治理结构变了,别急着解读成“大厂全面接管”。