跳到正文

全部动态

今日 25 条

6月8日星期一

AI HOT 精选

小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...

推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。

AI HOT 精选

微软AI负责人说超级智能快来了,但不会抢你饭碗

Mustafa Suleyman 在播客里聊了几个事。他判断超级智能不会造成大规模失业,但没给出具体论证。微软去年10月跟 OpenAI 签了新合同,一边继续合作,一边拿到了独立研发超级智能的许可,已经建了团队、在训前沿模型,本周 Build 大会还发了7个全模态模型。他点名批评 Anthropic 把 Claude 说成有意识,认为现在消费者对 AI...

推荐理由:Mustafa Suleyman 在播客里抛了个大判断——超级智能不会造成大规模失业,但正文没给出具体论证,这点先别太激动。信息量主要靠两个事实撑着:一是微软去年10月跟OpenAI签的新合同,既续了合作又拿到了独立研发超级智能的许可,团队和前沿模型训练都已经在跑了;二是本周Build大会发了7个全模态模型。他还点名批评Anthropic把Claude说成有意识,认为现在消费者对AI的理解还太浅。整体是CEO访谈,不是产品发布,所以分数卡在78-84这个区间。

AI HOT 精选

阿里云把 AgentScope 的 Java 版升到 2.0,主打企业级智能体在 JVM 环境里跑生产

这个版本把架构改成了分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能恢复。多租户用 Workspace 做数据隔离,权限控制做得比较细,还加了人工介入的环节。长期运行靠 HarnessAgent 管上下文和容错。开源地址在推文链接里,但正文没给出性能基准或实际部署规模的数据。

推荐理由:阿里云把 AgentScope 的 Java 版推到了 2.0,这次改动挺实在:架构拆成分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能接上。多租户用 Workspace 做数据隔离,权限粒度更细,还加了人工介入环节,长期任务靠 HarnessAgent 管上下文和容错。我会先打个折——正文没给性能基准,也没说实际部署规模,所以这些能力到底省多少资源、稳不稳,还看不出来。开源地址在推文链接里,但没披露定价或落地案例。整体是给 Java 技术栈的企业把智能体往生产环境推了一步,信息缺口明显,先放在 featured 这档。

AI HOT 精选

微信在测试右滑拉起的 AI 助手,能直接调小程序干活,还和主流手机厂商打通了

腾讯正在灰度测试一个藏在微信里的 AI 助手,右滑就能呼出。它用自然语言指令直接调用数百万个小程序,比如帮你点咖啡。微信还跟华为、荣耀、小米、OPPO、vivo 合作,让手机系统助手也能跨应用调微信的服务,6 月 8 号已经放出了开发者接入指引。不过原文因为环境异常没加载出完整内容,具体的技术实现和开放范围正文没披露。

推荐理由:这条消息的钩子很足——微信开始把自己当成 agent 运行环境,不是只聊天,而是直接调小程序干活,还同步打通了手机厂商的系统级入口。我会先打个折,因为原文没加载完整,技术方案、开放范围、模型选型这些关键信息正文都没披露,所以暂时不能给更高分。但右滑入口加开发者指引加五家厂商合作,三个点放在一起,已经足够让从业者重新评估微信在 agent 分发上的位置。

AI HOT 精选

微信 AI 开始内测,开发者有两种方式让小程序被 AI 直接操作

微信开放平台发了接入指引,确认微信 AI 在内测。开发者可以选两种模式:自动模式是授权平台读小程序源码,不用额外开发,AI 就能分析页面并直接操作;开发模式是自己写技能提交审核,让 AI 调用。两种模式不冲突,可以同时开,也不影响现有小程序服务。官方说“微信 AI”这个名字可能还会改。

推荐理由:这条消息对微信生态的开发者很关键,因为官方终于给出了接入路径,不是画饼。自动模式等于让 AI 直接读你的小程序源码去干活,省掉额外开发,但正文没提对复杂页面的理解准确率怎么样,这点先别太激动。开发模式更灵活,但需要自己写技能并审核,上线节奏和审核标准也没说。整体看,平台动作明确,但模型能力、收费方式和正式开放时间都还是空白,所以分数卡在 featured 门槛附近。

AI HOT 精选

苹果发了第三代基础模型,一共五款,从手机端到云端都有

苹果在 2026 年 6 月 8 日公布了第三代 Apple Foundation Models(AFM),这次是和 Google 合作定制的。五款模型里,两款跑在设备上:AFM 3 Core 是 30 亿参数的密集模型,质量比上一代好;AFM 3 Core Advanced 是 200 亿参数的稀疏模型,但每次只激活 10 到 40 亿参数,靠的是把...

推荐理由:苹果这次一口气发了五款模型,分设备端和服务器端两条线,还拉上 Google 做定制,信息量够硬。30 亿参数的密集模型和 200 亿参数但每次只激活一小部分的稀疏模型,思路很明确:在手机上跑得动,在云端也能控成本。正文没给具体跑分和定价,所以我会先打个折,但官方发布本身就有分量,尤其对做端侧推理和隐私计算的人。

AI HOT 精选

Hugging Face 把 OpenEnv 交给社区委员会管了,Meta-PyTorch、Unsloth 等都在里面

OpenEnv 是一个给 AI 智能体用的训练环境,比如模拟终端、浏览器,让模型在里面干活并学习。Hugging Face 宣布这个项目不再自己说了算,改由一个委员会来协调,首批成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia 等。项目代码已经搬到 huggingface...

推荐理由:这条不是模型发布,但比很多模型发布更值得看。OpenEnv 做的事很简单:给智能体一个能反复试错、学会干活的沙盒,比如在终端里敲命令、在浏览器里点按钮。现在 Hugging Face 把控制权交出来,换成委员会模式,首批成员名单挺能打——Meta-PyTorch 管框架,Unsloth 管训练加速,Modal 和 Prime Intellect 管算力,Nvidia 也在。技术上两个点值得留意:一是 API 照着 Gymnasium 那套强化学习标准来,老玩家上手快;二是集成了 MCP,让智能体在环境里干活时能直接调外部工具,不用自己从头写胶水代码...

AI HOT 精选

ChatGPT 要变成 AgentGPT 了

OpenAI 准备给 ChatGPT 做上线以来最大的一次改版,从聊天机器人转成一个能直接干活的 Agent 平台。它会整合自家的编程工具 Codex、图像生成,还会接入 Canva、Booking 这类第三方应用。高管放话说“聊天已死”,目标是做成跨平台的个人 AI 助手,以后甚至不用你手动输入提示词。改版预计几周内在网页和手机端上线。商业压力不小:...

推荐理由:这条消息把改版讲得挺清楚,但来源只是一条 X 帖子,正文没披露正式上线时间、开放范围和定价,我会先打个折。高管那句“聊天已死”听着唬人,实际产品还没交付,这点先别太激动。整体判断是:方向重要,落地细节还缺,所以放在 84 分这个位置。

6月7日星期日

r/LocalLLaMA

一台笔记本跑通 Qwen3.6 35B-A3B:我的本地模型“从零到一”时刻

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14,配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型,在 3.2 万 token 上下文时生成速度约 27 token/秒,拉到 25.6...

推荐理由:这是单个用户的 Reddit 实测,不是官方发布或论文,但硬件、量化方式、上下文长度和速度都给得很具体,对想在自己机器上跑大模型的人有直接参考价值。我会先打个折,因为只有一台机器的数据,不代表普遍表现,但信息密度够上 featured,分数放在 72–77 这个区间合理。

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。

FT · 科技

OpenAI 计划对 ChatGPT 做上线以来最大一次改版,但具体怎么改正文没披露

FT 这篇报道的正文被付费墙和安全验证挡住了,只拿到了一个摘要片段。里面提到 OpenAI 正在筹划 ChatGPT 自发布以来最大规模的一次改版,想把聊天机器人重新定位成通往更高利润产品的入口,为可能的 IPO 铺路。公司估值写的是 8500 亿美元。至于这次改版到底会加什么功能、什么时候上线、怎么收费、产品机制是什么,正文都没披露,这些关键信息目前...

推荐理由:FT 这篇报道的正文被付费墙和安全验证挡住了,只拿到一个摘要片段。里面提到 OpenAI 正在筹划 ChatGPT 自发布以来最大规模的一次改版,想把聊天机器人重新定位成通往更高利润产品的入口,为可能的 IPO 铺路。公司估值写的是 8500 亿美元。至于这次改版到底会加什么功能、什么时候上线、怎么收费、产品机制是什么,正文都没披露,这些关键信息目前是空的。所以这条消息的新闻价值在于信号本身——OpenAI 在认真考虑把 ChatGPT 从免费流量池变成付费产品管道——但具体怎么落地、靠不靠谱,现在完全没法判断。我会先打个折,等有功能细节和定价策略...

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

TechCrunch · AI

OpenAI 推出锁定模式,关掉联网功能来防提示注入攻击

OpenAI 给 ChatGPT 加了一个叫 Lockdown Mode 的开关,主要给处理敏感数据的商业用户和个人用。打开后,ChatGPT 会禁用实时网页浏览(只能读缓存内容)、从网页抓取和显示图片、深度研究以及让模型进业务流程干活的 agent 模式。这么做的目的是降低一种叫“提示注入”的攻击风险——攻击者会把恶意指令藏在网页或文件里,诱导模型把...

推荐理由:OpenAI 把提示注入防御做成了一个用户可操作的开关,不是后台补丁,而是直接限制四个高风险功能。对处理敏感数据的企业和个人来说,这是个实打实的安全选项,虽然会牺牲一部分能力,但换来了更可控的环境。安全/产品类新闻里算有分量,但比不上模型发布或重大能力更新。

6月6日星期六

AI HOT 精选

GitHub 开源 Spec Kit:先写产品规范再让 AI 写代码,把 vibe coding 的流程反过来

GitHub 把 Spec Kit 开源了,专门解决 AI 编程里一个常见毛病:需求还没说清楚,模型就开始写代码,结果边界漏了、反复返工。这个工具包把流程倒过来——先写产品功能规范,再让 AI 根据规范去澄清差距、做技术计划、拆任务,最后交给 agent 执行。规范本身成了可执行的开发合约,不是一份看完就扔的文档。目前支持 Copilot、Claude...

推荐理由:我会先打个折:正文没披露这套流程在实际项目里能省多少返工时间,也没给出和直接让 Copilot 写代码的对比数据。但故事本身够硬——GitHub 把“先写规范再写代码”这个老规矩做成 AI 编码的入口,规范不再是看完就扔的文档,而是驱动 agent 执行的合约。支持 Copilot、Claude 等多模型,109K+ 星说明开发者对这套思路的认可度不低。这点先别太激动,但方向对,值得跟。

新智元 · 公众号

Anthropic 花 280 美元一单,请 1000 名工程师给 Claude 的代码打分

Anthropic 通过 Snorkel 的 Marlin 项目招募了约 1000 名软件工程师,专门审查 Claude 写的代码。每完成一单任务给 280 美元,工作流包括在 GitHub 仓库里提 Pull Request、对 AI 生成的两版代码做 A/B 对比,然后从正确性、安全性、可靠性和可维护性四个维度打分。正文没披露这些工程师的资历门槛、...

推荐理由:HKR 三项都成立:价格和人数有传播力,流程和评估维度够细,对做代码 Agent 的团队有参考价值。放在 featured 合适,但不到 p1,因为这不是新模型或新能力发布,更像一次数据标注合作的具体披露。正文没披露工程师资历门槛和任务一致性控制,这点先别太激动。

机器之心 · 公众号

视频AI能一次生成5分钟了,京东开源JoyAI-Echo,告别抽卡式出片

京东放出了JoyAI-Echo,一个能一口气生成最长5分钟视频加音频的框架,而且全量开源。它主打跨镜头画面和声音的一致性,支持局部重绘,用8步DMD蒸馏来提速,最高能输出1472×2560分辨率的片子。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。

推荐理由:JoyAI-Echo把长视频生成的门槛拉到了5分钟,而且代码全放出来,不是只发篇论文。跨镜头画面和声音一致性、局部重绘、8步蒸馏提速这些点都踩在视频AI从业者的痛点上。不过原文因为微信环境验证没过去,具体效果和实测数据暂时看不到,这点先别太激动。单源覆盖、没有独立评测,分数放在78–84区间比较合理。

AI HOT 精选

Google 发布 Colab 命令行工具,本地终端能直接调用云端 GPU 跑脚本了

Google 把 Colab 搬进了终端。装一个命令行工具,就能在本地敲指令直接租用 A100 或 T4 这类高性能 GPU,把本地的 Python 脚本扔到云端跑,跑完再把模型、数据集和可回放的 notebook 日志拉回本地。它还给 AI 编程助手(比如 Antigravity、Claude Code)准备了现成的技能文件,让这些助手也能自己调 G...

推荐理由:Google 给 Colab 出了个命令行工具,不用开浏览器就能在终端里租 GPU 跑代码,跑完自动把模型和 notebook 日志拉回本地。还顺手给 Claude Code 这类 AI 编程助手配了技能文件,让助手也能自己调 GPU。对经常用 Colab 白嫖算力或者想给 agent 接远程执行环境的人来说,这比网页版灵活不少。不过正文没提价格变化和并发限制,实际租用体验还得看后续。

AI HOT 精选

Gemini Live 现在能边聊边改图,摄像头对着什么就实时生成新画面

Gemini 应用里的 Live 模式加了实时生图和编辑功能。你打开摄像头,告诉它你想看到什么,它就能当场改画面,比如换墙色、加家具、把眼前场景变成梗图。正文没提生成一张图要多久、支持哪些画风,也没说免费额度怎么算。

推荐理由:Gemini Live 现在能边看边改图了,你开着摄像头说“把墙刷成蓝色”或者“加个沙发”,它当场给你变出来。这功能听着挺唬人,但正文没交代生成延迟、画风支持范围,也没提免费额度,所以实际用起来卡不卡、花不花钱,都得打个问号。HKR 全过:标题有实时交互的噱头,操作门槛低到只剩张嘴,而且直接冲着修图软件和创意工具去的,竞争味很浓。

Hacker News 首页

General Instinct 开源 InstinctRazor:把 245GB 的大模型压到 48GB,能在本地设备上跑

General Instinct 开源了 InstinctRazor,一个专门给边缘设备用的模型压缩方案。他们拿 Qwen3.5-122B-A10B 开刀,这个模型原本是 BF16 格式的混合专家模型(MoE),体积大约 245GB。压缩后变成一个 48GiB 的 GGUF 文件,比 Gemma-4-26B-A4B 还小,但在 MMLU-Pro 和 G...

推荐理由:我会先打个折:这是 YC 的 Launch HN,不是独立评测,性能数据得等第三方复现。但亮点很实在——把一个 245GB 的 MoE 模型压到 48GiB,还能在消费级显存上跑 8k 上下文。正文没披露压缩后推理速度有多快,也没说 MMLU-Pro 具体掉了多少分,这点先别太激动。不过思路本身对想在本地跑大模型的团队挺省钱,所以放在 featured 合适。

Hacker News 首页

Google 发布 Gemma 4 的 QAT 版模型,让手机和笔记本跑起来更省内存

Google 放出了 Gemma 4 的量化感知训练(QAT)检查点。简单说,就是在训练时就考虑压缩,而不是训完再硬压,这样模型在手机、笔记本上跑的时候占内存更小、速度更快。不过这篇公告只给了个标题和链接,正文没披露具体压到几比特、有哪些尺寸、跑分对比和发布时间。我会先打个折,等实际模型放出来再看效果。

推荐理由:Google 放出了 Gemma 4 的量化感知训练检查点,目标是在手机和笔记本上跑得更省内存、更快。但公告正文太薄,没给出具体压到几比特、有哪些尺寸、实测提升多少,也没说什么时候能拿到模型。信息缺口明显,只能先给 featured 底分,等实际模型和跑分出来再重新判断。

6月5日星期五

AI HOT 精选

苹果内部把新版 Siri 标成“Beta”,不会当成品来宣传

彭博社记者古尔曼爆料,苹果内部将新版 Siri 标记为“Beta 版”,意味着它不会被宣传成完全成熟的产品。苹果可能还会像当初推 Apple Intelligence 那样,给想尝鲜的用户设一个等待名单。另外,iOS 27 的部分 Siri 请求会转到 Google Cloud,调用授权版 Gemini 模型,并跑在谷歌的英伟达 Blackwell B...

推荐理由:HKR 三项都成立:Siri 标 Beta 是苹果自己的态度信号,Gemini 和 B200 的细节让爆料有料,苹果 AI 依赖外部算力和模型这件事本身就容易引发讨论。分数定在 82 合理,因为毕竟还是未发布产品的二手报道,不是官方发布或重大产品事件。

AI HOT 精选

Meta 把未启用的人脸识别代码塞进了智能眼镜 App,已推送到超 5000 万台设备

安全研究员从 Meta 智能眼镜的配套 App 里拆出了一套叫 NameTag 的人脸识别功能代码。这套代码虽然没开启,但核心组件已经通过应用更新,静默分发到了下载量超 5000 万次的设备上。它的工作流程是:用三个 AI 模型分别完成人脸检测、图像裁剪和把人脸转成生物特征模板(faceprints),然后跟手机本地数据库做比对。识别成功会弹通知,没认...

推荐理由:这篇东西挖出了 Meta 智能眼镜 App 里藏着的 NameTag 人脸识别代码,虽然没开启,但核心组件已经通过更新静默塞进了超 5000 万次下载的设备里。我会先打个折:它毕竟不是官方发布或重大事故,只是一篇基于代码拆解的深度报道,所以重要性我给到 82,刚好跨过 featured 门槛。HKR 三条全过:热点是隐藏代码加 5000 万设备规模,知识量有三模型本地比对的具体流程,关联度则踩中了中美算力差距和效率竞赛的从业者神经。正文没确认功能已对用户开放,所以分数没再往上拉。

r/LocalLLaMA

微软没出 Qwen3.6-27B 或 Gemma-4-31B 这种尺寸的模型,而是发了一组 MAI 系列

Reddit 上有人吐槽微软应该发类似 Qwen3.6-27B 或 Gemma-4-31B 这种中等体量的开源模型,结果他们放出来的是七个 MAI 模型。其中 MAI-Thinking-1 参数规模标的是 1T A35B,上下文窗口 256K;MAI-Code-1-Flash 是 137B A5B,同样 256K 窗口。帖子正文被网络策略挡了,看不到更...

推荐理由:微软一口气放出 7 个 MAI 模型,带推理和代码变体,256K 上下文窗口,信息量够得上 HKR-K 和 R。帖子拿 Qwen3.6 和 Gemma-4 当参照物,说微软早该发这类中型模型,这个追赶角度撑起了 H。不过来源是 Reddit 吐槽帖,正文还被网络策略挡了,缺基准测试、许可证和定价细节,所以停在 featured 档,上不了 P1。

Hacker News 首页

Lowfat:一个命令行过滤器,帮作者省了 91.8% 的 LLM token

Lowfat 是一个可插拔的 CLI 过滤工具,能自动把 kubectl、docker、grep 这类命令输出的冗余信息(比如表格边框、空行、重复标题)裁掉,只保留关键内容再喂给大模型。作者自己用了两个月,原始输出总共 440 万个 token,过滤后只用了 30 万,省下 410 万 token,换算下来节省了 91.8%。它可以作为 shell 包...

推荐理由:我会先打个折:这是个个人 Show HN 项目,不是大厂发布,但 91.8% 的 token 节省率配上两个月的实测数据,说服力够强。它解决的不是什么高深问题,就是把 kubectl、docker 这类命令输出里的表格边框、空行、重复标题裁掉,只留干货再喂模型。这事做 agent 的人都懂——工具返回一堆格式垃圾,token 烧得飞快,上下文还被撑爆。Lowfat 的思路简单粗暴,但正好打在痛点上。不过正文没提兼容性边界和极端情况,这点要留意。整体看,数据扎实、痛点真实,放在 featured 门槛上没问题。

新智元 · 公众号

蔚蓝科技卖了2.5万台四足机器人,90%进了普通人家

蔚蓝科技的四足机器人已经卖出2.5万台,覆盖295个城市,其中家庭用户占了九成。他们新发布的BabyAlpha A3算力比上一代提升了1000倍,能在机器上直接跑一个70亿参数的大模型。不过正文因为环境异常没加载出来,具体的技术细节和价格信息暂时看不到。

推荐理由:HKR三项都过了:标题抓人,数据有料,话题踩在家庭机器人和端侧大模型的竞争神经上。不过正文因为环境异常没加载出来,技术细节和价格都看不到,信息主要来自公司单方面口径,不是独立验证的行业突破,所以放在featured的低位。

量子位 · 公众号

与其砸100亿做人形机器人,不如先让10万台机器狗进家庭

蔚蓝科技的BabyAlpha系列机器狗已经卖出25397台,其中九成是家庭用户买回去用的。他们最新的A3机型能在本地跑一个70亿参数的大模型,官方给出的推理速度是每秒280个token。不过正文因为环境验证问题没加载出来,具体配置、价格和实际体验细节暂时看不到。

推荐理由:HKR 三项都过:有明确的走访对象和销量数据,有端侧推理的具体指标,话题也切中中美算力差距和效率竞赛。但正文因为环境问题没加载出来,缺少配置、价格和实际体验细节,本质上还是一篇带有观点的产品进展评论,不是模型发布或平台级事件,所以放在 featured 档的偏上位置。

Computing Life · Share · 鸭哥调研

Grok Build 0.1:xAI 押注并行广度,但还没交出成绩单

xAI 在 2026 年 5 月推出了编程 agent Grok Build 0.1,CLI 和 API 先后上线。它跟 Claude Code 走的是两条路:Claude 靠单个深度 agent 加 1M 上下文窗口死磕复杂重构,Grok Build 则用 8 个并行子 agent 各干各的,靠速度(100+ tokens/秒)和广度抢活。定价是 A...

推荐理由:xAI 的 Grok Build 0.1 走了一条和 Claude Code 完全不同的路:不拼单 agent 的深度和超长上下文,而是用 8 个子 agent 并行干活,靠推理速度抢时间。这个思路本身有信息量,但文章没给基准测试结果,也没说清楚并行方案在实际项目里到底省不省钱、会不会互相踩脚。定价只提了 A 开头,后面断了,隐私条款也没展开。所以先放 featured,等有实测数据或者成本细节再往上调。

AI HOT 精选

ChatGPT 记忆功能今天大升级,但具体怎么升还没说

Sam Altman 发推说 ChatGPT 的记忆功能今天有重大升级。正文没披露记忆机制怎么改、覆盖哪些用户、有没有新的控制选项、是否收费、以及分批推送的时间表。我会先打个折,等官方补细节再判断实际变化有多大。

推荐理由:HKR-H 和 HKR-R 通过,因为 Sam Altman 的推文指向一次记忆升级,但 HKR-K 不通过:正文没披露机制、用户范围、控制选项和推送时间表,信息缺口太大。

Hacker News 首页

Anthropic 开源了一套 AI 挖漏洞的工具包,把威胁建模、扫描、修补丁串成一条自动流水线

Anthropic 在 GitHub 上放出了一个叫 defending-code-reference-harness 的开源项目,把威胁建模、代码扫描、漏洞分类和打补丁这些安全活儿打包成一套可定制的自动化流程。项目页面上说你可以把它当成一个“自主扫描引擎”来用,但正文没披露这套东西在真实漏洞挖掘上的准确率、误报率,也没给出跟现有扫描工具的对比数据。目...

推荐理由:Anthropic 的招牌加上一个实打实的 GitHub 仓库,让 HKR 的 H 和 R 都站得住。但文章本质上是一封公开信和政策呼吁,不是已经落地的法律或产品,框架的实际效果、基准测试全都没给,所以 K 不成立。话题分量够上 featured,但信息缺口把它卡在 72–77 这个区间,74 分合理。

AI HOT 精选

OpenAI 在生成接口里直接返回内容审核分数,不用再单独调一次审核接口

OpenAI 把内容审核评分塞进了 Responses API 和 Completions API 的返回结果里。你现在发一次请求就能同时拿到生成内容和对应的安全分数,不用像以前那样先调生成接口、再调审核接口。拿到分数后,你可以自己决定怎么用:记日志、做路由分发、人工复核,或者直接拦截。正文没披露这个审核模型的延迟会增加多少、准确率怎么样,也没说和独立...

推荐理由:HKR-K 和 HKR-R 都成立:OpenAI 把审核分数塞进生成响应里,开发者可以据此做路由和拦截,省掉一次单独审核调用的开销。HKR-H 偏弱,因为这只是公开信和功能更新,不是已生效的法律或硬性安全突破,所以放在 featured 档位。正文没给出法案文本和执行时间表,实际省钱效果还得看调用量和审核精度,但方向上是给安全管线减负。

TechCrunch · AI

苹果首次放行 AI 代理进 iMessage 商家聊天,Poke 拔得头筹

苹果批准了 Poke 接入 Messages for Business,这是该平台第一个能直接跟用户发短信干活的 AI 代理。Poke 本身做的就是让用户通过短信使唤 AI 助手,这次相当于把它的服务嵌进了苹果官方的商家消息通道。不过正文没披露苹果的审核标准是什么、这次开放的范围有多大,也没提商业分成怎么算。

推荐理由:HKR-H/K/R 都过,但正文很薄:只确认了 Poke 获批和“首个”身份,没给出审核规则、铺开节奏或商业条款。这更像一条门槛级的产品动态,够 featured,但信息密度撑不起 78 分以上的段位。

AI HOT 精选

Codex 加了个 iOS 应用构建插件,不用切窗口就能预览和改代码

OpenAI 给 Codex 接入了 Build iOS Apps 插件,现在你可以在 Codex 的内置浏览器里直接跑 iOS 应用、打开 SwiftUI 预览,改完代码也能热重载,不用来回切换工具。正文没提这个插件是官方做的还是第三方贡献的,也没说支持哪些 iOS 版本或设备型号。

推荐理由:HKR 三项都过:钩子是 Codex 直接处理 iOS 应用测试,有 SwiftUI 预览和热重载这些具体细节。但这是一封公开信和政策呼吁,不是已生效的法律,正文也没给出法案文本和执行时间表,所以放在 featured 而不是更高。

AI HOT 精选

Replit Agent 接入 Shopify,描述卖什么就能自动搭好一个独立站

Replit 和 Shopify 打通了:用户在 Replit Agent 里说一句想卖什么,Agent 会直接生成自定义店铺页面、创建 Shopify 商店并上架商品。建完去 Shopify 认领店铺、设好支付就能开卖。正文没提收费方式、支持的地区和具体上线时间,如果是真的,对想快速试水电商的人挺省事。

推荐理由:HKR 全过:Shopify 打通流程对开发者有实感,但这是公开信和政策呼吁,不是已生效法律,法案文本和执行时间表都缺失,所以停在 featured 档。判断挂在信息缺口上——没提收费和地区,省钱与否得等后续。

AI HOT 精选

Boson AI 和 LMSYS 把 Higgs Audio v3 TTS 跑在了 SGLang-Omni 上,一个 4B 参数的语音合成模型,主打低延迟...

Higgs Audio v3 TTS 是 Boson AI 的语音合成模型,参数量大约 4B,底层用了 Qwen3-4B。它支持 100 种语言,在内部测试集上词错率/字错率能压到个位数。这个模型专门为语音助手那种边说边生成的场景设计,不等句子结束就能开始合成,后续文本到了还能保持声音、情绪和节奏连贯。开发者可以直接在输入文本里插标签来控制 20 多种...

推荐理由:H 和 K 靠 4B/100 语言/流式合成这几个硬指标撑住。R 偏弱,因为文章没给延迟、定价和权重,更像一个能力宣告而非可立刻复用的发布,所以放在 featured 低位。

6月4日星期四

AI HOT 精选

neolab 发布 Nex-N2-Pro,一个 397B 参数的混合专家推理模型,跑分自称摸到 GPT-5.5 水平

这个模型基于 Qwen3.5-397B-A17B 改造,总参数量 397B,用了混合专家架构(MoE,把任务分给不同子模型处理,省算力)。它能处理 26 万多字的长上下文,也支持图像识别。官方说它在 Terminal Bench 2.1、GDPVal、SWE-Verified 这几个测试集上拿了最高分,性能对标 GPT-5.5 和 Claude Opu...

推荐理由:HKR 三项都过:标题的 benchmark 钩子够强,正文也给了模型尺寸、上下文和 token 缩减的具体数字。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高。

r/LocalLLaMA

华为开源 KVarN:KV 缓存压缩 3 到 5 倍,推理反而更快,不是减速

华为放出了一个叫 KVarN 的 KV 缓存量化方法,Apache 2.0 协议,已经能通过一个开关直接跑在 vLLM 上。它能把存上下文的那块显存压到原来的 1/3 到 1/5,吞吐量最高比 FP16 还快 40%。和之前的 TurboQuant 不一样,它在推理任务上不会崩。不需要改模型、不用重新训练、也不用校准数据。不过帖子正文被 Reddit ...

推荐理由:HKR 全过:钩子够具体,正文给了压缩比、吞吐和接入方式,对做推理部署的人省钱省资源。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高档位。

r/LocalLLaMA

英伟达放出 Nemotron-3-Ultra 超大 MoE 模型,550B 总参数但只激活 55B,最低要 8 张 H200 才能跑

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16,一个混合专家(MoE)模型。总参数量 550B,但每次推理只激活其中 55B 参数,相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token,能一口气处理很长的文档。硬件门槛不低,官方列的最低配置是 8 张 H200...

推荐理由:这条消息干货集中在规模和硬件门槛上:550B 总参数、55B 激活、100 万 token 上下文,最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间,所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器,能直接筛出一批会认真评估的人。缺点也明显:没有性能数据,光看参数和上下文长度,只能说明“理论上能处理很长的内容”,但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布,适合放进 featured 提醒大家关注后续评测。

Hacker News 首页

Infracost 做了个本地工具,让编程助手在写基础设施代码时就能看到云成本,实测能省 67% 的 API 费用

Infracost 发布了 Cost.dev,一个本地命令行工具,可以嵌进 Claude Code、Cursor 这类编程助手的流程里。它的核心作用是:在你让 AI 写云资源代码(比如 Terraform)的时候,实时告诉你这套配置每个月要花多少钱,并给出省钱建议。他们拿裸用 Claude 做基准测试,结果显示这个工具能让模型输出的 token 量减少...

推荐理由:Infracost 发了个本地命令行工具 Cost.dev,专门给写代码的 Agent 做云成本估算,核心卖点是让模型输出更省 token、调用更省钱。他们给出的数字挺好看:Claude 输出 token 最多降 79%,API 成本最多降 67%。我会先打个折——这是厂商自己的数据,没有第三方验证,实际效果得看具体场景和 Agent 的实现方式。但思路本身是实用的,直接在本地跑,不依赖外部服务,对控制 Agent 的 API 支出和云资源浪费有直接帮助。正文没披露支持哪些云平台、和现有 CI/CD 流程怎么集成,这些信息缺口让实用性打了一点折扣。...

新智元 · 公众号

分子之心发布 MMDesign,声称靶点命中率超过 90%

分子之心推出了一个叫 MMDesign 的 AI 平台,专门用来从头设计生物大分子药物。他们在 12 个治疗靶点上做了测试,每个靶点只挑了 14 到 50 个分子去做湿实验验证,结果有 11 个靶点都测出了特异性结合,算下来靶点成功率超过了 90%。不过正文因为访问环境异常没加载出来,具体用了什么模型架构、训练数据规模、以及和哪些国际顶尖模型做了对比,...

推荐理由:我会先打个折:正文没披露这 12 个靶点具体是什么、难度如何,也没说湿实验的具体指标和对照组,所以 90% 这个数先别太激动。但亮点在于,每个靶点只筛了 14 到 50 个分子就进湿实验,如果数据属实,意味着前期筛选成本压得很低。对做 AI 制药的人来说,这比跑分更有参考价值。整体偏产品发布,但数字够具体,放在 featured 档合理。

AI HOT 精选

微软 AI 负责人说 Anthropic 模型太贵,正在自己搞更便宜的替代品

微软 AI 负责人 Mustafa Suleyman 公开说 Anthropic 的模型成本太高,公司已经在开发内部替代模型来降本。他没透露具体模型名称、能便宜多少、什么时候上线。这件事的背景是微软一边给 OpenAI 投了几百亿美元,一边还在大量采购别家模型当备选,现在连备选都觉得贵了。正文没披露自研模型是基于开源方案还是完全从头训,也没说性能对标的...

推荐理由:HKR三项都过了。微软点名Anthropic贵,自己下场做便宜替代,这个动作本身就够抓眼球。但正文缺了关键信息——模型叫什么、能便宜多少、什么时候能用,这些都没说,所以分数先打个折,放在featured里偏低的位置。