跳到正文

#Agent

今日 39 条

6月10日星期三

AI HOT 精选

Claude Code 团队成员 Thariq 的十条效率建议:从检查它做没做对,转向检查它做没做对的事

Thariq 的核心观点是换个思路用 Claude Code:别老盯着输出结果挑错,先确保它接对了任务。他给了十条具体做法。第一,一上来就把项目背景、限制条件全丢给它,把它当能跟你讨论的同事,而不是个补丁工具。第二,用一份简短的需求文档引导 Claude 反问你细节,把模糊想法聊清楚。第三,让它同时探索几个方案,直接生成 HTML 原型给你看,比看文字...

推荐理由:这篇是 Claude Code 的实战教程,干货密度高。Thariq 没讲大道理,而是给了十条能立刻上手的操作,比如先把项目背景全丢给模型、用需求文档引导它反问细节、让它同时跑几个方案出 HTML 原型对比。核心思路是把 Claude 当能讨论的同事,而不是补丁工具,这个视角切换本身就值回票价。内部人士分享加上三条 HKR 全中,放在 featured 没问题。

AI HOT 精选

OpenRouter 的 Advisor 工具页面 404 了,正文没披露任何细节

OpenRouter 原本要介绍一个叫 Advisor 的工具,让 GPT-4o Mini 这类便宜模型在生成过程中可以随时去问 Claude Fable 等更强模型。但博客页面直接返回 404,文章不存在。定价、延迟、路由策略这些关键信息全都没公开,目前只能看到标题和摘要里的概念,没法判断实际效果和成本。

推荐理由:我会先打个折:OpenRouter 这篇博客直接 404,正文没披露定价、延迟、路由策略和实际效果,目前只有标题和摘要里的概念。概念本身有意思——让便宜模型在生成中途去问强模型,相当于给低成本模型配了个随时可叫的顾问,不是简单的 fallback 或静态路由。这点先别太激动,因为没数据验证到底省不省钱、延迟高不高、强模型被调用的频率和策略全都不清楚。对正在搭模型路由栈的团队来说,这个方向确实踩中了成本与质量的平衡点,但信息缺口太大,只能当产品信号看。

AI HOT 精选

GitHub Copilot CLI 现在能建自定义 AI 智能体,把一次性终端指令变成可重复跑的工作流

GitHub Copilot CLI 新增了自定义智能体功能,让模型能读懂你团队的技术栈和常用流程,把以前在终端里零散敲的提示词变成一套可复用的自动化工作流。正文没披露具体的配置方式、推送范围和是否额外收费,所以实际落地成本还不清楚。

推荐理由:GitHub 官方产品更新,HKR 拿到 H 和 R:自定义 Copilot CLI 智能体对开发者工作流有实际影响。K 偏弱,因为配置方式、推送范围和是否额外收费都没披露,所以定在 featured 门槛。

6月9日星期二

AI HOT 精选

Cohere 发布 North Mini Code:一个 30B 参数、每次只用 3B 的开源代码模型

Cohere 在 Hugging Face 上开源了 North Mini Code,采用 Apache 2.0 协议。这是一个 30B 参数的混合专家模型,每次推理只激活 3B 参数,专门为让模型在终端里自主写代码、修 bug 这类任务设计。在 SWE-Bench Verified 上,它的 pass@10 跑到了 80.2%,在 Artificia...

推荐理由:HKR-H 来自一个紧凑的 MoE 编码模型加上一个亮眼的 SWE-Bench 成绩;HKR-K 有参数、协议、上下文和基准数据。Cohere 不是前沿实验室,所以这个发布放在 78-84 分的开源编码模型区间比较合适。

AI HOT 精选

塔塔咨询要少招人了,因为开始用 AI 智能体干活

塔塔咨询服务(TCS)说以后招聘会放缓,原因是公司正在把更多 AI 智能体塞进业务流程里,让它们接手一部分原来由人做的外包工作。不过正文没披露具体要少招多少人、AI 智能体部署到了多大规模,也没给时间表。

推荐理由:TCS 放话要因为 AI 智能体少招人,这是外包行业一个很实在的转折信号。我会先打个折:正文没披露具体砍多少岗位、AI 部署到了什么量级,也没时间表,所以信息缺口不小。但“亚洲最大外包商因 AI 放缓招聘”这个事实本身已经够硬,HKR 三条全中,给 76 分放在 featured 里是合适的。

The Verge · AI

苹果把 AI 的赌注全押在隐私上,但云端那部分还没说清楚

WWDC 上苹果把迟到 AI 这件事包装成“为了隐私才慢”,Apple Intelligence 和 Siri AI 会铺到 iPhone、iPad、Mac、Apple Watch 和 Vision Pro,还单独做了个 Siri AI 应用,带聊天界面、AI 拍照修图和一些初步的“让模型替你干活”的功能。但文章没解释清楚一件事:处理任务已经扩展到 G...

推荐理由:WWDC 上苹果把 Siri AI 铺到全系设备,隐私是整场发布会的定调词。但这篇文章没跟着喊口号,而是揪住一个正文都没解释清楚的点:任务已经跑到 Google 这类外部云上了,苹果却没交代跨云隐私机制。这个信息缺口让整件事从“苹果终于做 AI 了”升级成“苹果的隐私故事能不能站住脚”,所以值得推给读者。

AI HOT 精选

一个编程 Agent 串起两个 HuggingFace Space,自动生成了一个巴黎地标 3D 画廊

作者让一个编程 agent 自己动手,把 ideogram-ai/ideogram4 和 VAST-AI/TripoSplat 这两个 Space 串了起来。流程是:先用 ideogram4 生成巴黎地标的图片,再把图片喂给 TripoSplat,从单张图片重建出 3D 高斯泼溅文件(.ply),接着转成体积小约 3 倍的 .ksplat 格式,最后用...

推荐理由:我会先打个折:这不是模型或平台发布,而是一篇 Hugging Face Spaces 的实操教程。但作者把两个现成 Space 串起来,让 agent 自己跑通从文字到 3D 场景的流程,还给出了约 3 倍的压缩数据,对做 agent 编排和轻量 3D 管线的人挺实用。正文没披露生成质量和延迟的具体测试,这点先别太激动。整体放在 featured 档位合适。

AI HOT 精选

Qwen3.7-Max 靠一份 15 万字文档,4 小时做出能跑的手机和网页应用

实验里 Qwen3.7-Max 不看设计稿、不接后端,只读一份约 15 万字的产品调研文档,在隔离环境里分别生成了安卓 APK 和一个 Web 应用,单端耗时约 4 小时,中间没人插手。模型本身看不懂图,它是通过像素坐标反推布局来还原界面。做法是把任务拆成规划、架构、编码等阶段,每步做完就检查——静态检查、编译自检(0 error)、Web 端 34 ...

推荐理由:我会先打个折:正文没披露失败率、重试次数、人工介入点,也没说这15万字文档本身质量如何。但亮点在于它把模型看不懂图这个短板说清楚了——靠像素坐标反推布局,不是真懂设计。任务拆成规划、架构、编码并逐段自检的做法,让4小时出双端这件事有了可复现的骨架。如果是真的挺省钱,但没给对比基线,先别太激动。

AI HOT 精选

GitHub 12.2 万星项目 Skills 加了个 Teach 技能,把工作目录变成能记住你学到哪的学习空间

Skills 仓库新出的 Teach 技能,核心是把一个普通文件夹变成有状态的学习环境。它用四个文件来追踪学习进度:MISSION.md 写目标,lessons/ 放课程,learning-records/ 记你已经掌握的东西(不是记“讲了什么”),reference/ 自动生成速查手册。五个机制里比较有意思的是 ZPD,会根据你的学习记录动态调整难度...

推荐理由:这条更新来自 Skills 仓库(GitHub 122K 星),核心是把一个目录变成带记忆的学习环境,靠四个文件追踪进度,ZPD 机制会根据你已掌握的内容动态调难度。对做 agent 记忆和可复现学习流程的人有直接启发。但信息源只有一篇 X 上的总结,没有基准测试、维护者细节或用户反馈,所以我会先打个折——概念扎实,落地效果还得看实际跑起来怎么样。

FT · 科技

苹果发布 Siri AI,想跟其他聊天机器人掰手腕

苹果终于把拖了很久的 Siri 大改版拿出来了,叫 Siri AI。FT 这篇报道的正文被付费墙挡住了,只返回了安全验证页面,所以具体改了啥、模型细节、什么时候能用、功能清单这些,正文都没披露。从标题看,苹果是直接冲着 ChatGPT 这类对手去的,但 RSS 摘要里只提了一句用户隐私承诺,别的信息全是空白。我会先打个折:光看标题像是个大动作,但没看到...

推荐理由:FT 的信源权威性加上 Siri 大改版这个动作,H 和 R 都站得住,所以能进 featured。但 K 过不了,因为正文除了隐私承诺什么都没给,模型规格、发布时间、功能清单全是空白,我会先打个折:光看标题像是个大动作,没看到实质内容之前别太激动。

r/LocalLLaMA

Apple 放出 MLX LM Server,让多台 Mac 通过雷电网口搭伙跑大模型

这篇 Reddit 帖子本身被屏蔽了,正文内容看不到,只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理,能同时处理多个子代理的请求,不会一个一个排队干等。它还支持分布式推理,可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型,相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

推荐理由:这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要拼出信息,所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理,多个子代理的请求不用排队干等;还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理,相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动,正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间,验证很弱。但思路本身对关注本地推理成本的人有参考价值,所以给到 featured 门槛以上。

Computing Life · Share · 鸭哥调研

Fable 5 很贵,但省钱的答案 Anthropic 两个月前就发布了

Anthropic 发布了 Claude Fable 5,输出价格每百万 token 50 美元,是 Sonnet 4.6 的三倍多。省钱的办法他们自己早在四月就给了:advisor tool。让便宜的模型(比如 Sonnet)干活,遇到拿不准的决策时,花几百个 token 请 Opus 出个主意,方向盘始终在便宜模型手里。官方数据显示,Sonnet ...

推荐理由:Fable 5 发布本身是大新闻,但这篇的重点是 advisor tool 作为省钱模式,不是首发消息。HKR 全中:价格对比制造好奇,advisor 机制具体可操作,成本决策直接戳中 agent 开发者。但文章没给 Fable 5 自己的评测数据,信息有缺口,所以重要性给 78 而不是更高。

AI HOT 精选

奥尔特曼说 OpenAI 进入第三阶段:把 AI 做成便宜、好用、安全的日常工具

OpenAI 的 CEO 奥尔特曼和首席科学家帕霍茨基发了一篇博客,把公司发展分成三个阶段:第一阶段搞技术研发,第二阶段把产品推向全球看用户怎么用,现在正式进入第三阶段。他们的目标是让先进 AI 变得供给充足、成本亲民、安全实用,让每个人和机构都能用上。具体提了三个方向:做能自动搞科研的 AI 研究员、加快经济增长、给全球每个人配一个专属的通用人工智能...

推荐理由:这篇是奥尔特曼和首席科学家联名的路线图博客,把公司发展切成三个阶段,现在正式进入“让 AI 普及、易用且安全”的第三阶段。我会先打个折:正文没给出任何模型发布时间、性能指标或成本数字,所以重要性到不了 85。但“第三阶段”这个提法本身是个清晰的叙事钩子,三个目标(自动科研、经济加速、个人 AGI)和成立国际机构的建议,把 OpenAI 接下来的发力方向摊开了。对从业者来说,这篇能帮你判断 OpenAI 会把资源往哪砸、安全治理的调子怎么定,值得一看。

AI HOT 精选

OpenAI 秘密提交 IPO 申请,跟 Anthropic 抢资本跑道;Altman 说 2028 年 3 月前 AI 会扛起大部分研究工作

OpenAI 已经向 SEC 秘密交了 S-1 表格,正式启动上市审查。秘密提交的好处是收入、亏损、客户名单这些敏感数字暂时不用公开。Anthropic 上周也走了同样的流程,两家从拼模型直接升级成拼融资,抢的是下一代 AI 基础设施的钱。Sam Altman 在博客里放了个时间点:到 2028 年 3 月,OpenAI 大部分研究工作会由 AI 自己...

推荐理由:两家最受关注的 AI 公司几乎同时启动上市流程,从拼模型直接升级成拼融资,这个节点本身就值得从业者关注。Altman 给出的 2028 年研究自动化时间表是个很具体的判断,不管最后能不能兑现,都会影响行业对人才和资金配置的预期。信息源只有一条 X 上的帖子,没看到 S-1 原文或更多财务细节,所以先打 90 分,等正式招股书出来再往上调。

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

彭博科技

苹果推迟在欧盟上线 Siri AI,称监管机构拒绝沟通

苹果说目前没法在欧盟地区的 iPhone、Apple Watch 或 iPad 上推出 Siri AI 功能。公司把原因归结为欧盟监管机构“拒绝沟通”,但正文没披露具体是哪些法规卡住了、双方谈了什么、以及有没有预计的解决时间。

推荐理由:这条消息有冲突、有事实、有共鸣,HKR 三项全中。苹果点名欧盟监管“拒绝沟通”,但正文没写具体是哪条法规卡了、双方到底谈没谈、以及有没有解禁时间表,信息缺口很明显。我会先打个折:没有技术细节和合规路径,只能算一条有话题性的产品/政策动态,放在 75 分的中等权重位置刚好,别因为苹果牌子就往上拔。

TechCrunch · AI

苹果给 iPhone 加了 AI 补全:帮你写完句子、修好照片、跑通快捷指令

苹果在 Safari、快捷指令和密码 App 里塞了 AI 功能,能自动补文字、修图和串流程。正文没提什么时候推送、支持哪些 iPhone 机型,也没说背后用的是哪款模型。

推荐理由:我会先打个折:正文只说了功能方向,没给时间表、机型范围和模型细节,所以不能当正式发布稿来读。但苹果在 Safari 里补文字、在快捷指令里串流程、在密码 App 里修图,这三个落点都是系统级入口,一旦铺开对 agent workflow 和端侧分发的冲击不小。这点先别太激动,等具体推送和模型信息出来再调判断。

TechCrunch · AI

苹果要给快捷指令加 AI:用一句话描述需求,它帮你搭好自动化流程

苹果在快捷指令 App 里塞进了一个 AI 功能,你直接用大白话告诉它想干什么,它就能自动生成对应的自动化流程。目前只放出了一小段 RSS 摘要,正文没披露具体上线时间、哪个系统版本会支持、收不收费,也没说背后用的是本地模型还是云端模型。这点先别太激动,等苹果自己把细节补上再说。

推荐理由:我会先打个折:正文只放了一段 RSS 摘要,没写上线时间、系统版本、收费模式,也没说背后是本地模型还是云端模型。能确认的是苹果让快捷指令听懂人话并自动生成自动化流程,这对从业者来说是个系统级 agent 的实锤信号。但细节全缺,先别太激动,等苹果自己把机制和限制补上再判断实际分量。

AI HOT 精选

苹果说欧盟《数字市场法》卡住了 Siri AI,iOS 27 和 iPadOS 27 在欧盟地区没法按时上线

苹果发了一篇简短声明,把锅甩给了欧盟的《数字市场法》(DMA),说因为监管要求,Siri 的新 AI 功能不会随 iOS 27 和 iPadOS 27 一起在欧盟推出。具体哪些功能被拦、什么时候能在欧盟上线,正文一个字都没提。

推荐理由:苹果这篇声明很短,核心就一句话:因为 DMA,Siri 的新 AI 功能不会跟着 iOS 27 和 iPadOS 27 在欧盟上线。我会先打个折——正文没列出具体受影响的功能,也没给任何时间表,信息缺口不小。但这件事本身信号够强:大厂的产品节奏被法规直接打断,不是技术问题,是政策问题。对做全球化产品的 AI 从业者来说,这是个实打实的案例,提醒你分区合规可能比模型训练还难搞。所以虽然细节少,还是值得放在 featured 位置。

TechCrunch · AI

苹果憋了很久的 AI 版 Siri 终于来了,想从语音助手变成 AI 伙伴

苹果发布了新版 Siri AI,想把 Siri 从听指令的语音助手升级成能陪你聊天、能干更多活的 AI 伙伴。不过 TechCrunch 这篇正文很短,没写具体用了什么模型、什么时候推送、要不要付费、到底多了哪些功能,这些关键信息都还没披露。

推荐理由:HKR-H 和 HKR-R 都过了,因为苹果拖了很久的 Siri AI 大改版本身就是个高关注度的产品故事。HKR-K 没过:正文没给模型、没给推送时间、没给具体能力,信息太虚,只能卡在 featured 门槛上。

The Verge · AI

苹果在 WWDC 发布 Siri AI,语音可调语速和口音,能读屏、跨应用操作

苹果在 WWDC 上公布了 Siri AI,说是“全新版本”,比旧版更会聊天、能力更强。语音可以自己调语速、表现力和口音。Siri AI 会做成系统级,能看懂屏幕内容,也能直接操作你的应用。软件工程高级副总裁 Craig Federighi 做了介绍,但正文没披露具体上线时间和支持哪些设备。

推荐理由:苹果在 WWDC 上把 Siri 重新包装成 Siri AI,核心变化是让它能看懂你屏幕上的内容,并且直接跨应用帮你操作,不再是以前那个只回答问题的助手。Craig Federighi 出来站台,但正文没给出具体上线日期,也没说哪些设备能跑。我会先打个折:功能听着挺实用,但没时间表就是画饼,所以重要性停在 86 分,没往上走。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

AI HOT 精选

NotebookLM 升级:对话里能直接干活,推理更强,但新格式和价格都没说

Google 给 AI Ultra 订阅用户推了个 NotebookLM 大更新。现在你在对话里就能让它执行多步骤任务,不用自己来回倒腾,相当于把 agent 塞进了聊天窗口。推理能力也升了级,处理复杂研究问题会更顺。官方说新增了一批输出格式,但正文没列具体是哪些,也没提价格会不会变、什么时候推给普通用户。我会先打个折:功能听着实用,但信息缺口不小,别...

推荐理由:HKR 三项都踩中:Google 确认 NotebookLM 给 AI Ultra 用户加了 in-chat agent、高级推理和多输出格式。但正文没列出具体格式、没提价格变动、也没说普通用户什么时候能用,信息缺口不小,所以停在中等权重的产品更新档位。

6月8日星期一

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

r/LocalLLaMA

OpenEnv 改由多家公司共同管理,包括 Hugging Face、PyTorch、Prime Intellect 等

OpenEnv 这个用来给 AI 智能体创建终端、浏览器等执行环境的工具,现在不再由单一团队控制,而是转交给一个委员会来协调。初始成员有 9 家,包括 Meta 的 PyTorch、Unsloth、Modal、Prime Intellect、Nvidia 和 Mercor。不过 Reddit 原帖内容被屏蔽了,正文没披露具体的治理规则、各家出钱出力的比...

推荐理由:这条消息本身信息量不大,但动作很实在——OpenEnv 不再是一家说了算,而是拉了个委员会来管,初始成员有 PyTorch、Unsloth、Modal 等 9 家。对做智能体训练的人来说,执行环境归谁管、会不会突然改协议或停更,是选型时很实际的风险点。我会先打个折:正文没披露各家出钱出力的比例、决策机制和后续路线图,所以现在只能说治理结构变了,别急着解读成“大厂全面接管”。

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

AI HOT 精选

阿里云把 AgentScope 的 Java 版升到 2.0,主打企业级智能体在 JVM 环境里跑生产

这个版本把架构改成了分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能恢复。多租户用 Workspace 做数据隔离,权限控制做得比较细,还加了人工介入的环节。长期运行靠 HarnessAgent 管上下文和容错。开源地址在推文链接里,但正文没给出性能基准或实际部署规模的数据。

推荐理由:阿里云把 AgentScope 的 Java 版推到了 2.0,这次改动挺实在:架构拆成分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能接上。多租户用 Workspace 做数据隔离,权限粒度更细,还加了人工介入环节,长期任务靠 HarnessAgent 管上下文和容错。我会先打个折——正文没给性能基准,也没说实际部署规模,所以这些能力到底省多少资源、稳不稳,还看不出来。开源地址在推文链接里,但没披露定价或落地案例。整体是给 Java 技术栈的企业把智能体往生产环境推了一步,信息缺口明显,先放在 featured 这档。

AI HOT 精选

微信在测试右滑拉起的 AI 助手,能直接调小程序干活,还和主流手机厂商打通了

腾讯正在灰度测试一个藏在微信里的 AI 助手,右滑就能呼出。它用自然语言指令直接调用数百万个小程序,比如帮你点咖啡。微信还跟华为、荣耀、小米、OPPO、vivo 合作,让手机系统助手也能跨应用调微信的服务,6 月 8 号已经放出了开发者接入指引。不过原文因为环境异常没加载出完整内容,具体的技术实现和开放范围正文没披露。

推荐理由:这条消息的钩子很足——微信开始把自己当成 agent 运行环境,不是只聊天,而是直接调小程序干活,还同步打通了手机厂商的系统级入口。我会先打个折,因为原文没加载完整,技术方案、开放范围、模型选型这些关键信息正文都没披露,所以暂时不能给更高分。但右滑入口加开发者指引加五家厂商合作,三个点放在一起,已经足够让从业者重新评估微信在 agent 分发上的位置。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

AI HOT 精选

微信 AI 开始内测,开发者有两种方式让小程序被 AI 直接操作

微信开放平台发了接入指引,确认微信 AI 在内测。开发者可以选两种模式:自动模式是授权平台读小程序源码,不用额外开发,AI 就能分析页面并直接操作;开发模式是自己写技能提交审核,让 AI 调用。两种模式不冲突,可以同时开,也不影响现有小程序服务。官方说“微信 AI”这个名字可能还会改。

推荐理由:这条消息对微信生态的开发者很关键,因为官方终于给出了接入路径,不是画饼。自动模式等于让 AI 直接读你的小程序源码去干活,省掉额外开发,但正文没提对复杂页面的理解准确率怎么样,这点先别太激动。开发模式更灵活,但需要自己写技能并审核,上线节奏和审核标准也没说。整体看,平台动作明确,但模型能力、收费方式和正式开放时间都还是空白,所以分数卡在 featured 门槛附近。

机器之心 · 公众号

openJiuwen 搞了个叫 MANGO 的多智能体流网络,让一群模型自己学会怎么组队干活

openJiuwen 提出了 MANGO,一个多智能体流网络框架。它把强化学习、文本梯度(用自然语言反馈来调模型)和 Skip-k 机制(跳过不靠谱的中间步骤)揉在一起,让一群模型自己学会怎么组队、怎么分工。用 GPT-4o-mini 跑分,在 MATH500 数学题上比 MaAS 准确率高了 12.8 个百分点,在 DROP 阅读理解上比 AFlow...

推荐理由:我会先打个折:这还是个研究框架,不是大模型或平台级发布,所以别当重磅炸弹看。但 HKR 里 K 最扎实,机制和数字都给出来了,MATH500 上 +12.8% 的差距不算小。H 和 R 靠“流网络”这个角度撑住,对搞多智能体协作的人有参考价值。正文没提开源代码链接,这点先别太激动。

AI HOT 精选

OpenAI 公布第三阶段计划:2028 年让 AI 接手大部分研究,并给每人配一个个人 AGI

Sam Altman 和 Jakub Pachocki 在 6 月 8 日发文,把 OpenAI 的路线图摊开了讲。公司内部判断,到 2028 年 3 月,AI 系统可能承担他们研究工作里“相当大一部分”,所以第一个目标是造一个能自动做 AI 研究的系统,帮研究员更快地测试想法、找错和迭代。第二个目标是加速经济增长,同时把收益分出去。第三个目标最直接:...

推荐理由:Sam Altman 和 Jakub Pachocki 这次没画大饼,而是给了个带时间点的内部判断:到 2028 年 3 月,AI 可能接手 OpenAI 研究工作的相当一部分。我会先打个折,这种预测本身就有自我实现的成分,但把它写进公开路线图,说明内部对研究自动化的信心已经很高了。文章把目标拆成三个:造自动做研究的系统、加速经济并把收益分出去、以及最直接的安全对齐。信息量够,时间点具体,对从业者来说既是信号也是压力,值得马上写。

AI HOT 精选

Hugging Face 把 OpenEnv 交给社区委员会管了,Meta-PyTorch、Unsloth 等都在里面

OpenEnv 是一个给 AI 智能体用的训练环境,比如模拟终端、浏览器,让模型在里面干活并学习。Hugging Face 宣布这个项目不再自己说了算,改由一个委员会来协调,首批成员包括 Meta-PyTorch、Reflection、Unsloth、Modal、Prime Intellect、Nvidia 等。项目代码已经搬到 huggingface...

推荐理由:这条不是模型发布,但比很多模型发布更值得看。OpenEnv 做的事很简单:给智能体一个能反复试错、学会干活的沙盒,比如在终端里敲命令、在浏览器里点按钮。现在 Hugging Face 把控制权交出来,换成委员会模式,首批成员名单挺能打——Meta-PyTorch 管框架,Unsloth 管训练加速,Modal 和 Prime Intellect 管算力,Nvidia 也在。技术上两个点值得留意:一是 API 照着 Gymnasium 那套强化学习标准来,老玩家上手快;二是集成了 MCP,让智能体在环境里干活时能直接调外部工具,不用自己从头写胶水代码...

AI HOT 精选

ChatGPT 要变成 AgentGPT 了

OpenAI 准备给 ChatGPT 做上线以来最大的一次改版,从聊天机器人转成一个能直接干活的 Agent 平台。它会整合自家的编程工具 Codex、图像生成,还会接入 Canva、Booking 这类第三方应用。高管放话说“聊天已死”,目标是做成跨平台的个人 AI 助手,以后甚至不用你手动输入提示词。改版预计几周内在网页和手机端上线。商业压力不小:...

推荐理由:这条消息把改版讲得挺清楚,但来源只是一条 X 帖子,正文没披露正式上线时间、开放范围和定价,我会先打个折。高管那句“聊天已死”听着唬人,实际产品还没交付,这点先别太激动。整体判断是:方向重要,落地细节还缺,所以放在 84 分这个位置。

6月7日星期日

AI HOT 精选

北海道农民雇了个叫 Codex 的工程师,用 AI 干了 8 件农活

北海道农民富安弘毅把 ChatGPT 和 Codex 当工程师用,做了 8 件事:拍照识别西兰花病害、用卫星 NDVI 数据看作物长势、拿 ESP32 加 LINE 机器人远程开关温室卷帘、给农场群聊写了个管温度和排期的机器人、从聊天记录里自动统计播种数量、研究 RTK-GPS 自动转向原理并算了自建要花多少钱、用 Airtable 搭了农场管理数据库...

推荐理由:我会先打个折:全文只有一个人、一个农场,没有产量对比或省了多少工时的数字,所以不能当行业证据用。但它的价值不在严谨,而在把 AI 写代码这件事从屏幕拉到了泥地里——一个农民没找外包、没学编程,直接用 Codex 做出了 8 个能跑的工具。这种'非程序员用 AI 写代码干物理世界的活'的案例现在还很少,对国内做 agent 和 coding 方向的人是个挺新鲜的参照。

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

新智元 · 公众号

Anthropic 联创说 Claude 现在写了公司 80% 的合并代码,两年内可能到 100%

Anthropic 联合创始人 Jack Clark 公开说,Claude 目前产出了公司里 80% 被合并进主干的代码,他预计两年内这个比例会到 100%。另外文章提到,2026 年第二季度 Anthropic 工程师人均每天合并的代码量是 2024 年的 8 倍。不过原文因为微信环境验证问题,正文没抓到,这些数字的具体口径和统计方式没法核实,先打个折看。

推荐理由:HKR 三项都成立:Jack Clark 亲口说的代码占比数字是个硬钩子,事实点够具体,而且对从业者的职业焦虑和效率想象都有触动。这不是模型发布或重大产品更新,所以分数留在 78–84 区间合理。正文没抓到,统计口径没法核实,我会先打个折看。

机器之心 · 公众号

ICML 2026 中稿的 FusionRoute:让多个模型在生成每个词时自己选最合适的专家,还能自我纠错

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型,而是冻结住几个专家模型不动,只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token(词或子词)时,实时挑选一个最合适的专家模型来输出,同时把路由器的判断分数和专家模型的输出分数揉在一起,让最终选择更准。论文在 GSM8K、MATH-50...

推荐理由:这篇 ICML 2026 的 FusionRoute 论文,核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选,还加了自我修正来纠错。思路确实有意思,但文章没给出具体的性能提升数字、代码链接和实际部署成本,所以我会先打个折,放在 featured 里偏低的档位。

量子位 · 公众号

京东开源 JoyAI-Echo,5 分钟 AI 长视频不崩,推理速度提了 7.5 倍

京东放出了一个叫 JoyAI-Echo 的开源框架,专门解决 AI 生成 5 分钟长视频时画面容易崩、前后不一致的问题。它用跨模态记忆模块把视频里的角色、场景信息存下来,保证长镜头里不会突然变脸或换衣服。训练上用了 DMD 后训练技术,推理速度比原来快了大概 7.5 倍,生成一段视频的成本和时间都压下来了。输出端还做了实时超分,能把 720P 画面直接...

推荐理由:我会先打个折:正文没提第三方评测或用户实测,所有性能数据都来自京东自己,所以效果得等上手再看。但这条消息本身有料——JoyAI-Echo用记忆模块存角色和场景信息,解决长视频变脸换衣服的老毛病,推理还快了7.5倍,成本往下走。对做视频生成的团队来说,开源就意味着能拿来改、能压成本,这点挺实在。先给80分,等有实测对比再往上调。

AI HOT 精选

AI 公司开始集体换用更便宜的模型,成本能砍掉九成

Tomasz Tunguz 观察到,基础模型公司往上抢应用层生意、最聪明的闭源模型越来越贵、开源模型又已经够用,这三件事逼着 AI 买家开始大规模“换芯”。Coinbase 把简单任务分流到便宜模型,用量指数级涨但成本没变;Lindy 把所有流量从 Anthropic 切到 DeepSeek v4,省了几百万美元,核心场景效果反而更好;Harvey 在...

推荐理由:这篇不是那种“AI 要颠覆一切”的空话,而是把 Coinbase、Lindy、Harvey 这些公司怎么在实际业务里换模型、省了多少钱讲得很清楚。Harvey 那个 84 美元对 954 美元的例子尤其直观,让人一看就知道成本压力有多大。它属于对行业成本结构变化的扎实观察,不是重大模型发布或产品上线,所以放在 featured 里、76 分这个位置是合适的。