跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

1,465 条精选相关主题MCP 与工具调用AI 编码推理能力

最新精选

第 561–580 条 · 共 1,465 条

6月9日星期二

r/LocalLLaMA

Apple 放出 MLX LM Server,让多台 Mac 通过雷电网口搭伙跑大模型

这篇 Reddit 帖子本身被屏蔽了,正文内容看不到,只能从标题和现有摘要拼出大致信息。Apple 的 MLX LM Server 支持连续批处理,能同时处理多个子代理的请求,不会一个一个排队干等。它还支持分布式推理,可以通过 Thunderbolt RDMA 把几台 Mac 连起来一起跑模型,相当于用高速雷电网口把算力拼成一台虚拟大机器。具体性能、延...

推荐理由:这篇 Reddit 帖子正文被屏蔽了,只能从标题和摘要拼出信息,所以我会先打个折。Apple 的 MLX LM Server 支持连续批处理,多个子代理的请求不用排队干等;还支持通过 Thunderbolt RDMA 把几台 Mac 连起来做分布式推理,相当于用高速雷电网口拼出一台虚拟大机器。这点先别太激动,正文没披露吞吐量、延迟、支持的最大模型尺寸和发布时间,验证很弱。但思路本身对关注本地推理成本的人有参考价值,所以给到 featured 门槛以上。

Computing Life · Share · 鸭哥调研

Fable 5 很贵,但省钱的答案 Anthropic 两个月前就发布了

Anthropic 发布了 Claude Fable 5,输出价格每百万 token 50 美元,是 Sonnet 4.6 的三倍多。省钱的办法他们自己早在四月就给了:advisor tool。让便宜的模型(比如 Sonnet)干活,遇到拿不准的决策时,花几百个 token 请 Opus 出个主意,方向盘始终在便宜模型手里。官方数据显示,Sonnet ...

推荐理由:Fable 5 发布本身是大新闻,但这篇的重点是 advisor tool 作为省钱模式,不是首发消息。HKR 全中:价格对比制造好奇,advisor 机制具体可操作,成本决策直接戳中 agent 开发者。但文章没给 Fable 5 自己的评测数据,信息有缺口,所以重要性给 78 而不是更高。

AI HOT 精选

奥尔特曼说 OpenAI 进入第三阶段:把 AI 做成便宜、好用、安全的日常工具

OpenAI 的 CEO 奥尔特曼和首席科学家帕霍茨基发了一篇博客,把公司发展分成三个阶段:第一阶段搞技术研发,第二阶段把产品推向全球看用户怎么用,现在正式进入第三阶段。他们的目标是让先进 AI 变得供给充足、成本亲民、安全实用,让每个人和机构都能用上。具体提了三个方向:做能自动搞科研的 AI 研究员、加快经济增长、给全球每个人配一个专属的通用人工智能...

推荐理由:这篇是奥尔特曼和首席科学家联名的路线图博客,把公司发展切成三个阶段,现在正式进入“让 AI 普及、易用且安全”的第三阶段。我会先打个折:正文没给出任何模型发布时间、性能指标或成本数字,所以重要性到不了 85。但“第三阶段”这个提法本身是个清晰的叙事钩子,三个目标(自动科研、经济加速、个人 AGI)和成立国际机构的建议,把 OpenAI 接下来的发力方向摊开了。对从业者来说,这篇能帮你判断 OpenAI 会把资源往哪砸、安全治理的调子怎么定,值得一看。

AI HOT 精选

OpenAI 秘密提交 IPO 申请,跟 Anthropic 抢资本跑道;Altman 说 2028 年 3 月前 AI 会扛起大部分研究工作

OpenAI 已经向 SEC 秘密交了 S-1 表格,正式启动上市审查。秘密提交的好处是收入、亏损、客户名单这些敏感数字暂时不用公开。Anthropic 上周也走了同样的流程,两家从拼模型直接升级成拼融资,抢的是下一代 AI 基础设施的钱。Sam Altman 在博客里放了个时间点:到 2028 年 3 月,OpenAI 大部分研究工作会由 AI 自己...

推荐理由:两家最受关注的 AI 公司几乎同时启动上市流程,从拼模型直接升级成拼融资,这个节点本身就值得从业者关注。Altman 给出的 2028 年研究自动化时间表是个很具体的判断,不管最后能不能兑现,都会影响行业对人才和资金配置的预期。信息源只有一条 X 上的帖子,没看到 S-1 原文或更多财务细节,所以先打 90 分,等正式招股书出来再往上调。

AI HOT 精选

Sam Altman 说 OpenAI 计划到 2028 年让 AI 自己搞大部分研究

Sam Altman 在一篇博客里列出了三个目标:先造出能自动做研究的 AI 研究员,再用它去加速科学和产品开发,最后给每个人配一个个人 AGI,帮你处理工作、学习、写代码、做生意、健康文书和日常决策。时间节点定在 2028 年 3 月,但正文没披露具体怎么验证这些目标是否达成,也没说成本、安全措施或失败预案。

推荐理由:HKR三项都踩中了:OpenAI给AGI研究路线图贴了个2028年3月的标签,还列了三个目标。我会先打个折,因为原文只是一篇博客摘要,不是正式产品发布或带技术细节的长文,所以没给P1。正文没披露怎么验证目标是否达成,也没提成本、安全措施或失败预案,这点先别太激动。

彭博科技

苹果推迟在欧盟上线 Siri AI,称监管机构拒绝沟通

苹果说目前没法在欧盟地区的 iPhone、Apple Watch 或 iPad 上推出 Siri AI 功能。公司把原因归结为欧盟监管机构“拒绝沟通”,但正文没披露具体是哪些法规卡住了、双方谈了什么、以及有没有预计的解决时间。

推荐理由:这条消息有冲突、有事实、有共鸣,HKR 三项全中。苹果点名欧盟监管“拒绝沟通”,但正文没写具体是哪条法规卡了、双方到底谈没谈、以及有没有解禁时间表,信息缺口很明显。我会先打个折:没有技术细节和合规路径,只能算一条有话题性的产品/政策动态,放在 75 分的中等权重位置刚好,别因为苹果牌子就往上拔。

TechCrunch · AI

苹果给 iPhone 加了 AI 补全:帮你写完句子、修好照片、跑通快捷指令

苹果在 Safari、快捷指令和密码 App 里塞了 AI 功能,能自动补文字、修图和串流程。正文没提什么时候推送、支持哪些 iPhone 机型,也没说背后用的是哪款模型。

推荐理由:我会先打个折:正文只说了功能方向,没给时间表、机型范围和模型细节,所以不能当正式发布稿来读。但苹果在 Safari 里补文字、在快捷指令里串流程、在密码 App 里修图,这三个落点都是系统级入口,一旦铺开对 agent workflow 和端侧分发的冲击不小。这点先别太激动,等具体推送和模型信息出来再调判断。

TechCrunch · AI

苹果要给快捷指令加 AI:用一句话描述需求,它帮你搭好自动化流程

苹果在快捷指令 App 里塞进了一个 AI 功能,你直接用大白话告诉它想干什么,它就能自动生成对应的自动化流程。目前只放出了一小段 RSS 摘要,正文没披露具体上线时间、哪个系统版本会支持、收不收费,也没说背后用的是本地模型还是云端模型。这点先别太激动,等苹果自己把细节补上再说。

推荐理由:我会先打个折:正文只放了一段 RSS 摘要,没写上线时间、系统版本、收费模式,也没说背后是本地模型还是云端模型。能确认的是苹果让快捷指令听懂人话并自动生成自动化流程,这对从业者来说是个系统级 agent 的实锤信号。但细节全缺,先别太激动,等苹果自己把机制和限制补上再判断实际分量。

AI HOT 精选

苹果说欧盟《数字市场法》卡住了 Siri AI,iOS 27 和 iPadOS 27 在欧盟地区没法按时上线

苹果发了一篇简短声明,把锅甩给了欧盟的《数字市场法》(DMA),说因为监管要求,Siri 的新 AI 功能不会随 iOS 27 和 iPadOS 27 一起在欧盟推出。具体哪些功能被拦、什么时候能在欧盟上线,正文一个字都没提。

推荐理由:苹果这篇声明很短,核心就一句话:因为 DMA,Siri 的新 AI 功能不会跟着 iOS 27 和 iPadOS 27 在欧盟上线。我会先打个折——正文没列出具体受影响的功能,也没给任何时间表,信息缺口不小。但这件事本身信号够强:大厂的产品节奏被法规直接打断,不是技术问题,是政策问题。对做全球化产品的 AI 从业者来说,这是个实打实的案例,提醒你分区合规可能比模型训练还难搞。所以虽然细节少,还是值得放在 featured 位置。

TechCrunch · AI

苹果憋了很久的 AI 版 Siri 终于来了,想从语音助手变成 AI 伙伴

苹果发布了新版 Siri AI,想把 Siri 从听指令的语音助手升级成能陪你聊天、能干更多活的 AI 伙伴。不过 TechCrunch 这篇正文很短,没写具体用了什么模型、什么时候推送、要不要付费、到底多了哪些功能,这些关键信息都还没披露。

推荐理由:HKR-H 和 HKR-R 都过了,因为苹果拖了很久的 Siri AI 大改版本身就是个高关注度的产品故事。HKR-K 没过:正文没给模型、没给推送时间、没给具体能力,信息太虚,只能卡在 featured 门槛上。

The Verge · AI

苹果在 WWDC 发布 Siri AI,语音可调语速和口音,能读屏、跨应用操作

苹果在 WWDC 上公布了 Siri AI,说是“全新版本”,比旧版更会聊天、能力更强。语音可以自己调语速、表现力和口音。Siri AI 会做成系统级,能看懂屏幕内容,也能直接操作你的应用。软件工程高级副总裁 Craig Federighi 做了介绍,但正文没披露具体上线时间和支持哪些设备。

推荐理由:苹果在 WWDC 上把 Siri 重新包装成 Siri AI,核心变化是让它能看懂你屏幕上的内容,并且直接跨应用帮你操作,不再是以前那个只回答问题的助手。Craig Federighi 出来站台,但正文没给出具体上线日期,也没说哪些设备能跑。我会先打个折:功能听着挺实用,但没时间表就是画饼,所以重要性停在 86 分,没往上走。

r/LocalLLaMA

Levi:在你的本地 Qwen 30B 上跑类似 AlphaEvolve 的搜索系统

Levi 是一个开源项目,让你能在本地用 Qwen3-30B-A3B 模型跑一套类似 AlphaEvolve 的搜索系统。作者在 ADRS、IFBench 和 HotpotQA 三个基准上做了测试,声称在单模型、相同预算的条件下,整体成本最多能降到原来的 1/35,评估次数最多能减少到 1/12。不过正文被 Reddit 的网络屏蔽页挡住了,具体实现细...

推荐理由:这篇来自 Reddit 的帖子只给了模型名、基准和成本比例,代码成熟度和可复现细节正文被屏蔽了没看到,所以我会先打个折。但能在本地用 Qwen3-30B-A3B 跑 AlphaEvolve 风格搜索这件事本身挺抓人,数字如果属实确实省钱,先给 featured 让社区去验证。

AI HOT 精选

NotebookLM 升级:对话里能直接干活,推理更强,但新格式和价格都没说

Google 给 AI Ultra 订阅用户推了个 NotebookLM 大更新。现在你在对话里就能让它执行多步骤任务,不用自己来回倒腾,相当于把 agent 塞进了聊天窗口。推理能力也升了级,处理复杂研究问题会更顺。官方说新增了一批输出格式,但正文没列具体是哪些,也没提价格会不会变、什么时候推给普通用户。我会先打个折:功能听着实用,但信息缺口不小,别...

推荐理由:HKR 三项都踩中:Google 确认 NotebookLM 给 AI Ultra 用户加了 in-chat agent、高级推理和多输出格式。但正文没列出具体格式、没提价格变动、也没说普通用户什么时候能用,信息缺口不小,所以停在中等权重的产品更新档位。

6月8日星期一

AI HOT 精选

Hivemind 给 AI 编程助手加了个“记性”,能把每次干活的经验存下来复用

Hivemind 这个工具现在开放了持续学习功能,专门给 AI 编程智能体用。它会自动收集 Claude Code、Codex、Cursor、Hermes、Pi 这些助手干活时的操作轨迹,把成功的套路提炼成可复用的技能,存到你自己的云盘里,再同步给所有助手。内置的 SkillOpt 负责持续训练这些技能,效果上,Claude Code 准确率涨了 19...

推荐理由:HKR三项都站得住,但这是Hivemind的一次功能更新,不是大厂动作,也没有其他来源交叉验证。52个场景的测试结果让它有干货,够格进低位的featured。

r/LocalLLaMA

OpenEnv 改由多家公司共同管理,包括 Hugging Face、PyTorch、Prime Intellect 等

OpenEnv 这个用来给 AI 智能体创建终端、浏览器等执行环境的工具,现在不再由单一团队控制,而是转交给一个委员会来协调。初始成员有 9 家,包括 Meta 的 PyTorch、Unsloth、Modal、Prime Intellect、Nvidia 和 Mercor。不过 Reddit 原帖内容被屏蔽了,正文没披露具体的治理规则、各家出钱出力的比...

推荐理由:这条消息本身信息量不大,但动作很实在——OpenEnv 不再是一家说了算,而是拉了个委员会来管,初始成员有 PyTorch、Unsloth、Modal 等 9 家。对做智能体训练的人来说,执行环境归谁管、会不会突然改协议或停更,是选型时很实际的风险点。我会先打个折:正文没披露各家出钱出力的比例、决策机制和后续路线图,所以现在只能说治理结构变了,别急着解读成“大厂全面接管”。

AI HOT 精选

五个模型经济体里,价格崩盘消失了:控制与涌现

这篇博客因为 Hugging Face 返回了 429 错误(请求太频繁),正文内容没抓到。从标题和摘要看,实验用 OpenAI、NVIDIA、OpenBMB 的模型和一个自己微调的 5 亿参数模型来驱动市场里的交易代理。他们试了三种干预手段都没能重现价格崩盘,最后是靠结算时强行改写价格才把崩盘做出来。我会先打个折:具体怎么干预、崩盘长什么样、数据量多...

推荐理由:我会先打个折:正文因为 Hugging Face 限流没抓到,具体干预怎么设计、崩盘长什么样、数据量多大都只能靠标题和摘要猜。但就现有信息看,五个模型经济体里崩盘凭空消失、只能靠结算作弊做出来,这个发现对代理可靠性和模拟真实性都是实打实的质疑。信息缺口明显,但角度够刁,值得推给从业者看一眼。

AI HOT 精选

阿里云把 AgentScope 的 Java 版升到 2.0,主打企业级智能体在 JVM 环境里跑生产

这个版本把架构改成了分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能恢复。多租户用 Workspace 做数据隔离,权限控制做得比较细,还加了人工介入的环节。长期运行靠 HarnessAgent 管上下文和容错。开源地址在推文链接里,但正文没给出性能基准或实际部署规模的数据。

推荐理由:阿里云把 AgentScope 的 Java 版推到了 2.0,这次改动挺实在:架构拆成分布式无状态,能挂在 K8s 上自动扩缩容,会话断了也能接上。多租户用 Workspace 做数据隔离,权限粒度更细,还加了人工介入环节,长期任务靠 HarnessAgent 管上下文和容错。我会先打个折——正文没给性能基准,也没说实际部署规模,所以这些能力到底省多少资源、稳不稳,还看不出来。开源地址在推文链接里,但没披露定价或落地案例。整体是给 Java 技术栈的企业把智能体往生产环境推了一步,信息缺口明显,先放在 featured 这档。

AI HOT 精选

微信在测试右滑拉起的 AI 助手,能直接调小程序干活,还和主流手机厂商打通了

腾讯正在灰度测试一个藏在微信里的 AI 助手,右滑就能呼出。它用自然语言指令直接调用数百万个小程序,比如帮你点咖啡。微信还跟华为、荣耀、小米、OPPO、vivo 合作,让手机系统助手也能跨应用调微信的服务,6 月 8 号已经放出了开发者接入指引。不过原文因为环境异常没加载出完整内容,具体的技术实现和开放范围正文没披露。

推荐理由:这条消息的钩子很足——微信开始把自己当成 agent 运行环境,不是只聊天,而是直接调小程序干活,还同步打通了手机厂商的系统级入口。我会先打个折,因为原文没加载完整,技术方案、开放范围、模型选型这些关键信息正文都没披露,所以暂时不能给更高分。但右滑入口加开发者指引加五家厂商合作,三个点放在一起,已经足够让从业者重新评估微信在 agent 分发上的位置。

r/LocalLLaMA

双卡 3090 跑 27B 模型,解码速度几乎翻倍,没插 NVLink 也做到了

一位 Reddit 用户拿 qwen3.6-27b-autoround-int4 模型做测试,对比单张 3090 和两张 3090 的表现。在没装 NVLink、走 8x/8x PCIe 通道、P2P 自动开启、张量并行设为 2 的条件下,叙事类文本的解码速度从 53 token/秒涨到 94 token/秒,代码类解码从 62 token/秒涨到 1...

推荐理由:我会先打个折:这只是 Reddit 上一个用户的单次测试,没换模型、没换卡型复现,所以别急着当通用结论。但它的价值在于给了一个很具体的参考点——在没桥接器、走普通 PCIe 通道的情况下,qwen3.6-27b 的 int4 量化版用张量并行跑,解码速度几乎翻倍。对正在纠结要不要加卡跑本地推理的人来说,这个数据比厂商白皮书实在。正文没披露功耗、延迟波动和长文本下的表现,这些缺口让结论只能停在“值得自己试一下”的程度。

AI HOT 精选

微信 AI 开始内测,开发者有两种方式让小程序被 AI 直接操作

微信开放平台发了接入指引,确认微信 AI 在内测。开发者可以选两种模式:自动模式是授权平台读小程序源码,不用额外开发,AI 就能分析页面并直接操作;开发模式是自己写技能提交审核,让 AI 调用。两种模式不冲突,可以同时开,也不影响现有小程序服务。官方说“微信 AI”这个名字可能还会改。

推荐理由:这条消息对微信生态的开发者很关键,因为官方终于给出了接入路径,不是画饼。自动模式等于让 AI 直接读你的小程序源码去干活,省掉额外开发,但正文没提对复杂页面的理解准确率怎么样,这点先别太激动。开发模式更灵活,但需要自己写技能并审核,上线节奏和审核标准也没说。整体看,平台动作明确,但模型能力、收费方式和正式开放时间都还是空白,所以分数卡在 featured 门槛附近。