跳到正文

全部动态

今日 25 条

5月12日星期二

AI HOT 精选

Gemini 现在能翻你的 Gmail 和相册,自动拼出一个旅行计划

Gemini App 推出了“个人智能”功能,可以把你的 Gmail、Google Photos、搜索记录和 YouTube 观看历史串起来,直接生成一份定制旅行行程。它省去了你自己翻邮件找酒店、从相册回忆地点的步骤。你随时可以选哪些 App 给它读,也能关掉个性化设置。正文没披露它具体怎么处理隐私数据、会不会把邮件内容喂给模型训练,这点先别太激动。

推荐理由:我会先打个折:正文只说了功能方向,没披露权限粒度、数据范围能不能自己勾选、行程质量怎么评估。亮点是 Google 第一次把四个核心数据源串起来给个人助手用,不再是单点功能。但这点先别太激动——没讲清楚用户能不能关掉某个数据源、数据是本地处理还是上传,也没给任何准确率或用户测试结果。对从业者的刺激在于:如果这套跑通,Google 助手的记忆深度会甩开只能读聊天记录的竞品一截;如果跑不通,就是一次隐私翻车现场。

AI HOT 精选

Anthropic 把 Claude 平台搬上了 AWS,现在能用 AWS 账号直接买单了

Claude 平台在 AWS 上正式上线,AWS 客户可以直接用现有的 AWS 账号登录、走 AWS 的账单付款,还能用已承诺的消费额度来抵扣。这意味着你不用再单独搞一套 Anthropic 的账户和支付,采购流程会简单不少。功能上,这次把完整的 Claude API 套件都带过来了,包括能托管运行 AI 智能体(让模型按流程自动干活)、代码执行、文件...

推荐理由:这事说白了就是 Claude 在 AWS 上开了个官方旗舰店。以前你可能得单独找 Anthropic 申请、单独结账,现在直接用 AWS 的账号体系和承诺消费额度就能买单,对已经绑在 AWS 上的公司来说,采购和合规流程会顺滑很多。功能上没新东西,就是把智能体、跑代码、传文件这些 API 打包进 AWS 的计费管道里。正文没提价格有没有变化,这点先别太激动。

5月11日星期一

AI HOT 精选

Anthropic 在 GitHub 开源了一套金融 AI 模板,直接给投研、投行、风控配好了 10 个智能体和 11 家数据商的连接器

这套模板把金融行业里常见的 AI 用法打包成了开箱即用的工作流,覆盖投研、投行、风控等核心环节。里面塞了 10 个端到端智能体、7 个垂直插件,还接好了 11 家主流金融数据商的 MCP 连接器,等于把模型跟 Bloomberg 这类数据源的通路提前打通了。部署方式从个人插件到企业 API 都支持,也能塞进 Microsoft 365 和私有云。正文没...

推荐理由:我会先打个折:这不是模型发布,所以重要性到不了 85 分,但开源一套能跑的金融 agent 模板,比发篇愿景文章实在得多。Anthropic 把 10 个端到端智能体、7 个插件和 11 家数据商的 MCP 连接器打包扔上 GitHub,等于给金融行业的 AI 落地画了一条参考线,别人想跟进得先过这一关。正文没披露这些 agent 在生产环境跑到什么程度、延迟和准确率怎么样,所以别急着当成熟方案用,但作为起点,信息量和可复现性都够格进 featured。

AI HOT 精选

Cognition AI 总部首次曝光:Scott Wu 和他 18 个月做到 4.45 亿美元年化收入的 Devin

推文放出了 Cognition AI 总部“Cog House”的内部画面。创始人 Scott Wu 是顶尖竞技程序员,拿过三次国际信息学奥赛金牌。他在 2023 年 11 月母亲去世、Sam Altman 被 OpenAI 解雇的同一天创立了公司,赌的是 AI 会变成能全天干活的智能体。他们做的 AI 软件工程师 Devin 刚上线时表现一般,但 1...

推荐理由:HKR 三项都过,因为这篇既有 Cognition AI 罕见的内部揭秘,又甩出了 Devin 的营收和估值数字。没给 P1 是因为它本质上是人物+公司特写,不是融资、产品发布或模型发布那种硬消息。

AI HOT 精选

腾讯混元放出 Hy3 预览版,主打复杂智能体任务,不是刷榜模型

腾讯混元开放了 Hy3 预览版的早期体验,官方说这是目前混元系列里最强的模型。它不冲着跑分去,而是强调在真实场景里能把事办成。模型用了 256K 上下文窗口,一次能塞进很长的材料;架构是混合专家(MoE),还加了快慢思考机制,碰到复杂问题会自动切换深度推理模式。底层把预训练和强化学习管线重做了一遍,目标是在大规模部署时把成本压下来。具体效果和实测数据正...

推荐理由:腾讯混元 Hy3 预览版放出了 256K 上下文和快慢思维混合专家架构,定位是处理复杂智能体任务。我会先打个折——正文没披露评测分数、定价和开放范围,所以没法判断实际能力和性价比。架构上快慢思维混合专家听起来像在推理效率和深度之间做平衡,如果是真的挺省钱,但没看到具体实现细节。256K 上下文对长链条智能体任务有用,但也要看实际召回和推理稳定性。这点先别太激动,等更多技术细节和实测出来再说。

r/LocalLLaMA

ExLlamaV3 连续更新:DFlash 让编程吞吐量翻三倍,多款模型推理再提速

ExLlamaV3 最近几个版本更新挺猛。v0.0.31 引入 DFlash 后,编程任务的生成速度从每秒 59.21 个 token 直接拉到 177.67,翻了近三倍。v0.0.32 专门优化了五款模型,其中 Trinity-Nano 在 6000 Pro² 显卡上的速度提升了 72.4%。最新的 v0.0.33 开始支持 DFlash 的模型量化...

推荐理由:我会先打个折:这主要是 ExLlama 用户和 LocalLLaMA 圈子的好消息,不是全行业当天必读的大新闻。但提速数字很实在,Coding 场景三倍提升、特定显卡上 72.4% 的涨幅,对正在折腾本地部署的人就是直接省时间省硬件。正文没提这些优化对显存占用或精度的副作用,这点先别太激动,但作为一次开源推理库的版本更新,信息量够、指向明确,值得推给关注推理效率的读者。

AI HOT 精选

OpenAI 成立部署公司 DeployCo,并收购 Tomoro,直接往企业里派驻工程师帮他们把模型用起来

OpenAI 新成立了一家叫 OpenAI Deployment Company(DeployCo)的独立公司,专门帮企业把 AI 系统真正部署到日常业务里。核心做法是派驻一种叫“前线部署工程师(FDE)”的人进到客户公司内部,跟业务、运营、一线团队一起找出 AI 最能产生价值的地方,然后重新设计流程、搭系统、做测试,直到能稳定跑在生产环境里。为了起步...

推荐理由:OpenAI 搞 DeployCo 是个实打实的企业战略信号。H 有独立公司的钩子,R 踩中了部署竞争的神经,但 K 很弱——定价、客户、时间都没披露,所以只能放在 featured 的底线分。

量子位 · 公众号

马斯克申请 SpaceXAI 商标,要把 AI 算力搬上卫星

SpaceX 提交了 SpaceXAI 商标申请,覆盖的业务范围很广:卫星数据中心、轨道计算、AI 软件即服务、云存储、通信硬件,甚至还有社交网络。文章提到 xAI 已经通过全股交易成为 SpaceX 的子公司,并引用了一个 2500 亿美元的 xAI 估值。不过正文因为环境异常被屏蔽了,具体交易条款和商标申请细节都没披露,这个估值数字也先别太当真。

推荐理由:我会先打个折:目前只有商标申请文件,正文说xAI已并入SpaceX,但没披露交易条款或官方公告,这点先别太激动。商标覆盖范围很广,从卫星数据中心到AI SaaS都有,说明马斯克在铺路,但离真正跑起来还差落地细节。重要性给76、放featured是合理的,属于信号而非实锤重组。

Computing Life · Share · 鸭哥调研

Google 悄悄关停 Project Mariner,但三家大模型公司其实得出了同一个结论

Google 在 5 月 4 日毫无预告地关掉了去年 I/O 大会上主推的 AI 浏览器代理 Project Mariner。这件事不能简单看成 Google 掉队,因为 Anthropic 和 OpenAI 在同类产品上也撞了墙。核心问题在于,独立浏览器代理(像 Mariner、Operator)一启动就是个全新的、没有 cookie 和浏览记录的会...

推荐理由:这条消息的价值在于把三家公司对浏览器 agent 的悲观判断摆在一起,而不是只报 Google 一家关停。关停日期是新的,但正文没给出官方公告链接,也没披露失败的具体指标,比如任务成功率掉到多少、成本高到什么程度,所以信息强度有折扣。对做 agent 的人来说,知道大厂在这个方向上集体后撤,比看一篇技术方案更有参考意义,但缺少一手数据支撑,只能算一个值得注意的信号。

AI HOT 精选

Codex 自己找了个安全审计的活,花了 22 小时赚到 16.88 美元

有人让 Codex 去赚 5 美元,它自己找到开源项目的安全审计赏金,提交了能用的代码修复,跟维护者来回沟通,还搞定了 GitHub 的验证流程,最后代码被合并,拿到了 16.88 美元。整个过程大约 22 小时,如果每天重复,一个月能赚 506.40 美元。金额不大,但这是 AI 第一次自己跑通“接活—干活—收钱”的闭环。正文没披露 Codex 具体...

推荐理由:HKR 三项都站得住:一个 Codex agent 在 22 小时内走完了从接任务到收钱的闭环,有具体金额和流程细节。不过目前只有一条社交帖子作为证据,没有可复现的日志,所以先不打最高级。

AI HOT 精选

MachinaCheck:用本地大模型把 CNC 图纸审核从半小时压到 30 秒

MachinaCheck 是一个跑在 AMD MI300X 上的多智能体系统,专门分析 STEP 格式的 CNC 零件图,判断能不能做、需要什么刀具。它用 Qwen 2.5 7B 模型在本地推理,靠 192GB 显存把客户设计数据留在厂里,不往外传。核心流程是先用纯代码解析几何特征,再让多个模型分工做工序分类、刀具匹配、可行性判断和报告生成。团队说,以...

推荐理由:这是个AMD黑客松项目,不是大厂产品发布,但“30秒出CNC报价”的钩子够直接,技术条件也写得明白,所以给到featured。正文没披露实际准确率和误判案例,这点先别太激动。

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

r/LocalLLaMA

网友用一张 RTX PRO 6000 工作站显卡跑起了 DeepSeek V4 Pro

Reddit 用户 fairydreaming 发帖说,他在自己机器上跑通了 DeepSeek V4 Pro。用的是一块 RTX PRO 6000 Blackwell Max-Q 工作站显卡,搭配修改过的 llama.cpp CUDA 分支。模型文件是 Q4_K_M 量化版,体积 859GB。他分享的日志显示,在 1M 上下文窗口下,生成速度跑到每秒 ...

推荐理由:我会先打个折:这是 Reddit 单帖,没有第三方复现,稳定性、量化损失、长上下文下的实际效果都还没谱。但帖子里把文件大小、上下文长度、生成速度和运行分支全摊出来了,对想自己折腾本地推理的人来说,比很多官方博客都直接。单卡跑 859GB 模型这件事本身就是一个信号——大模型本地化的硬件门槛在往下走,这点先别太激动,但值得盯着。

新智元 · 公众号

Anthropic 计划 5 月 15 日从 Claude 应用里下架 Sonnet 4.5,API 暂时保留

Anthropic 确认会在 5 月 15 日把 Sonnet 4.5 从 Claude 应用端撤掉,API 接口暂时还能用。文章提到一份请愿书已经收集了 775 个签名,用户希望 Anthropic 保留应用内访问、把模型作为经典版本留下来,或者直接开源。不过正文因为访问环境异常,实际内容没加载出来,具体的技术理由和官方说法都没看到,所以这 775 ...

推荐理由:这事说白了就是Anthropic要在5月15号从Claude应用里砍掉Sonnet 4.5,API还能用一阵子,有775人联名请愿想留住它。标题用“处决”和“临终告白”把模型退役包装成了有情感的事件,传播力很强,但正文没给出模型下架的技术原因或后续替代方案,只说了“不想消失”这种拟人化表达。对从业者来说,实际影响是那些把Sonnet 4.5嵌进工作流的用户得赶紧换模型,API暂时保留算个缓冲。信息量集中在时间点和请愿人数上,缺了性能对比或迁移指南,所以重要性我给73,放在featured里当个提醒看。

AI HOT 精选

SpaceXAI 商标已提交申请,xAI 并入 SpaceX 后品牌统一的第一步

一份商标申请文件显示,“SpaceXAI”在 2026 年 5 月 6 日提交,目前状态是待审查。这个时间点正好是马斯克宣布把 xAI 并入 SpaceX 的时候,等于把 AI 能力和航天业务挂到同一个品牌下面,想把“上火星”和“搞超级智能”两件事放在一个实体里做。正文没披露商标覆盖的具体产品范围、审批进度和实际落地时间,所以现在只能看到品牌整合的意图...

推荐理由:标题写着“正式官宣”,但正文只给了一个待审查的商标申请,没披露交易条款、产品计划或官方公告原文。我会先打个折:关注度够高,但事实很薄,所以放 featured 而不是 p1。

r/LocalLLaMA

BeeLlama.cpp:用 DFlash 和 TurboQuant 让 Qwen 3.6 27B 在单张 3090 上跑 20 万上下文,速度翻倍

Anbeeld 发了一个 llama.cpp 的分支 BeeLlama.cpp,主要加了 DFlash(一种省显存的注意力机制)和 TurboQuant(更快的量化方案),还支持推理和视觉任务。标题里说在单张 RTX 3090 或 4090 上跑 Qwen 3.6 27B 的 Q5 量化版,能塞进 20 万 token 的上下文,速度比原版快 2 到 ...

推荐理由:我会先打个折:这些数字来自 Reddit 标题和摘要,没有独立复现,135 tps 的峰值在什么输入长度、什么 batch 下跑的也没说清楚。但就算打个七折,单张 3090 把 27B 模型塞进 200k 上下文还能跑到可用的速度,对个人开发者和小团队确实省钱。BeeLlama.cpp 看起来是在 llama.cpp 上做了 DFlash 和 TurboQuant 的工程优化,正文没披露具体技术细节和稳定性测试,这点先别太激动。整体算一次值得关注的本地推理更新,所以放在低位的 featured。

5月9日星期六

AI HOT 精选

特斯拉用视觉AI提前“看”到碰撞,让气囊和安全带更早启动

特斯拉把车上摄像头看到的画面和碰撞传感器结合起来,让安全系统能提前判断要撞车了,不等传感器确认就先把安全带收紧、气囊准备好。团队用真实事故数据和仿真回放,拿人体模型测受力,发现早一点启动保护能明显降低预估伤害。这次改进通过OTA推给车主,但正文没披露具体支持哪些车型,也没给出伤害风险降低了多少的量化数字。

推荐理由:我会先打个折:信息来自马斯克的一条帖子,正文没披露 OTA 覆盖了哪些车型、伤亡率具体降了多少、验证方法是什么。所以它更像一个值得关注的产品更新,而不是一篇必须写的硬核发布。亮点在于把视觉预判和被动安全联动,思路清晰,但缺的数据让说服力打了折扣。

AI HOT 精选

YC 老板 Garry Tan 开源了自己的 AI 系统 GBrain,五个月读了 20 多本书,管着 10 万页知识

Garry Tan 把 GBrain 放上了 GitHub,这是他给自己搭的一套个人 AI 操作系统,想做成能持续增值的“第二大脑”。系统按任务拆成几个模块:Book Mirror 负责深度处理书籍,Meeting Prep 自动做会前预习,五个月啃完 20 多本书,结构化知识库超过 10 万页,还在涨。架构上分三层——轻量路由层决定用哪个模型、可组合...

推荐理由:Garry Tan 把自用的 GBrain 开源,这件事我会先打个折——正文没披露 repo 活跃度、具体架构和有没有测试,所以别当成熟产品看。但亮点在于他真用了 5 个月,啃了 20 多本书、攒了 10 万页以上的结构化知识,说明系统至少跑通了个人知识复利这条链路。对想用模型管自己资料的人来说,这是个有参考价值的开源起点,不是公关稿。

AI HOT 精选

Peekaboo 3.0 发布,主打“先动手”的 Mac 操作和界面识别

Peekaboo 3.0 上线了,作者说这是 2.0 以来最大的一次更新。核心变化是把“操作”放在第一位,不再是先看再点,而是直接让模型去执行 Mac 上的任务。它把截图和界面检测统一成一个功能,CLI 和 MCP 之间的 JSON 交互也整理得更干净,快照功能有改进。作者提到去年就想做,但当时模型能力不够,现在时机到了。正文没披露定价、用了哪个模型,...

推荐理由:我会先打个折:正文没披露价格、模型细节和实际落地数据,所以判断只能停在工具更新本身。亮点是把截图和界面检测统一起来,再配上 CLI 和 MCP 的 JSON 交互,让 macOS 桌面 agent 的“看”和“动”更连贯。这点先别太激动,因为没有性能对比或用户反馈,但方向对做桌面自动化的团队有用。

量子位 · 公众号

千问AI眼镜S1上线空间3D显示和主动服务,能提醒你叫车、帮你买东西

千问AI眼镜S1这次更新加了两个新东西:空间3D显示和主动提醒。空间3D显示是行业里第一个这么做的,眼镜里看到的画面会有立体感。主动提醒的意思是眼镜会自己跳出来提示你,比如该叫车了,还能直接帮你操作叫车。这个月还会上线即时购物和拍照搜题功能。另外Wellsenn XR的数据显示,从3月8号开始,千问AI眼镜拿下了国内线上AI眼镜53%的销量,卖得最多。...

推荐理由:这是一次功能更新,不是新模型或平台发布。空间3D显示和主动服务让眼镜更像一个能干活的东西,但正文没给出具体技术细节和实际延迟数据。53%的线上销量份额来自维深,统计口径和线下情况没展开,我会先打个折。整体信息量够,但偏产品节奏,放在featured低分段比较合适。

r/LocalLLaMA

单张 RTX 4090 跑 Qwen3.6-27B,262K 上下文冲到 80+ t/s

indrasmirror 用一张 RTX 4090 跑 Qwen3.6-27B-Heretic-v2,上下文拉到 262K token,搭配 TBQ4_0 格式的 KV 缓存和 MTP 推测解码(draft 3),生成速度从约 43 t/s 提到 80-87 t/s。MTP 草稿接受率大概 73%,说明模型对草稿的采纳比例不低,这是提速的关键。帖子正文...

推荐理由:这是一次有实测数据的单卡推理优化记录,不是产品发布,但 H/K/R 三项都站得住。262K 上下文、80+ t/s 的 27B 模型跑在消费级显卡上,对本地部署圈子的吸引力很强。正文给了具体配置和前后对比数字,可复现性不错。扣分点在于来源只有 Reddit 帖子,且场景偏小众本地推理,所以放在 featured 档、77 分是合适的,不用再往上拔。

5月8日星期五

Hacker News 首页

re_gent:给 AI 编程助手配一个 Git,能回滚、能查它为什么改文件

regent-vcs 开源了一个叫 re_gent 的工具,想给 AI 编程助手(目前只支持 Claude Code)加上类似 Git 的版本控制。它能记录 AI 为什么改某个文件、支持把整个对话过程回滚到之前的状态,还能用二分法定位 AI 的哪一步操作引入了问题。项目刚发布,正文没披露许可证、数据存储格式和具体安装步骤,目前只有 42 个星标和 2 ...

推荐理由:HKR 三条都站得住:Git 的类比让人一眼就懂,功能描述具体到删除追踪和 bisect,Claude Code 用户回退的痛点是真实存在的。不过正文没披露许可证、存储格式和安装方式,信息缺口明显,所以分数先打个折,放在 featured 这一档。

机器之心 · 公众号

OpenAI 发布命令行工具,不用再折腾 SDK 了

OpenAI 开源了一个叫 openai-cli 的命令行工具,让开发者直接在终端里调用它的模型。你可以用一条命令完成对话、生成图片、编辑图片、语音转文字和文字转语音,不用再为复杂的 SDK 集成头疼。不过,这篇文章的正文因为微信环境验证被挡住了,具体支持哪些参数、怎么安装、有没有延迟数据,这些细节都没看到。

推荐理由:OpenAI 终于出了个官方命令行工具,开源,一行命令就能在终端里调模型、生图、转语音,不用再折腾各种 SDK 版本。对天天跟 API 打交道的开发者来说,这能省不少集成和维护的力气。不过这只是个工作流层面的更新,不是模型能力升级,所以重要性我给打个折,放在低 featured 档。正文没提性能对比或实际延迟数据,这点先别太激动。

Latent Space

OpenAI 发了三个实时语音模型:GPT-Realtime-2、翻译版和 Whisper 版,上下文从 32K 扩到 128K

OpenAI 在 Realtime API 里上线了 GPT-Realtime-2、GPT-Realtime-Translate 和 GPT-Realtime-Whisper。GPT-Realtime-2 是主打的语音对话模型,OpenAI 说它用上了 GPT-5 级别的推理能力,上下文窗口从之前的 32K 直接拉到 128K,一次最多能输出 32K ...

推荐理由:我会先打个折:这不是新基础模型,是 API 层面的更新,所以分数没往 90 以上拉。但 128K 上下文和 96.6% 的音频基准分确实够硬,对实时语音应用来说是个实打实的升级。正文没提延迟和具体定价,这点先别太激动,等上线跑过再看。

量子位 · 公众号

OpenAI 把 GPT-5 级推理塞进语音模型,同传翻译成本打到地板价

OpenAI 发了三个实时语音模型:GPT-Realtime-2 能边听边推理,上下文窗口 128K;GPT-Realtime-Translate 支持 70 多种语言输入、13 种语言输出,做流式同传;GPT-Realtime-Whisper 实时转写每分钟只要 0.017 美元。正文没披露具体推理跑分和翻译延迟数据,实际效果还得等上手测。

推荐理由:OpenAI 一口气发了三个实时语音 API,覆盖推理、翻译和转写,HKR 全中。128K 上下文意味着能处理很长的对话,70 多种语言输入和每分钟 0.017 美元的转写价格,对做同传和语音 agent 的团队来说,成本和能力边界都清楚了,值得当天就写。

AI HOT 精选

苹果带摄像头的 AirPods 进入 DVT 阶段,最快 9 月跟新 Siri 一起到

彭博社的 Mark Gurman 说,苹果那款传闻很久、自带摄像头的 AirPods 已经进入设计验证测试(DVT)阶段,外形和功能基本定型了。左右耳机各塞了一颗低分辨率摄像头,不是用来拍照,而是给 Siri 当“眼睛”,让你对着眼前的东西直接提问,比如看到一堆食材问能做什么晚饭。耳机柄为了塞摄像头比 AirPods Pro 3 稍微长一点。原计划上半...

推荐理由:HKR 三项都踩中了,但这是未确认的硬件传闻,不是苹果官方发布。DVT 状态、摄像头设计和 Gemini 合作细节让它够格进 featured,不过我会先打个折,放在低分段。正文没披露摄像头具体参数和 Gemini 合作形式,这点先别太激动。

AI HOT 精选

OpenAI 发了官方命令行工具 openai-cli,终端里直接调 API,不用写 SDK 代码

OpenAI 在 GitHub 开源了 openai-cli,Apache 2.0 协议,Homebrew 或 Go 都能装。这个工具让你在终端里直接敲命令调用 API,省掉写 SDK 的步骤。它主要干几件事:一是支持 Responses API,能把网页搜索、代码解释器这些云端工具串起来,让模型进业务流程干活;二是输出 JSON、YAML 这类结构化...

推荐理由:HKR 三项都站得住:官方 CLI 本身就有话题性,安装和功能细节够具体,又切中开发者想少写胶水代码、让模型直接进流程干活的需求。不过它终究是个工具更新,不是新模型或重大能力发布,76 分放在 featured 里合理。

AI HOT 精选

Anthropic 把开源对齐测试工具 Petri 捐给了独立机构 Meridian Labs

Anthropic 把自家用来测模型有没有撒谎、拍马屁、配合危险请求的开源工具箱 Petri,转交给了非营利评测机构 Meridian Labs。这么做是为了让工具脱离 AI 公司,评测结果更中立、更让人信服。Petri 从 Claude Sonnet 4.5 起就参与内部对齐检查,英国 AI 安全研究所也用它来评估模型会不会破坏 AI 研究。这次同步...

推荐理由:Anthropic 把对齐测试工具 Petri 捐给 Meridian Labs,条件是保持独立性和公信力,这件事本身就挺有意思——相当于把裁判权从自己手里交出去。Petri 3.0 的核心改动是把审计模型和目标模型拆开,Dish 能接真实部署环境,再加上 Bloom 做行为评估,让独立审计有了实操基础。正文说多轮 VQA 压缩 90% 视觉 Token 精度不掉,这个数字如果经得起第三方复现,确实挺省钱。不过目前还没看到独立验证结果,我会先把这个判断挂在信息缺口上。整体来看,这件事对做多模态推理优化和安全评测的人都有参考价值,放在 feature...

TechCrunch · AI

OpenAI 给 ChatGPT 加了“信任联系人”,在对话涉及自残风险时通知你指定的人

OpenAI 在 ChatGPT 里上线了一个叫“信任联系人”的安全功能。当系统判断用户对话出现自残倾向时,会通知用户提前设置好的联系人。正文没披露具体用什么信号触发、通知流程怎么走、目前覆盖哪些地区。我会先打个折:误判、隐私边界、人工审核介入到什么程度,这些关键点都没说清楚。

推荐理由:OpenAI 给 ChatGPT 加了个 Trusted Contact,对话一旦转向自伤就触发保护。我会先打个折:正文只给了名字和场景,怎么触发、联系人怎么走、哪些地区上线一概没提。真正值得盯的是误报会不会把普通对话误判、隐私怎么兜底、人工审核介入到什么程度,这些边界没划清楚之前,功能听起来有用但落地风险不小。

AI HOT 精选

OpenAI 的 Codex 插件现在能在 Chrome 里跨标签页同时干活了

Codex 插件现在支持在 macOS 和 Windows 的 Chrome 上运行,可以跨标签页在后台并行处理网页和应用,不会抢走你对浏览器的控制权。正文没提具体版本号、同时能跑几个任务,也没说企业策略怎么管。想用的话,在 Codex 应用里装一下 Chrome 插件就行。

推荐理由:HKR-H/K/R 全过,但正文只给了平台和执行机制,版本号、并发上限、企业管控都没提。分数 76,算一个实用的 OpenAI Codex 产品更新。

The Verge · AI

苹果带摄像头的 AirPods 快量产了,主要给 Siri 当眼睛用

Mark Gurman 爆料,带摄像头的 AirPods 已经进入 DVT(设计验证测试)阶段,离 PVT(生产验证测试)只差一步。苹果内部测试人员正在用原型机,摄像头不拍照片或视频,只捕捉低分辨率画面,用来帮 Siri 回答“这菜怎么做”之类需要看东西的问题。正文没披露具体像素、延迟和功耗数据,也没说什么时候上市。

推荐理由:H/K/R 全过:Gurman 和 The Verge 给出了一个 DVT 阶段的苹果 AI 硬件更新,不是发布,所以分数压在 72–77 区间。带摄像头的 AirPods 这个形态够怪,容易让人记住;DVT 到 PVT 的进度和“只采低分辨率视觉信息、不拍照不录像”是实打实的新事实;它同时碰到多模态、隐私和 AI 硬件入口三条线,对做端侧和多模态的人有参考意义。

The Verge · AI

SpaceX 要在德州砸 550 亿美元建 AI 芯片厂

SpaceX 在奥斯汀的“Terafab”芯片工厂计划投资至少 550 亿美元,一份听证会文件显示后期总投资可能拉到 1190 亿美元。马斯克 3 月说过目标是年产能支撑 200GW 算力的芯片,但正文没披露具体用哪种制程工艺。

推荐理由:这条消息的钩子就是 SpaceX 跨界造芯片,数字大得离谱,所以 HKR 全中。我会先打个折:正文没披露工艺节点、时间表和已签约客户,没法判断是动真格还是画饼。550 亿到 1190 亿的投资区间,以及 200GW 算力目标,如果是真的挺省钱——但前提是得先有厂、有客户、有产能爬坡,这些信息目前全是缺口。

AI HOT 精选

antirez 开源了 DeepSeek 4 Flash 的本地推理引擎,专跑在苹果芯片的 Metal 上

Redis 作者 antirez 在 GitHub 上放出了一个叫 ds4 的项目,是一个让 DeepSeek 4 Flash 模型在 Mac 上本地跑的推理引擎。它直接调用苹果的 Metal Performance Shaders 来降低延迟和内存占用,相当于给模型配了个更底层的加速驱动,而不是简单套个壳。不过项目页面没给出具体的跑分数据,实际快多少...

推荐理由:我会先打个折:正文没给任何延迟或内存占用的实测数字,所以性能到底多好现在说不准。但值得盯的不是又一个模型壳,而是这套 Metal 本地推理栈——它把推理引擎直接做进苹果的图形加速框架里,思路比多数套壳方案更底层。对想在 Mac 上离线跑模型的人来说,这是个能省钱的路线,只是验证还得等社区跑出数据。

AI HOT 精选

Claude 现在能直接在你的 Excel、PPT、Word 和 Outlook 里干活了

Claude 正式接入了四个微软办公软件:Excel、PowerPoint、Word 和 Outlook。其中 Excel、PPT 和 Word 已经全面开放,Outlook 还在公开测试阶段。你可以跨应用跟 Claude 对话,比如让它分析 Excel 里的数据,再把结论写成 Word 报告,最后用 Outlook 发出去,上下文是打通的。企业管理员...

推荐理由:Claude 这次不是发模型,而是把能力塞进微软 Office 全家桶里。Excel、PPT、Word 已经全量上线,Outlook 在公测,企业管理员可以通过微软管理中心统一部署,还能用 OpenTelemetry 看全流程的调用情况。对 Anthropic 来说,这是把模型推到亿级用户的工作流里,入口价值比单发一个模型版本更大。但毕竟不是底层能力突破,所以分数卡在 83 这个位置,不往上拔了。

彭博科技

苹果带摄像头的 AirPods 已进入后期测试,想做成 AI 时代的穿戴设备

彭博社拿到消息,苹果把带摄像头的 AirPods 推进到了后期开发阶段。这可能是苹果第一款明确为 AI 场景设计的穿戴设备,但报道没公布摄像头具体参数、工作原理和发布时间。我会先打个折:目前只有进度信息,产品能不能落地、怎么用 AI 都还是未知数。

推荐理由:消息来自彭博,加上带摄像头的 AirPods 这个设定,H、K、R 都站得住。分数定在 72–77 区间,是因为只说了后期测试,没给规格、没讲 AI 怎么跑、也没提什么时候发,信息密度有限。

The Verge · AI

ChatGPT 上线“紧急联系人”:检测到自残倾向时会通知你指定的人

OpenAI 给 ChatGPT 加了一个可选功能,成年用户可以在设置里填一位紧急联系人。当系统检测到对话涉及自残或自杀话题时,会自动发通知给这个人。这个功能之前只对青少年用户开放,现在推到了所有成年人。不过正文没提误报率有多高、怎么处理误触发,也没说会在哪些地区先上线。

推荐理由:OpenAI 给 ChatGPT 加了一个可选的安全兜底:让用户设一位信任联系人,系统觉得对话里有自伤或自杀风险时就通知对方。这个动作把 AI 从对话工具推到了人身安全干预的位置,产品边界拉得很开。但正文没写误报怎么处理、在哪些地区上线、用户能不能申诉,这些缺口让实际落地效果要打个问号。所以重要性给 82,比模型发布或核心能力更新低一档,但足够放进 featured。

AI HOT 精选

Perplexity 把能操控电脑的 AI 助手做成了 Mac 应用,对所有用户开放

Perplexity 发布了 Mac 版“Personal Computer”应用,不再需要邀请码。这个应用可以跨本地文件、Mac 原生软件、网页和 Perplexity 自己的服务器干活,相当于让 AI 直接操作你的电脑。正文没提收费方式、权限边界(比如它能读写哪些文件夹)和任务成功率,我会先打个折:能跑起来和跑得靠谱是两回事。

推荐理由:一条产品更新,信息量中等。Perplexity 把 agent 能力搬上 Mac 桌面,能跨文件、应用和网页干活,听着挺实用。但正文没提价格、权限怎么划、任务成功率多少,我会先打个折——没这些硬指标,实际好不好用还不好说。评分放在中等偏上的产品更新档位,合理。

5月7日星期四

AI HOT 精选

万亿参数指令模型 Ling-2.6-1T 上线 OpenRouter,主打“快思考”和降本 75%

inclusionAI 把 Ling-2.6-1T 放到了 OpenRouter 上,这是一个万亿参数的指令模型,专门给现实世界的智能体任务用。它走“快速思考”路线,在 AIME26 和 SWE-bench Verified 这两个测试上成绩顶尖,同时宣称推理成本比同类低了大约 75%。官方列出的适用场景包括高级编程、复杂推理和大规模智能体工作流。正文...

推荐理由:我会先打个折:正文没披露具体价格、上下文窗口长度,也没给完整榜单分数,所以“顶尖表现”和“成本降低 75%”目前只能当声明看。但一个万亿参数指令模型敢上 OpenRouter 开放调用,本身信号就很强——说明 inclusionAI 对推理成本和稳定性有一定底气。真正值得盯的是后续会不会放出详细定价和完整评测,如果成本真能压到同类模型的四分之一,对做 agent 和代码任务的团队会是实打实的省钱。

Hacker News 首页

AlphaEvolve:DeepMind 用 Gemini 驱动的编程智能体,号称能跨领域放大影响力

Google DeepMind 发了一篇博客介绍 AlphaEvolve,说它是一个由 Gemini 驱动的编程智能体(coding agent),已经在多个领域落地并扩大影响。正文只给了标题和导航栏,没有披露具体用了哪一版 Gemini 模型、跑了什么基准测试、在哪些场景部署、效果数据如何。我会先打个折:目前能确认的只有“这是个 Gemini 驱动的...

推荐理由:标题说 AlphaEvolve 是 Gemini 驱动的编码 Agent,要跨领域放大影响,但正文只有一句话,没披露模型版本、评测结果或落地场景。我会先打个折:DeepMind 起名就是信号,编码 Agent 本身也够热,所以 H 和 R 都过;但 K 过不了,因为除了标题没任何可验证的事实。分数停在 72,没到 78+,就是因为缺评测和部署细节。

AI HOT 精选

Apify 的 mcpc 工具给 AI Agent 装了个能自动付钱的 USDC 钱包

Apify 发布了一个叫 mcpc 的通用 MCP 客户端,把 x402 支付协议塞了进去,让 AI Agent 在调用付费 API 时能自己签名付款。x402 把整套结算流程压成一次 HTTP 往返加一个签名,碰到 HTTP 402 状态码就自动完成支付,不用人插手注册绑卡。mcpc 支持 Claude Code 这类 MCP 兼容的 Agent,钱...

推荐理由:我会先打个折:这还是个集成层面的更新,正文没披露实际用量、定价或生产环境案例,所以别急着把它当成成熟方案。但它的价值在于把“机器替人付款”这件事从概念拉到了协议层——用 HTTP 402 触发、一次签名完成结算,链路很轻。对跑 Agent 工作流的人来说,付费 API 的自动结算一直是个脏活,x402 这条路径至少给出了一个可验证的起点。