Nvidia 推出免费工具 PAIR,把家里闲置的电脑拼成一台本地 AI 服务器
PAIR 是 Nvidia 新发布的开源软件,不是硬件路由器。它能在你家的局域网里自动发现装了 RTX 20 系以上显卡或苹果 M4 芯片的电脑,把它们串起来,一起跑 Ollama、LM Studio 这类本地模型推理,主要瞄准让模型进业务流程干活的 agent 场景。正文没提延迟、带宽要求和实际吞吐量,所以性能这块先别太激动。
PAIR 是 Nvidia 新发布的开源软件,不是硬件路由器。它能在你家的局域网里自动发现装了 RTX 20 系以上显卡或苹果 M4 芯片的电脑,把它们串起来,一起跑 Ollama、LM Studio 这类本地模型推理,主要瞄准让模型进业务流程干活的 agent 场景。正文没提延迟、带宽要求和实际吞吐量,所以性能这块先别太激动。
Google Cloud 推出了 Cloud Run instances,一种始终在线的容器服务,每月 5.7 美元。它解决了传统 serverless 服务(如 Cloud Run 普通模式或 Lambda)在无流量时缩到零、杀死后台循环的问题,也比每月 15-25 美元的虚拟机便宜。作者用它搭了一个技术简报 Agent,每 30 分钟抓取新闻,带持...
IFM 这次放出了 K2 Horizon,一共六个模型,从 0.9B 到 375B-A23B 都有。最小的 0.9B、3.7B 和 7B 在各自尺寸里都刷到了新高度,0.9B 在 AIME 2026 数学基准上拿了超过 48 分,还带了推理和工具调用能力。36B-A4B 用了一种叫 MoVA 的新注意力机制,按每个激活参数算,性能比很多大模型都强。这次...
推荐理由:IFM 这次放出的 K2 Horizon 系列信息密度高,六个模型全开源,小尺寸模型在数学基准上刷出新分数,还引入了一个新注意力机制。没给更高分是因为 IFM 还不是 OpenAI 或 Anthropic 那个级别的实验室,市场验证还没跟上,我会先打个折。
周四上午 11 点左右(美东时间),ChatGPT、Grok 和 Claude 几乎同时出问题。ChatGPT 这边,聊天、登录、传文件、语音、搜索、深度研究、生图全挂了,官方状态页只写了“ChatGPT 和 Codex 错误率升高”。Claude 的聊天和 Claude Code 也受影响。Grok 具体什么症状、各自什么时候恢复的、是不是同一个根因...
推荐理由:ChatGPT、Grok、Claude 在同一个上午集体出问题,这种同步性很少见,对大量用户的日常工作流是直接打断。正文没披露根因和恢复时间线,让事件的重要性没法打到顶,但话题本身足够上推荐。
Hacker News 上有人发现 OpenAI、Claude 和 Grok 差不多同一时间都崩了。用户贴出 Downdetector 的数据,显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,所以很多人猜是 Cloudflare 或某个底层共享服务出了问题,然后像多米诺骨牌一样带崩了这几...
推荐理由:OpenAI、Claude 和 Grok 差不多同一时间崩了,用户贴出的 Downdetector 数据显示 Cloudflare、Azure、AWS 和 Google Cloud 在 7:30 左右报错量都突然飙高,很多人猜是 Cloudflare 或某个底层共享服务出了问题,像多米诺骨牌一样带崩了这几家。这事在 HN 上讨论很热,但正文没披露官方确认的根因,所以我会先打个折,给到 featured 门槛的 78 分。
Google DeepMind 今天发布了 WeatherNext 3,号称是目前最准的全球天气 AI 模型。空间分辨率比上一代高了约 5 倍,能更清晰地捕捉雷暴、雨带这类局部天气,而且每小时更新一次。正文没披露具体参数量或是否开源,所以实际推理成本和可用性还不清楚。对做天气 AI 或依赖高分辨率预报的人来说,这算是目前最强的公开基线。
Google 发布了 WeatherNext 3,一个全球 AI 天气模型,分辨率比上一代高5倍——相当于从模糊的卫星图升级到能看清街道细节。它用实时观测数据训练,重点改进雨雪预报。正文没披露具体准确率提升了多少,也没说什么时候能用上。
Google DeepMind 和 Google Research 今天发布了 WeatherNext 3,一个深度学习天气模型,在 Operational WeatherBench 排行榜上拿了第一。Google 说它会直接给搜索、地图和 Gemini 提供天气数据,也会上云平台。这是第一次 Google 核心天气变量直接喂进自家产品。模型具体怎么跑...
作者 Rabah Shihab 把自己 1993 年在巴格达用纯 68000 汇编写的游戏《Babylonian Twins》喂给了 Claude Fable 5,让它把 72,758 行汇编代码移植到 Godot 4 引擎。第一步,AI 在 21 分钟内把 2010 年手写的 34,000 行 C++ 引擎搬进了 Godot,两个角色直接能跑。第二步...
OpenAI 启动了一个叫“Daybreak for Frontline Defenders”的新项目,承诺拿出 10 亿美元,以补贴形式提供自家 Daybreak 安全模型的访问权限、培训和技术支持,目标是在六个月内花完。这笔钱优先给美国那些预算紧张的一线防御单位,比如自来水厂、电网运营商、州和地方政府、社区银行等,帮他们审查老旧代码、分析可疑活动、...
推荐理由:10 亿美元补贴数字够硬,花法也具体,不是空头支票。扣分是因为这只是承诺,钱还没落地,而且正文没披露 Daybreak 模型本身的能力边界和实际防御效果,我会先打个折。
H公司放出了NeoMME,有2.6亿和8亿参数两个版本,主打多语言、多模态。它没走主流路线——不挂单独的视觉塔,也不接自回归语言模型,而是用一个双向Transformer同时吃进文字和原始图片块,从头训练,训练方式叫“掩码离散扩散”,可以理解成用猜被遮住的文字来学图片内容。微调后的NeoMME-Retriever能在一次前向计算里同时输出稠密向量和“后...
NVIDIA 本周给云游戏平台 GeForce NOW 加了 28 款游戏,头牌是《NBA 2K27》,而且它首发就支持 DLSS 5。这是 DLSS 5 第一次跟着年货大作一起上线,对云游戏玩家来说算个信号。但正文没提 DLSS 5 具体能提多少帧、延迟降多少,也没说其他 27 款里哪些也用了 DLSS 5。所以这点先别太激动,等跑分出来才知道实际效果。
英伟达正式宣布买下 AI 模型社区 Hugging Face,花了 129.3 亿美元。这个平台上有 300 万个模型、100 万个应用和 50 万个数据集,1800 多万开发者都在用。CEO 黄仁勋承诺平台会保持开放,不强制用英伟达的芯片或云服务。对英伟达来说,控制一个开放的生态,既能给自己的芯片做优化,也能把闲置算力卖出去。
推荐理由:英伟达 129.3 亿美元买 HuggingFace,是今年 AI 基础设施领域最大的一笔并购。300 万模型加 1800 万开发者的生态规模,配上黄仁勋'保持开放'的承诺,既有冲击力又有具体数字,还自带争议——开放承诺和商业利益怎么平衡,是后续最值得盯的线头。
英伟达同意以 129.3 亿美元收购 Hugging Face,把最大的开源模型、数据集和工具托管平台收到自己旗下。Hugging Face 2016 年成立,常被叫做“AI 界的 GitHub”,开发者在这里分享模型和协作。英伟达说会扩大平台规模、加强基础设施、让更多人用上 AI。不过正文没披露交易什么时候完成、需要哪些监管审批,这些关键信息都还缺着。
推荐理由:英伟达花近 130 亿美元买下 Hugging Face,直接动了开源模型托管的基础设施层。标题够悬念,价格和平台归属都是新信息,模型开发者和基础设施圈都会聊起来。不过正文没写交割时间和监管审批,这些关键缺口让判断得先打个折,但整体还是值得放在首页。
Thomas Wolf 在 X 上发帖说 NVIDIA 要花 129.3 亿美元买下 Hugging Face,当天用户端不会有任何变化。Wolf 表示团队会继续把 Hub 做成一个开放、独立、不绑定特定算力的平台,同时用 NVIDIA 的资源推开源 AI。帖子只有一段声明,没提交易结构、监管审批或整合时间表。
推荐理由:这笔约 130 亿美元的收购会重塑 AI 基础设施格局。Wolf 亲自确认并承诺 Hub 保持开放、算力中立,既让人稍微放心,也给开源生态引入一个新变量。我会先打个折:帖子只有一段声明,没披露交易结构、监管审批或整合时间表,所以别太早下结论。
视频讲的是多 Agent 系统里 Token 消耗失控的问题。几个 AI 代理互相调用、来回传消息,Token 用量会暴涨,传统 FinOps(云成本管理)那套根本管不住。标题提到微软 Foundry,但正文没披露具体案例或数据,比如一个典型多 Agent 任务到底多烧钱、比单模型高多少倍。核心痛点就是:Agent 协作时每个步骤都在花 Token,没...
Playco 用 GPT-6 Astra 做了一个叫 Playbot 的 AI 游戏开发 IDE,直接连 Unity 和 Godot 引擎,让模型自己编辑场景、跑测试、找 bug。他们先搭了一个灰色方块原型,然后让模型一次性生成三个不同主题的游戏世界,大部分第一次跑就能玩。相比上一代模型,手动修复量砍了一半。空间推理、UI 响应和手感都有提升。模型还能...
法律科技公司 Legora 用 OpenAI 的 GPT-6 Astra 跑了一次财报核对任务:一次性处理 41 份文件,几分钟内完成所有数字比对,包括找出藏在营收附注里的 50 万英镑差额。之前这个活要花一整个晚上甚至几天。Legora 自己的评测显示,新模型在这个流程上比上一版提升了近 40%,4 个故意埋的错误全抓到了。不过正文没披露具体用了什么...
NVIDIA 官方博客发了条一句话公告,说要花 129.303 亿美元买下 Hugging Face。但正文除了标题和网站导航栏,什么都没写——没提交易怎么完成、时间表、团队怎么整合,连个官方解释都没有。金额精确到小数点后三位,看着像真的,可信息量基本为零。目前只能当个头条消息看,后续细节得等官方再更新。
一条 HN 帖问谁真的在生产环境跑 MCP(模型上下文协议,一种让 AI 模型直接调用外部工具的标准接口)。有人给英国议会爬虫加了个 MCP 接口,调试时 Claude 自己主动去查数据,他觉得“挺香”。另一个开发者把 Claude Code 接上了 Jira 和 Figma,说用自然语言操作 Jira 简直是解脱,但 MCP 只比直接调 API“方便...
陈大年复出创办了 StartLux,第一款模型 StartLux-V1.0-27B-Preview 只有 270 亿参数,能直接在消费级电脑上跑,不用联网。在信通院 MCP 专项评测里,它综合得分 39.25%,排第二,比 1.6 万亿参数的 DeepSeek-V4-Pro 只差 1.3 个百分点,还在位置导航、金融分析和浏览器自动化三个单项拿了第一。...
推荐理由:陈大年带着 StartLux 重回牌桌,第一个模型就在信通院 MCP 评测里拿了第二,27B 参数跑在消费级硬件上,三个单项第一,跟 DeepSeek 的 1.6T 旗舰只差 1.3 分——这个性价比信号对 agent 方向的人很有参考价值。不过目前只有 benchmark 成绩,模型没公开,实际可用性还看不清,所以分数先打 82,等有更多落地信息再往上调。
OpenAI 推出了自称最聪明、对齐最好的模型 GPT-6 Astra。它在 FrontierMath Tier 4 上拿了 98%,ARC-AGI-3 上拿了 99.9%,ExploitBench 直接满分 100%,说明做数学题、适应新环境、找漏洞的能力都拉满了。在模拟越权测试里,Astra 一次都没越界,而上代 GPT-5.6 Sol 有 48%...
推荐理由:OpenAI 的新旗舰一口气刷爆三个高难度基准,还明确把网络安全能力标到 Critical 级别,并拿上一代模型的对齐数据做直接对比。这种发布今天一定会被所有 AI 媒体铺满。没给 100 分是因为正文没提实际开放节奏和外部复现情况,这些缺口让满分站不住。
WASM_OS 是一个完全跑在浏览器里的操作系统实验,启动只要 1.6 秒。自带文件管理器、画图、终端、Lisp 解释器,甚至还有一个 Linux 兼容层——全部编译成 WebAssembly。代码已开源。不过正文没提是否支持持久化存储或网络栈,所以目前更像一个玩具 demo,还不能当正经 OS 用。
Anthropic 发了篇教人用 Claude 搭电商购物智能体的实战指南。文章引用了早期客户的数字:购物车金额最多涨了 35%,下单转化率提升了 60%。但没说是哪些客户、在什么时间段测的,所以这些数字先当个方向参考,别直接当承诺。指南覆盖了搜索、推荐和客服场景,核心建议是让智能体直接调用实时库存和订单接口,别光靠模型自己瞎猜。
NiCE 的 COO Arun Chandra 说,80% 的财富 500 强公司已经在试点 AI Agent(能自主干活的 AI 程序),但真正铺开用的没几家。问题出在大家还在把 Agent 当独立工具,而不是当成一个系统来设计。他建议:先把 Agent 连上公司后端系统和数据库,打破数据孤岛;然后重新设计业务流程,而不是在已经低效的流程上硬套 AI...
Polars 发布了 2.0 的第一个候选版,正式版几周后到。这次大版本更新不堆新功能,主要是清理旧设计、改默认设置。最大的变化是 LazyFrame.collect 默认用流式引擎跑,团队说整体能快 5 倍左右,内存占用也低很多。代价是 join、group_by、unpivot 这些操作不再保证行顺序,除非你手动设 maintain_order。2...
Meta 发了新模型 Muse Spark 1.3,在 AAII 榜单上冲到全球第三,直接对标 OpenAI 和 Anthropic 的最强模型。扎克伯格说这是他们在写代码和让模型进业务流程干活上进步最大的一次,还承诺会开放模型权重。定价挺狠:如果你同意把自己的数据拿去训练,费用能砍掉 90% 以上。另外,斯坦福开了两门教怎么从零搭建 AI 智能体的新...
推荐理由:Muse Spark 1.3 在 AAII 上排到第三,直接对标 GPT-5.6-Sol,扎克伯格还承诺开放权重,训练费能打一折以下。这是 Meta 头一回在主流榜单挤进第一梯队,开源这边的牌桌要重新洗牌。没给满分是因为正文没披露模型参数量、推理成本和具体开放时间表,这些缺口让实际落地效果还得再观察。
FT这篇评论说,AI行业现在最大的麻烦不是模型不够强,而是公众不信了。公司天天吹AGI(通用人工智能),但产品经常翻车,用户越来越反感。文章建议少画大饼,多讲具体能用的场景,比如医疗诊断、物流优化这些,也别老说AI要取代人。正文没给具体数据或案例支撑,观点偏评论性质。
Uber 正和司机工会一起游说,要求在无人出租车大规模上路前先过安全审计、划定运营范围,并给人类司机留出过渡保护。它自己也在投自动驾驶,但怕 Waymo 等对手铺太快,冲击现有的司机运力网络。工会担心大量司机失业。游说重点放在加州和纽约。文章没提具体时间表,也没说 Uber 自己的无人出租车什么时候落地。
律所开始嫌弃通用AI不够用,要求供应商提供能理解特定法域、判例和内部知识库的定制模型。这意味着法律AI厂商得从卖标准产品转向做可定制、能嵌入工作流的方案。正文没披露具体成本或延迟数据,但定制化通常意味着训练和部署成本更高,验证也更复杂。
Eldermyr 是一个免费、浏览器直接玩的 MMO,作者靠“vibecoding”(用 AI 辅助写代码,边聊边改)6 周就做出来了。目前在线 20 人,进度存档,不用下载。正文没披露具体用了哪些 AI 工具,但从更新日志看迭代速度很快,几乎每天都有新版本。如果是真的,这成本和时间都挺省,但 20 人同时在线对 MMO 来说验证还很弱,先别太激动。
Nex 把 Claude 塞进销售、营销这类高重复度的 GTM 工作流里,不是只聊天,而是让模型进业务流程干活。正文没披露具体接入了哪些平台或工具,所以集成深度和适用范围还不清楚。如果真能稳定跑通,对想用 AI 替代人工执行批量外联、线索筛选的团队来说,省人力的效果会很明显。
世界排名第一的申真谞九段在 7 月 21 日的三番棋决胜局中,执黑 221 手以 11.5 目大胜 KataGo,完成让两子条件下的 2:1 逆转。这是人类棋手首次在正式系列赛中击败顶尖围棋 AI。第一局惨败后,申真谞放弃了模仿 AI 走法,改用防守和捞实地为主的策略;第三局他从第 80 手起胜率就维持在 99%,最终稳稳拿下比赛。他获得了 2.5 亿...
推荐理由:一场有实质内容的象征性事件。申真谞输完第一局后放弃模仿 AI,用防守和捞实地硬扛,第三局后半盘胜率全程 99%,说明他找到了当前最强围棋 AI 在让两子条件下的策略漏洞。对 AI 从业者来说,这比单纯输赢更有意思——它展示了人类怎么通过调整策略去摸模型的能力边界。不过说到底这还是一场围棋比赛,对模型训练和工程落地的直接知识增量有限,所以分数就定在 featured 档。
Artificial Analysis 的编码智能体指数把 Meta Muse Spark 1.3(max 配置,跑在 Muse Code 上)和 Claude Code + Opus 5(xhigh 配置)都标了 68 分,并列第一梯队。帖子只给了分数,没拆具体任务、延迟和成本,所以这个平手先别太当真——等详细数据出来再看值不值得切模型。
Anthropic发布了Fable 5.1,缓存读取价格砍了75%,但标题说未必真省钱——可能是命中率低或定价有坑。模型还上了Terminal-Bench和蛋白质设计任务,但正文没披露任何性能数字或成本对比,所以这点先别太激动。如果是真的挺省钱,但信息缺口太大,没法判断。
Hugging Face 和 Liquid AI 发了一份实操指南,拿 LFM2.5-350M 这个小模型做实验。他们用 TRL 库跑 GRPO(一种按组比较、挑好回答来优化的强化学习方法),只用了 500 条样本、训练 100 步,在免费 Colab GPU 上就能跑完。在 IFStruct 结构化输出基准上,模型按指定格式返回有效结果的比例从 22...
推荐理由:一份实操向的教程,数字具体、方法可复现,H 和 K 都站得住。但内容只对微调工程师有用,缺乏破圈潜力,R 不成立。放在 featured 档给 72 分合理。
OpenAI 在 8 月底合入开源仓库的一份系统提示模板,透露了 Codex Persistent mode 的真实运作方式:它不是 24 小时常驻进程,而是一个每 1 到 3 分钟唤醒、检查、再休眠的循环。每次睡下前,模型必须记下目标、当前状态、收工条件和下次检查时间,醒来后自己判断该干什么。一条硬规矩是持续运行不扩大授权范围,超出权限必须先请示。W...
推荐理由:信息密度高,有开源仓库的源码依据,把唤醒-检查-休眠的循环和授权范围限制这两点讲清楚了。扣分是因为这是对模板的解读,不是官方发布,实际产品体验未知。
OpenRouter 数据显示智能体每周消耗 7.3 万亿 token,名义上是人类用量的 5.2 倍。但这 5.2 倍里 70% 到 85% 是缓存读取,模型服务商对这部分只收原价的一折左右,所以实际账单大概只多出 1 倍。这个数字只能代表 OpenRouter 一家平台,它的流量只占全球推理量的 1%,而且区分人类和智能体的算法权重没公开,没法复现...
推荐理由:三条消息打包,但核心价值在第一篇:终于有人把智能体名义 token 消耗和缓存打折后的真实成本拆开算了,结论是实际账单大概只翻了一倍。OpenAI 芯片跑分和 GitHub 文档压缩原型是附赠信息,密度稍低。跨源聚合的编辑判断清晰,没有硬吹。
xAI 把 Grok Bot 做成了企业版。每个 Bot 相当于一个在云端独立运行的虚拟员工,能像人一样操作各种应用和网站。你教它一遍工作流程,它就能自己接着干。Bot 之间还能互发消息、共享上下文,不用你来回传话。这次企业版主要加了权限、网络和审计这类管理控制。文章举了销售、招聘、市场、财务和工程五个场景,其中财务 Bot 能从 SaaS 和重复采购...
推荐理由:xAI 把 Grok Bot 包装成企业版“虚拟员工”,主打跨应用操作和 Bot 间直接通信,还加了权限、网络、审计这类企业必需的管理控制。文章举了销售、招聘、市场、财务、工程五个场景,财务 Bot 能从 SaaS 和重复采购里找省钱机会,这个例子比较实在。但正文没披露定价,也没提任何一家实际客户的名字,所以效果到底怎么样还不好说。冲着 Cursor Enterprise 用户送两周免费试用,对开发者群体有直接吸引力,可以先看看实际跑起来是什么样。
GPT-6 Astra 是 OpenAI 目前最强的模型,也是第一个在 Preparedness Framework 下网络安全能力达到 Critical 级别的模型。说人话就是:给它工具和权限,它能自己找未知漏洞、开发攻击方法,不用人手把手教。OpenAI 为此把内部隔离、加密和全程监控(包括思维链监控)都加码了,还设了安全评估卡点。Astra 比上...
推荐理由:OpenAI 旗舰模型发布,第一次把自己安全框架的最高风险等级打出来了,行业震动级别。标题、事实、情绪三点全中,跨源报道密度会很高。没给满分只是因为这篇是安全概览,完整能力基准还没放出来,我会先打个折。