跳到正文

全部动态

今日 3 条

5月15日星期五

r/LocalLLaMA

RTX 5000 PRO 48GB 实跑测试:27B 模型跑到 80 tok/s,200k 上下文全精度缓存

一位完全没装过机的 Reddit 用户花了 5600 美元攒了一台 RTX 5000 PRO 48GB 的机器,单卡跑 Qwen3.6-27B-FP8 模型。他自己说装机全靠问 LLM,配 vLLM 时烧掉了 Claude Code 一半的周额度才搞定。实测下来,生成速度最高能到每秒 80 个 token,提示很长时掉到 50–60 tok/s,但提示...

推荐理由:这篇来自 Reddit 的个人装机实测,把价格和跑分都摆出来了,对想自己攒机跑大模型的人参考价值很高。我会先打个折:只有单卡、单模型、单人测试,没对比其他卡,也没提散热和长期稳定性,所以不能直接当采购指南。但 48GB 显存能跑 27B 模型还这么快,确实让人对本地推理的成本和体验更有信心。

5月14日星期四

AI HOT 精选

杨植麟发 40 分钟视频拆解 Kimi K2:训练花了 460 万美元,编程跑分压过 GPT-5.5

杨植麟在视频里把 Kimi K2 的训练账本摊开了:总花费 460 万美元,靠线性注意力等架构上的极致优化,在编程任务上跑赢了 GPT-5.5 等对手。这个数字说明他们用远低于大厂的预算,靠设计把资源差距抹平了。不过视频是创始人自述,没有第三方验证,跑分对比的具体基准和测试条件也没展开,这点先别太激动。

推荐理由:杨植麟用40分钟视频把Kimi K2的训练账本摊开来看,460万美元的成本在同类模型里算低,编程任务上敢直接叫板GPT-5.5,这个对比本身就有传播力。不过视频是单一信源,具体用了哪些基准测试、对比条件是什么,正文没披露,所以分数卡在84不往上走。我会先打个折,等看到独立复现或更多技术细节再调整。

AI HOT 精选

AI 替你处理邮件,一个月要花多少钱?

作者拿主流大模型算了一笔账:让 AI 帮你读、写、整理邮件,每月推理成本在 22 到 130 美元之间,中位数 26 美元。如果做成 SaaS 产品,按 75% 毛利率定价,一年大概要收 500 美元,比 Google 企业版贵一倍。想省钱的话,换小模型能把成本压到十分之一甚至二十分之一;更狠的做法是直接在用户自己的 GPU 上跑,边际成本趋近于零。文...

推荐理由:这篇文章没发布新模型或产品,就是一篇成本算账的评论。我会先打个折:它把顶尖模型、小模型和本地部署三条路径的月费摆在一起,22–130 美元对比近零成本,数字直观,对正在掂量 AI 邮件代理是否划算的团队有参考价值。正文没披露测试用的具体模型名和邮件量,所以这些数字只能当量级参考,别直接套进预算表。整体是一篇有用的观点分析,不是重大发布,所以重要性给 73 分。

r/LocalLLaMA

双卡 RTX 3090 跑 Qwen 3.6 27B:48G 显存、26 万上下文窗口,生成速度 113 token/秒

一位 Reddit 用户用两张 RTX 3090 在 Ubuntu 上跑 Qwen 3.6 27B 模型,没上 NVLink。处理长文本时每秒能啃 4000 个 token,生成回答的速度是每秒 113 个 token。这个速度日常聊天或做文档处理都够用。不过帖子正文被 Reddit 的安全策略挡了,看不到具体配置细节,比如用的是哪个量化版本、功耗和温...

推荐理由:我会先打个折:这是单个 Reddit 帖子,没披露量化方式、批处理大小和功耗,复现细节不够。但 HKR 三条都踩中了——配置具体、数字清楚、直击本地推理玩家的痛点,所以给到 featured 的低位。

5月13日星期三

AI HOT 精选

Andrej Karpathy 说,AI 编程账单九成花在了没用的上下文上

Karpathy 点出几个常见的浪费行为:每次请求都把整个代码库丢给模型、用最贵的模型干简单活、Agent 重复发送相同内容。他给的省钱思路是管好上下文、打开提示词缓存、按任务难度分模型——日常用便宜的,关键任务再上贵的,再建一个 SKILL.md 文件避免每次都重新教模型。正文没给出具体测试数据,但逻辑上确实能省。

推荐理由:Karpathy 这条吐槽本身信息量不大,但胜在把“无效上下文”这个老问题用账单浪费的角度重新讲了一遍。我会先打个折:正文没给出具体账单样本或可复现的测试,所以没法验证 90% 这个数字。不过它确实把三种典型浪费场景列清楚了——重复传代码库、杀鸡用牛刀、不开缓存——对正在付钱的开发者有直接参考价值。这点先别太激动,但值得看一眼自己的 API 调用是不是也犯了这些毛病。

5月12日星期二

r/LocalLLaMA

一台 16GB 显存 + 64GB 内存跑本地代码补全和智能体编程

Reddit 用户 grumd 在一张 RTX 5080(16GB 显存)和 64GB 内存的单机上同时跑了两套模型:Qwen2.5-Coder-7B Q6 做代码补全,Qwen3.6-35B-A3B Q8 做智能体编程(让模型自己规划步骤、调用工具写代码)。35B 那个模型用了内存卸载,上下文能撑到约 145k,速度是每秒 35.29 个 token...

推荐理由:这是一篇 Reddit 个人实验帖,不是系统评测,没有对比其他方案或验证稳定性,所以我会先打个折。但作者把模型、量化方式、上下文长度和吞吐都列清楚了,对想在自己机器上搭本地编程助手的开发者有直接参考价值。正文没披露功耗、并发表现和长上下文下的准确率,这点先别太激动。

量子位 · 公众号

Anthropic 工程师提议用 HTML 替代 Markdown,Karpathy 也表态支持

Anthropic 工程师 Thariq 发了条推,列出 5 个理由主张模型输出 HTML 而不是 Markdown,Karpathy 随后转发表示认同。他的核心论点是 Markdown 的语法歧义太多,解析器各家实现不一致,模型生成时容易出错;HTML 虽然啰嗦但结构明确,对自动化处理和前端渲染更友好。正文没披露具体是哪 5 个理由,只提到生成 HT...

推荐理由:Anthropic 工程师 Thariq 主张用 HTML 替代 Markdown,Karpathy 也表态支持,这事在开发者圈子里容易吵起来。我会先打个折:这不是模型发布或产品更新,只是一场格式辩论。但文章给了具体数字——HTML 生成时间是 Markdown 的 2 到 4 倍,说明成本差距不小,从业者会关心 token 消耗和维护复杂度。正文没披露实验环境或代码,所以别太激动,目前只是一篇 Reddit 帖子,没有独立复现或论文支撑。

Computing Life · 鸭哥

AI 怎么让我失眠,又怎么帮我找回了睡眠

作者三月底开始严重失眠,每晚只能睡两三个小时,辞职后也没好转。他没靠瞎猜,而是让 AI 花五分钟写了个 app,把苹果手表和手机里 HealthKit 的健康数据(咖啡因、酒精、入睡时间、深睡时段等)全导出来,再让 AI 跑多变量回归分析,看哪些因素和睡眠时长负相关最明显。结果发现,晚饭后最后一次用 AI 的时间是头号变量——用得越晚,睡得越差;而喝咖...

推荐理由:这篇是个人量化实验,不是行业大新闻,但数据很具体。作者先写了个 app 拉出 HealthKit 数据,做回归发现晚饭后最后一次用 AI 的时间越晚,当晚睡眠越短;停用后平均多睡 1 小时 40 分钟。我会先打个折:这只是单人数据,没有复现,也没公开代码或论文,所以重要性停在 78。但 HKR 三项都成立,角度新鲜,数字也够硬,对开源微调那批人来说,既戳中 AI 过劳的焦虑,又给了个可复现的追踪思路。

Computing Life · 鸭哥

我用 AI 治好了 AI 造成的失眠

作者在 2026 年 3 月左右开始严重失眠,每晚只能睡两三个小时。他让 AI 写了个工具,把 Apple Watch 和 iPhone 里的健康数据全导出来,再让 AI 跑多元回归分析,结果发现最影响睡眠的变量是晚饭后使用 AI 的时间——用得越晚,睡得越差。咖啡因、酒精这些反而没表现出明显关联。原因可能是用 AI 时人一直在高强度阅读、思考和并行处...

推荐理由:HKR 三项都成立:个人反转有传播力,HealthKit 加回归分析给了可验证的细节,睡眠损失直接打在 AI 从业者的痛点上。不过这只是单篇 Reddit 帖子,没有独立复现或论文/代码公开,所以保持在 featured 档的 72 分。

r/LocalLLaMA

Reddit 网友用英特尔傲腾持久内存攒了一台机器,本地跑 1 万亿参数模型,速度超过 4 token/秒

Reddit 用户 APFrisco 分享了一套硬件方案:用 768GB 英特尔傲腾持久内存(Optane PMem)当主存储,搭配 192GB DDR4 ECC 内存和一张 12GB 显存的 RTX 3060 显卡,通过 llama.cpp 的混合推理(CPU+GPU),在本地跑起了 Kimi K2.5 这个 1 万亿参数模型的 Q2_K_XL 量化...

推荐理由:HKR 三项都成立:标题的反差感足够抓人,正文把硬件型号、量化版本和速度都列清楚了,而且对本地推理圈子的成本敏感用户有直接参考价值。不过这只是单个 Reddit 用户的分享,复现细节和稳定性都没展开说,所以分数就压在 featured 门槛上。

AI HOT 精选

把大模型命令塞进脚本第一行:用 shebang 直接跑 LLM

Simon Willison 试了一种很野的玩法:把 LLM 命令行工具直接写在脚本的 shebang 行里,让一个纯文本文件变成可执行脚本。最简单的例子是 `#!/usr/bin/env -S llm -f` 下面直接跟一句“画个骑自行车的鹈鹕 SVG”,就能生成图片。复杂一点的可以用 `-T` 参数调用外部工具(比如报时),或者直接在 YAML 模...

推荐理由:Simon Willison 这次没发新模型,也没推平台,就是演示了一个把 LLM 当 shebang 解释器的命令行玩法。我会先打个折:这更像一个巧妙的黑客技巧,不是生产级方案,正文也没披露错误率或延迟数据。但它的价值在于把“用自然语言写脚本”这件事拉到了终端里,fragments 和 -T 这些参数让例子能直接跑通,对经常写胶水脚本的开发者来说,看一眼就会想试试。整体属于低配 featured,因为影响范围还在 CLI 自动化这个圈子里,没往外扩。

AI HOT 精选

Karpathy 聊人机交互下一步:别只让模型吐 Markdown,试试让它直接写 HTML

Karpathy 觉得现在大模型默认输出 Markdown 太简陋了,他建议直接让模型生成带排版、图形和交互的 HTML,界面会好用很多。更远的想法是“交互式神经视频”——用扩散模型实时生成能操作的画面,但他也承认这玩意儿怎么跟精确的传统软件配合还是个没解的问题。输入这边,光靠语音、文字或视频不够,得加上手势指点这类更自然的交互。在脑机接口到来之前,输...

推荐理由:Karpathy 这条推文没给数据,就是个人判断,所以重要性只能打到 featured 的及格线。但他把 LLM 输出形态的变化串成了一条线:从纯文本到带格式的 Markdown,再到能直接渲染的 HTML,最后抛出“交互式神经视频”这个方向。我会先打个折——神经视频现在连跟传统软件精确配合都做不到,正文也没说怎么解决,这点先别太激动。不过对做 AI 产品的人来说,这个框架确实能帮他们想清楚下一步该把界面做成什么样。

5月11日星期一

量子位 · 公众号

菲尔兹奖得主实测 ChatGPT 5.5 Pro,17 分钟跑出论文级数学结果

陶哲轩的同事、菲尔兹奖得主 Timothy Gowers 拿 ChatGPT 5.5 Pro 试了一道加法数论里的难题,模型在 17 分 05 秒内给出了一个最优的二次上界构造,相当于直接产出了一篇小论文的核心证明。之后他又让模型把整个过程写成 LaTeX 预印本,总共花了 47 分钟。Gowers 把结果发在了自己博客上,因为 arXiv 目前拒收 ...

推荐理由:三条都过:Gowers 的第一人称实测、17 分 5 秒和 47 分钟预印本都是可讨论的硬信息。不是模型发布,但有名有姓的实验和数学推理冲击让它必须写。

5月10日星期日

机器之心 · 公众号

谷歌 Ted Xiao 把近十年机器人学习分成三个时代,从 RT-1 到 RT-2 再到规模化

这篇文章的正文被微信环境异常拦截了,实际内容无法读取。从标题和已有英文摘要看,Ted Xiao 的复盘主要讲谷歌机器人团队怎么从 RT-1 用 8.7 万条遥操作轨迹训练,走到 RT-2 把 50 亿到 550 亿参数的视觉语言模型改造成视觉-语言-动作策略。具体三个时代怎么划分、每个阶段踩了什么坑、规模化后效果到底提升多少,正文没披露,没法展开。

推荐理由:我会先打个折:这不是新发布,是一篇回顾性梳理,所以分数没往 80 以上走。但作者身份和内部数字让它值得上推荐位。Ted Xiao 把谷歌机器人学习拆成三个阶段,从遥操作采数据到把大模型当机器人脑子用,脉络清楚。RT-1 的 8.7 万条轨迹说明早期靠人工遥控攒数据的笨功夫,RT-2 用 5B 到 55B 的 VLM 改策略,点出了现在大家纠结的核心——模型大了能不能直接控硬件。正文没披露 RT-2 在真实场景的失败率或延迟数据,这点先别太激动。整体适合给做具身智能的人当路线图看。

新智元 · 公众号

硅谷顶尖 AI 甩开世界一年?这篇正文其实没给实锤

这篇文章的标题抛出一个很猛的判断,说硅谷最前沿的 AI 比外界领先一年,我们用的都是“技术余晖”。但点进去后,页面直接显示“环境异常,完成验证后即可继续访问”,正文内容完全没加载出来。所以,标题里提到的投资人 Elad Gil 的时间差说法(顶尖实验室员工领先硅谷 3-4 个月,硅谷又领先纽约 3-6 个月),以及 Mythos 在专家级网络攻击模拟中...

推荐理由:我会先打个折:这篇是二手评论,不是模型或产品发布,所以分数压在72–77这个区间。HKR三项都成立——“技术余晖”的钩子够抓人,时间差和73%成功率给了具体数字,地域焦虑感也拉满了。正文没披露Mythos测试的具体条件和样本量,这点先别太激动,但作为一篇制造FOMO的评论,它完成了任务。

5月9日星期六

AI HOT 精选

用 Codex 并行调试验证修复

作者查 bug 时会让 Codex 在临时沙盒里重建出问题现场,先确认 bug 能复现,再修,修完再验证一遍。本地环境不会被搞乱,因为所有操作都在隔离的临时环境里跑;速度也不掉,因为他同时开 10 个会话并行处理。正文没披露具体修复成功率或单次耗时。

推荐理由:这是一篇第一人称的工作流笔记,不是产品发布或基准测试,但 10 个 Codex 会话并行修 bug 的实操信号很强。我会先打个折——正文没披露修复成功率、单会话耗时和资源消耗,所以实用性还缺几块拼图。不过它把“临时沙盒 + 并行验证”这套打法讲清楚了,对想用 AI agent 干活的开发者有直接参考价值,放在 featured 里偏低的位置合理。

Latent Space

Anthropic 一年翻十倍,其他公司却在裁掉超过一成的人

Anthropic 现在被二级市场估到 1 万亿到 1.2 万亿美元,已经超过 OpenAI,排进全球前 15 大公司。这个估值背后有实打实的收入支撑:他们刚经历了一个“奇迹般”的第一季度,年化收入增速达到 80 倍,一个月内年化收入又跳涨了 150 亿美元。另一边,Block 裁了 40% 的人,Coinbase 裁了 14%,Cloudflare ...

推荐理由:这条不是官方融资或产品发布,属于行业评论,但信息密度高。Anthropic的10倍年增长和1万亿以上估值数字很扎眼,旁边又列了一串裁员百分比,对比强烈。我会先打个折:估值和增长数据正文没交代来源,是转述的说法,不能当实锤用。但即便保守看,它也点出了AI行业资金和人才在向头部集中的趋势,对从业者判断方向有参考价值。

AI HOT 精选

让 Claude 直接输出 HTML,效果比 Markdown 好得多

Anthropic 的 Thariq Shihipar 提出一个反直觉的建议:让 Claude 输出 HTML 而不是 Markdown。Simon Willison 过去一直默认用 Markdown,因为 GPT-4 时代 8192 token 的上下文限制让 Markdown 更省 token。但 Thariq 的文章让他重新考虑这件事——HTML...

推荐理由:HKR 三项都踩中了,但本质是个工作流技巧,不是 Claude 本身的功能更新。作为一篇质量在线的 Claude Code 教程,放在 72–77 分段合理,加上 Simon Willison 的转发背书,进 featured 没问题。

5月8日星期五

AI HOT 精选

机器人终局:一份物理 AGI 路线图,用大语言模型的成功逻辑来推演

演讲者把机器人做成人形通用智能拆成六块:视频世界模型当第二预训练范式,世界行动模型(WAM)负责把感知转成动作,数据收集策略对标特斯拉 FSD 的物理数据飞轮,EgoScale 和灵巧性缩放定律试图量化训练规模与手部操作能力的关系,物理强化学习用来跑通最后一公里,DreamDojo 则是一个端到端的神经物理引擎。整体思路是照搬大语言模型的成功路径,但正...

推荐理由:我会先打个折:这是演讲者个人的路线图,不是论文或产品发布,所以别当官方公告看。但它的好处是把物理 AGI 拆成了 6 个能聊的模块,并且用 LLM 的发展阶段来类比,让做机器人的人能快速对齐讨论框架。正文没给出每个模块的具体验证结果或数据,所以这条路线图更多是观点而非实证。对从业者来说,值得扫一眼,但暂时不用太激动。

阿里技术 · 公众号

阿里许晓斌内部访谈:工程师用 AI 后,写代码时间从 30% 降到 5%,端到端交付效率提升 2-3 倍

许晓斌在内部访谈里给了几个数:工程师重度用 AI 后,写代码占工作时间从 30% 掉到 5%,跟 Agent 对话的时间从 5% 涨到 60%,端到端交付效率提升 2 到 3 倍,纯编码效率提升 10 倍。这些数字来自内部访谈,不是大规模统计,样本量和统计口径正文没披露,所以我会先打个折看。核心变化不是代码写得更快,而是工程师的时间分配被彻底打散重排—...

推荐理由:阿里技术这篇是内部访谈整理的组织方法论,不是产品发布或模型更新,但给出的数字很具体,能让人直观感受到 AI 把工程师的工作重心从写代码拽到了指挥 Agent 上。我会先打个折:效率提升 2 到 3 倍这个说法正文没交代是怎么算出来的,样本量和统计口径都不清楚,这点先别太激动。不过 HKR 三项都踩中了,放在 featured 门槛上刚好。

量子位 · 公众号

美国研究员 36 小时跑遍中国 AI 圈:字节让所有实验室紧张,DeepSeek 被所有人夸

Ai2 研究员 Nathan Lambert 在 36 小时内密集拜访了智谱、月之暗面、清华、美团、小米和零一万物。他观察到中国 AI 实验室普遍紧盯字节跳动的动向,同时对 DeepSeek 的技术实力和开源做法表示尊重。学生深度参与核心工作、开源习惯以及技术栈的自主掌控,是中美 AI 生态的几个明显差异。

推荐理由:这篇不是模型发布或大厂合作,属于一手见闻加行业判断,信息密度高但偏观察性质。我会先打个折,放在featured而不是p1。正文没给出具体数据验证,但研究员身份和走访名单让可信度不低,值得从业者花几分钟读。

FT · 科技

科技巨头砸了7250亿美元搞AI基建,自由现金流跌到十年最低

FT这篇付费文章正文被锁了,只从标题和摘要片段能看出几个关键信息:硅谷大厂们过去在AI基础设施上累计花掉了7250亿美元,这个数字直接把它们的自由现金流压到了近十年的最低点。以前这些公司是轻资产、现金牛的玩法,现在被迫转型成重资产的基建投资者。但文章没披露具体是哪几家公司、统计的时间跨度、以及自由现金流是按什么会计准则算的,这些缺口让数字的横向可比性打...

推荐理由:标题把 7250 亿 AI 基建投入和十年最低自由现金流绑在一起,冲突感很强,成本与回报的账本焦虑一下就出来了。正文没披露具体公司名单、统计周期和会计口径,所以数字的精确边界还不清楚,我会先打个折。但即便口径模糊,这个量级的支出对比已经足够让从业者关注基建烧钱能不能回血,时效性和话题性都在。

阮一峰的网络日志

软件开发的第三种方式:像老太太盖神秘屋一样用 AI 写代码

阮一峰这期周刊把 AI 辅助编程比作“神秘屋”式开发——没有整体规划,想到哪写到哪,代码层层堆叠,充满个性但外人看不懂。这种开发方式可能取代传统的大教堂和集市模式,成为个人和小团队的主流。另外介绍了一个叫 HN SOTA 的大模型人气榜,通过扫描 Hacker News 每天最热的 200 个帖子里对模型的讨论和好评来排名,本周前三名是 Claude ...

推荐理由:阮一峰这期周刊把 AI 编程总结成“第三种方式”,核心是“神秘屋”——你给需求,模型直接出结果,中间过程你看不到。这个说法比“低代码”或“辅助编程”更直白,也更容易让人理解为什么开发者会又爱又怕。HN SOTA 的榜单用每天 200 个 HN 热门话题来量模型人气,不是跑分,而是看社区讨论热度,算是一种接地气的 benchmark。整篇是评论性质,没有新模型或产品发布,所以重要性停在 72。HKR 三项都过:比喻够新、方法够简单、情绪够普遍。

AI HOT 精选

ChatGPT 中文回复老说“我会稳稳地接住你”,WIRED 拆解了原因

ChatGPT 在中文对话里反复蹦出“我会稳稳地接住你”这类怪话,已经成了梗。WIRED 把这归因于模式坍缩——模型在后训练中被奖励机制带偏,逮住几个讨好人的短语使劲用。一个直接原因是翻译错位:英文口语“I've got you”被生硬直译成煽情长句,再被 RLHF 强化成“用户爱听”的固定套路。类似问题还有无故冒出“砍一刀”这种营销话术。这事不是 O...

推荐理由:我会先打个折——正文没给样本量,所以“频现”到底多频繁说不清。但这条信息对做对齐和中文产品的团队有提醒价值:模式坍缩和翻译错位会让模型输出变得油腻,RLHF 讨好奖励又容易把这种表达固化下来。Claude 和 DeepSeek 新版本也出现类似表达,说明这不只是 OpenAI 一家的问题。不过,缺少数据支撑让判断只能停在“值得留意”这个级别。

AI HOT 精选

AI 代理生成的 PR 到处都是,GitHub 发了份审查指南

GitHub 这篇博客直接给了一套审查 AI 代理提交的 Pull Request 的方法。核心就三点:先看代码改了什么,别被大段生成代码吓住;再查逻辑漏洞和安全问题,因为模型容易写出看起来对但实际有坑的代码;最后在合并前把技术债清掉,别让自动提交把代码库搞乱。文章没给出具体的自动化检查工具,更多是人工审查的思路。

推荐理由:GitHub 这篇博客没推新模型或新功能,而是给了一份审查 AI 代理生成的 PR 的实操指南。我会先打个折:它更像经验总结,不是严格验证过的规范。但 3 个审查关注点——代码变更、逻辑/安全漏洞、合并前技术债——确实把“怎么审”拆成了能落地的步骤。对天天被 AI 提 PR 的工程师来说,这篇直接回应了“审不审得动”的问题,所以放在 featured 档位是合适的。

5月7日星期四

AI HOT 精选

中国 AI 实验室内部笔记:学生军团、快跟文化和被压缩的算力

作者走访了国内几家头部 AI 实验室,发现一个明显特点:核心贡献者里学生占比很高,他们没包袱、上手快,愿意做那些不炫但能让模型变好的脏活累活。这种文化让中国团队在追赶大模型、做智能体工作流时效率很高,但也被一些技术负责人认为会抑制从 0 到 1 的原创研究。文章提到,国内实验室在百亿级基础模型和十亿级垂直模型上都有布局,部分中文任务表现已超过 GPT-...

推荐理由:H/K/R 全过:一手实验室访问、具体的能力对比和模型规模信息、算力与部署的行业共鸣都很扎实。这不是模型发布或融资事件,属于强分析类内容,放在 78–84 分段合理。正文说“只看图片就能学压缩”和“压缩 90% 精度不掉”,这两个点如果后续有更细的消融实验或复现报告,价值还会更高。

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

5月6日星期三

新智元 · 公众号

12岁写代码,28岁撑起谷歌20亿业务,他却劝年轻人别卷编程了

Alon Chen 12岁开始写代码,28岁在谷歌管着年收20亿美元的业务。但他现在劝年轻人别再把编程当唯一护城河。他给了两个数字:微软新代码里30%是AI写的,谷歌这个比例也超过25%。他的判断是,以后更稀缺的能力是执行、把问题定义清楚、以及沟通协作,纯写代码的壁垒在变薄。不过正文没披露他具体是在什么场合说的这番话,也没给出这些AI生成代码比例对应的...

推荐理由:这篇不是产品发布或模型评测,更像一篇职业判断类的评论。我会先打个折:它没有披露新模型或新方法,但两个 AI 生成代码占比的数字让它比普通鸡汤更有信息量。正文没给出这些数字的统计口径和验证方式,所以别当精确指标用,但它确实说明大厂内部写代码这件事的构成在变。对从业者来说,这比单纯喊“AI 要取代程序员”更有参考价值,因为它指向的是技能重心的转移,而不是岗位消失。

Computing Life · Share · 鸭哥调研

AI 时代,复核不等于独立判断

别人拿 AI 输出来压你,你一眼就能看出他没动脑子。但轮到自己用 AI 写分析、回邮件时,那条线就模糊了:你读一遍觉得通顺,就发出去了,这到底算独立判断,还是只做了个熟悉度检测?沃顿的 Shaw 和 Nave 用实验把这事量化了。一千三百多人做认知反射测试,AI 给错误答案时,仍有八成的人照单全收。更要命的是,用了 AI 的人对自己答案的信心反而高出 ...

推荐理由:我会先打个折:正文只给了 Shaw 和 Nave 两个实验线索,没放任何数字,所以知识深度有限。但它的钩子很准——复核不等于独立判断,检查容易滑成“看着眼熟就放行”,高验证复杂度的任务得先自己建个参考点再交叉比对。这点先别太激动,因为实验证据没亮出来,不过对天天跟 AI 输出打交道的从业者来说,这个提醒够直接、够有用。

r/LocalLLaMA

DeepSeek V4 便宜 17 倍,我实测了 10 天写代码哪些活能丢给本地模型

Reddit 用户 spencer_kw 把自己 10 天的编程工作流拆成 150 个任务,拿本地 Qwen 3.6 27B 和云端模型重新跑了一遍。结果 65% 的任务本地模型干得一样好,20% 勉强能用,只有 15% 必须上云端。他的 API 账单从每月 85 美元掉到 22 美元左右。这个测试说明省钱的关键不是盯着模型单价,而是按任务类型做分流—...

推荐理由:这篇不是模型发布,而是一个开发者拿自己的编码工作流做的成本实测,有日志、有复测、有分桶比例,信息量够。单一个 Reddit 帖子的样本量有限,普适性要打个折,所以放在 featured 而不是 P1。我会先看他的任务分类和路由逻辑,这点比“便宜 17 倍”本身更有参考价值。

Latent Space

GPT-5 用 11 分钟复现了物理学家的硬核论文,OpenAI 开始正经搞科研了

理论物理学家 Alex Lupsasca 聊了他怎么用 GPT-5 做研究。他先让模型做了道课本里的热身题,然后 GPT-5 只花了 11 分钟就复现了他一篇获奖级别的论文,这篇论文的发表日期在模型训练数据截止之后。后来,他加入 OpenAI 的科学团队,用 GPT-5.2 去算一个以前被认为不可能手算的胶子振幅公式,模型真给出了非零结果,团队花了三周...

推荐理由:Alex Lupsasca 在访谈里说,他们拿教材给 GPT-5 预热后,模型 11 分钟就复现了他论文里的结果;ChatGPT 又在一天内产出 110 页引力子计算,团队花了三周才验证完。我会先打个折:这是单人访谈,没有第三方复现,而且理论物理这个领域太窄,换到其他任务能不能跑通还不清楚。正文没披露验证过程中改了多少轮 prompt,也没说那 110 页里有多少是废话。所以先给 84 分,放在 featured 里,等有更硬的基准测试出来再调。

5月5日星期二

MIT Technology Review · AI

一份用 AI 加固民主的蓝图

Andrew Sorota 和 Josh Hendler 提出了一套三层架构,把 AI 塞进知识获取、个人代理和制度运行里,想让它帮民主续命。他们引用了 X 平台上的实地测试:AI 写的事实核查被不同政治立场的人认为比人类写的更有用,不过这篇论文还没经过同行评审,这点先别太激动。文章说,现在大家越来越靠 AI 来了解真相、形成观点,未来的个人 AI 代...

推荐理由:这篇文章没推新产品或新模型,而是搭了一个三层民主基础设施的框架:认知层帮人辨别信息,代理层让 AI 参与协商,制度层把 AI 嵌进治理流程。我会先打个折,因为正文没披露 X 平台事实核查的准确率、误判率这些硬指标,也没说地方协商平台到底覆盖多少用户、效果如何。但框架本身有干货,两个落地案例让讨论没飘在天上,对做 AI 治理和安全的人算一份有用的参考。

机器之心 · 公众号

马斯克 55 万张英伟达 GPU 的集群,实际有效利用率只有 11%

The Information 的报道说,xAI 手里大概 55 万张英伟达 GPU,但模型浮点运算利用率(MFU)只有 11%,折算下来相当于真正在干活的卡就 6 万张左右。文章把锅甩给了 HBM 显存读写、服务器之间通信、训练时空等和软件栈不统一这几个问题。作为对比,Meta 的利用率是 43%,Google 是 46%。不过原文因为微信环境验证失...

推荐理由:这篇不是模型发布或产品更新,是实打实的基础设施效率爆料。55万卡对11%利用率这个对比本身就够抓人,再加上Meta和Google的43%、46%做参照,信息密度高。我会先打个折:正文没披露xAI具体怎么算的MFU,也没说这个11%是瞬时值还是长期均值,但瓶颈拆解(HBM、跨节点通信、软件栈)让文章站得住脚,所以给到82分。

机器之心 · 公众号

Anthropic 联创预测:2028 年底前 AI 自己搞研发的概率超六成

Anthropic 联合创始人 Jack Clark 给了个时间点:到 2028 年底,AI 脱离人类独立做研发的概率超过 60%。他拿几个基准测试当证据——Claude Mythos Preview 在软件工程测试 SWE-Bench 上跑到 93.9%,Opus 4.5 在评估 AI 复现研究能力的 CORE-Bench 上拿到 95.5%。Cla...

推荐理由:我会先打个折:标题里的“自我进化”和“没有人类了”是媒体写法,Clark 原文说的是无人类参与的 AI 研发概率,不是奇点降临。但他作为联创,拿内部模型跑出来的基准分来押 2028 这个时间点,分量不一样。SWE-Bench 93.9% 说明代码修 bug 这类短任务已经很高,CORE-Bench 95.5% 测的是复现论文的工程能力,真正该盯的是 MLE-Bench 和 PostTrainBench——这两个才碰得到长周期、需要自己调参和做后训练的任务,目前正文没给具体分数,这点先别太激动。整体看,他是在用基准曲线推 timeline,不是纯拍脑...

5月4日星期一

Import AI

AI 研究即将全自动:Jack Clark 预测 2028 年底前,AI 自己造自己的概率超过六成

Jack Clark 根据公开数据做了一个判断:到 2028 年底,不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench,这个测试看 AI 能不能解决 GitHub 上的真实代码问题,Claude 2 当初得分大概 2%,现在 Claude Mythos Preview 已经干到 93.9%,基本把...

推荐理由:HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注,属于知名人物对 AI 时间线的判断,放在 85–94 分档合适,比模型发布的分量低一点。

新智元 · 公众号

迪士尼员工9天狂调Claude 46万次,Meta一个月烧掉60万亿token

新智元这篇推文本身被微信环境拦截,正文没披露原始数据表,只能从标题和摘要反推。标题说迪士尼内部有个AI使用看板,一名员工在9个工作日内向Claude发起了约46万次调用,平均每天超5万次,频率高到像在跑自动化任务。另一组数字是Meta 30天消耗60万亿token,按公开API价格算大概值90亿美元,但实际内部成本肯定低得多。我会先打个折:token消...

推荐理由:HKR三项都成立:钩子靠两个夸张的用量数字立住,知识部分有仪表盘截图和token折算,痛点踩在企业最关心的Claude成本控制上。分数维持74,因为数据都是二手转述,正文没给原始数据表,我会先打个折。

r/LocalLLaMA

一台 5 年老笔记本跑通 35B 模型:6GB 显存 + CPU 混合推理,插电 23 token/秒

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存,搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒,不插电掉到 10 token/秒出头。能跑起来的...

推荐理由:我会先打个折:这只是单个Reddit用户的跑分,不是官方发布,别当基准看。但它的价值不在权威性,而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来,在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节,这点先别太激动。对想用老设备玩大模型的从业者来说,这篇给了参数和思路,比单纯喊'能跑'有用得多。

5月2日星期六

TechCrunch · AI

Replit 创始人聊 Cursor 收购传闻、跟苹果较劲,以及他为什么不想卖公司

Replit 的 CEO Amjad Masad 在 StrictlyVC 活动上回应了几个尖锐问题。首先是竞争对手 Cursor 被传要以 600 亿美元卖给 SpaceX,他怎么看。Masad 没直接评价这个价格,但明确表示自己不想卖 Replit,更想独立发展。文章还提到 Replit 的收入从 2024 年全年的 280 万美元,猛增到现在年化...

推荐理由:TechCrunch 这篇截出来的部分,核心钩子是 Cursor 的 600 亿美元收购传闻和 Masad 的不卖表态,反差够强。信息增量上,Replit 从 280 万到十亿年化目标的跨度、Cursor 的天价传闻,都是圈内会盯着看的数字。不过正文没展开 Masad 对 Apple 争议和出售意向的完整说法,所以重要性我打个折,放在 72–77 这个区间。

5月1日星期五

新智元 · 公众号

拆解 Claude Code:让它好用的 98.4% 是工程,不是 AI

VILA-Lab 把 Claude Code v2.1.88 的 51.2 万行代码扒了一遍,发现真正跟 AI 决策逻辑相关的部分只占 1.6%。剩下 98.4% 全是确定性的工程基础设施:权限控制、上下文管理、工具路由和错误恢复。核心变化不是把提示词写得更长,而是给模型套上了一套好用的“缰绳”。

推荐理由:这篇不是 Anthropic 官方出品,是 VILA-Lab 的逆向分析,所以权威性我会先打个折。但它给的 51.2 万行源码和 1.6%/98.4% 的拆分很具体,对正在搭 agent 的团队来说,比很多公关稿有用——它把“模型强所以产品强”的叙事拉回到工程现实。正文没披露完整复现步骤,这点先别太激动,但判断方向是准的。

量子位 · 公众号

他用 AI 办了场音乐节,主题是“别读博”

B站UP主“混沌皮切总”用 AI 生成了 42 首“劝退读博”的歌,全网播放量超过 5000 万。一首歌要跑上百次生成,同时用 Suno、MiniMax 音乐、心模拉和 ACE-Step 几个工具来回试。正文没披露具体技术细节,但能看出现在 AI 做歌最花时间的不是生成,而是人得一首首听、一首首挑,这个筛选成本很高。

推荐理由:HKR 三项都站得住:梗本身够怪、传播数据和工作流细节都给了、最后落点卡在“AI 放大产出但人工筛选成本没降”这个创作者的真实焦虑上。这不是模型或平台发布,是实打实的案例拆解,分数放在 78-84 区间合理。