跳到正文

全部动态

今日 25 条

5月4日星期一

r/LocalLLaMA

Intel 和 AMD 联手推 x64 新指令集 ACE,一次能算 1024 次乘法,但没硬件、没功耗、没发货时间

这篇帖子想讨论新的 x64 指令扩展能不能缓解 AI 硬件短缺,但 Reddit 原文被屏蔽了,看不到具体讨论。根据现有摘要,Intel 和 AMD 公布的 ACE 扩展用 2D 瓦片寄存器和外积算法,每时钟周期能做 1024 次乘法,对比现在 AVX 的 64 次,纸面吞吐量直接翻了 16 倍。不过先别太激动——目前没有任何 ACE 硬件上市,功耗、...

推荐理由:HKR 三项都站得住:切入点把 CPU 指令集改动和 AI 硬件荒挂上了钩,有反差;技术细节给了吞吐量倍数和实现机制,不是空谈。分数没给更高,是因为正文自己说了——支持 ACE 的硬件还没发布,功耗、框架适配、量产时间全是空白,现在只能当个技术预告看,别太激动。

5月3日星期日

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

量子位 · 公众号

清华 AIR 开源具身智能仿真框架 GS-Playground,一块 4090 能同时跑 2048 个场景

清华 AIR DISCOVER 实验室和合作方开源了 GS-Playground,已被 RSS 2026 接收。这个框架把批量 3D 高斯泼溅渲染和并行物理引擎绑在一起,专门解决机器人训练时视觉仿真的算力瓶颈。在 RTX 4090 上,640×480 分辨率能跑到每秒一万帧,同时并行跑 2048 个场景;50 个人形机器人的基准测试里也能维持每秒 10...

推荐理由:这篇是清华 AIR DISCOVER Lab 开源的具身智能仿真框架 GS-Playground,论文被 RSS 2026 录用。我会先打个折:它解决的是仿真渲染的吞吐问题,不是直接训出一个更强的机器人模型,所以重要性到不了模型发布那档。但它的数字确实硬——单卡 RTX 4090 在 640×480 下渲染能冲到 10000 FPS,最多并行跑 2048 个场景,50 个人形机器人基准也能稳住 1015 FPS。真正值得盯的是他们把 3D 高斯泼溅的批渲染跟物理仿真并行耦合起来了,这比单纯吹 FPS 更有工程价值。正文没披露大规模训练后的策略迁移效...

r/LocalLLaMA

Reddit 网友用纯 C++17 手搓了一个 83 万参数的 Transformer,不用 PyTorch 也不用 BLAS,单核 CPU 训练 76 分钟

一个叫 Suspicious_Gap1121 的 Reddit 用户放出了 Quadtrix.cpp,一个用 C++17 从零写的 GPT 风格模型,总共 83 万参数。模型结构是 4 层、4 个注意力头、宽度 200 维,一次能看 128 个字符的上下文。他在单核 CPU 上拿 3140 万个字符训练了 76.2 分钟,验证损失降到 1.6371 n...

推荐理由:我会先打个折:这就是个个人练手项目,0.83M 参数离实用还远,别拿它跟正经模型比性能。但它的看点不在规模,而在把整个训练管线——LayerNorm、attention、Q/K/V、dropout、AdamW——全部手写反传,不用自动微分,不用 BLAS 加速,单核 CPU 跑通。正文没披露生成效果,也没给权重文件,所以只能当教学级实现来看。对 AI 从业者来说,这东西像一份可运行的底层教案,把平时被框架藏起来的细节全摊开了。

5月2日星期六

r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

Hacker News 首页

SimplePDF 推出 AI 填表助手,PDF 解析和填写全在浏览器里完成

SimplePDF 发布了一个叫 Copilot 的演示,能让你用聊天的方式填写 PDF 表单。它把 PDF 的解析、渲染和字段识别都放在浏览器本地跑,文件不会上传到服务器。默认接的是 DeepSeek V4 Flash 的代理,也支持你自己带 API 密钥、用云端模型或者接 LM Studio 本地模型。正文说 SimplePDF 现在月活用户超过 ...

推荐理由:HKR 三项都成立:审判式冲突来自“AI 填表但不上传文件”的设定;事实层面给出了 20 万月活、本地解析和蒸馏机制,不是空泛宣传;治理和竞争伦理的神经被触动,因为客户端工具调用绕开了传统 SaaS 的隐私风险。不过目前只是产品演示,没有裁决或平台级发布,所以重要性停在 74 分、featured 档位是合理的。

r/LocalLLaMA

有人在 Windows 上直接用 vLLM 跑 Qwen3.6-27B,单张 RTX 3090 跑到 72 tok/s

Reddit 用户 One_Slip1455 发了个原生 Windows 版 vLLM 启动器,不用 WSL 也不用 Docker。在一张 RTX 3090 上跑 Qwen3.6-27B(INT4 量化),短上下文能到 72 tok/s;上下文拉到约 2.5 万 token 时速度 64.5 tok/s,12.7 万 token 时还有 53.4 to...

推荐理由:HKR 三项都成立:原生 Windows 跑 27B 模型是钩子,帖子里有可验证的速度和上下文数字,而且直击本地推理省钱这个痛点。不过来源只有 Reddit 单帖,没有官方背书或产品级变动,所以放在 featured 低位是合理的。

Hacker News 首页

Spotify 给真人音乐人加“已验证”绿标,用来和 AI 账号区分开

Spotify 开始给符合“真实性标准”的艺人打上绿色对勾和“Verified by Spotify”标识,帮用户分辨账号背后是真人还是 AI。验证条件包括关联社交账号、稳定的听众数据、有周边或演出信息等,官方说听众常搜的艺人里超过 99% 都会拿到这个标,覆盖几十万人。但正文没披露具体审核流程、申诉机制,也没说怎么处理那些不用巡演和周边的小众独立音乐...

推荐理由:Spotify 开始给人类艺人贴 Verified 徽章,标题说就是为了跟 AI 音乐划清界限。我会先打个折——正文只有 RSS 片段,怎么验证、覆盖多少人、什么时候上线、审核标准是什么,全都没说。这点先别太激动,信息缺口太大。但话题本身够敏感,涉及版权、艺人身份和 AI 标注,容易引发行业争论,所以给了 featured 和 72 分。

5月1日星期五

r/LocalLLaMA

PFlash:在 RTX 3090 上跑 128K 上下文,预填充比 llama.cpp 快 10 倍

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时,首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”,挑出最重要的 5% 文本片段喂给大模型,省掉了大量无关计算。整个方案用 ...

推荐理由:HKR 三项都踩中了,但这是单条 Reddit 帖子,质量验证只给了单针 NIAH 32K–128K 全通过,RULER 和多针结果没放出来,所以先放在 featured 门槛上。

The Verge · AI

微软在 Word 里塞了个法律 AI 助手,想让律师放心把合同交给它审

微软发布了一个叫 Legal Agent 的 Word 插件,专门帮法律团队审合同。它会按你预设的规则手册(playbook)逐条检查条款,还能直接处理文档里的修订痕迹。这个功能来自微软收购的 Robin AI 团队。不过正文没披露具体定价和推送范围,所以实际用起来贵不贵、什么时候能用上还不清楚。

推荐理由:微软把 AI 塞进 Word 给律师用,不是写泛泛摘要,而是按法律实务流程干活——对照内部 playbook 审条款、处理修订记录。这点比通用 copilot 更具体,但正文没披露价格、上线范围和客户验证,所以先打个折,放在 featured 低段。

r/LocalLLaMA

Reddit 网友用 16 台 DGX Spark 攒了个集群,跑通 434GB 大模型

Reddit 用户 Kurcide 晒出了他搭的 16 节点 DGX Spark 集群。每台机器用一根 QSFP56 线连到 FS N8510 交换机,单链路跑到 100–111 Gbps,总带宽约 200 Gbps,所有节点都跑满了线速。这次测试的重点是统一内存:8 个节点合起来成功加载了 434GB 的 GLM-5.1-NVFP4 模型,接下来他还...

推荐理由:H、K、R 三项都成立:帖子是第一手集群实测数据,网络条件和模型运行情况都交代清楚了,434GB 模型跑在 8 节点上是个实打实的验证。范围限定在本地推理硬件,所以重要性落在 72–77 这个区间,没到产品发布级别。

新智元 · 公众号

一个开发者用10天婚假做了个AI世界生成器,一句话就能生成会自己运转的小镇

这个叫WorldX的项目,你输入一句话,它大概5分钟就能生成一个完整的AI世界。背后是一套6步地图生成流程,每个世界消耗约3万到18万个token。里面的NPC有自己的两层记忆和双轴情绪,会按Tick循环自主行动。比较有意思的是它用叠加标签加色差定位来做确定性坐标,让角色能真正走到具体位置而不是大概描述。不过正文没披露实际运行时的延迟和稳定性数据,这点...

推荐理由:我会先打个折,这是个独立项目不是大厂发布,所以分数压在75附近。但它的技术披露很实在,地图管线分6步、token消耗范围明确、坐标转换方案有工程参考价值,不是那种只放视频不说原理的展示。对正在折腾 Agent 记忆和世界生成的人,这篇文章能省不少试错时间,所以给 featured 没问题。

新智元 · 公众号

OpenAI 把 Codex 升级成能直接操控 Mac 的助手,跨应用干活不用人插手

OpenAI 给 Codex 接入了 Slack、Google Workspace 和 Microsoft 365,重点不是帮你补代码,而是让它直接接管电脑操作。测试里 Mike Russell 让 Codex 在 Mac 上跨 Adobe Audition、Photoshop 和 Firefly 完成一套音频剪辑到出图的工作流,全程人只围观,大概 8...

推荐理由:HKR 三条全中。OpenAI Codex 这次不是补代码,是直接上手操作 Mac,集成 Slack、Google Workspace 和 Microsoft 365,等于把 agent 塞进日常办公软件里。Mike Russell 的实测给了具体数字:8 分钟跑完音频修复、Photoshop 封面和 Firefly 视频生成,效果 85—90 分,虽然只有单信源,但 OS-agent 这个方向本身就够重,P1 没毛病。

Latent Space

AI 周报:Codex 开始抢知识工作者的活儿,Claude 盯上了创意工具

OpenAI 把 Codex 从写代码扩展到了文档、幻灯片、表格这类非编程工作,新版本里电脑操作速度提升了 42%,还接入了微软、谷歌、Salesforce 的办公套件。Anthropic 这边,Claude 新增了对 Blender、Adobe 全家桶、Ableton 等创意软件的支持,同时推出了一个代码安全审查工具。另外,英国 AI 安全研究所的报...

推荐理由:OpenAI 把 Codex 从写代码推到了非编码的 GUI 操作上,说 CUA 比之前快 42%,还接进了微软、谷歌和 Salesforce 的办公套件。我会先打个折:正文没披露价格、具体上线范围和可复现细节,所以别急着当省钱结论。真正值得盯的是 GUI agent 产品化这一步,而不是单次模型跑分。

FT · 科技

华为 AI 芯片在中国大卖,英伟达却卡住了

这篇是付费墙后面的文章,正文没披露具体订单金额、芯片型号和交付时间。从标题看,核心信息是华为接到了国内科技公司的大笔 AI 处理器订单,而英伟达因为出口管制在中国市场动弹不得。这背后反映的是中国算力供应链正在被迫转向国产替代,但文章本身没给出更多细节来支撑这个判断,先别太激动。

推荐理由:FT 的信源和华为 vs Nvidia 的中国市场角力,让 H 和 R 都站得住。但 K 这边确实虚:金额、型号、交付节点一概没给,所以分数只能压在 78–84 这个区间,别因为标题冲高。

Hacker News 首页

Pu.sh:一个 400 行 shell 脚本搭起来的编程助手框架

Pu.sh 用大约 400 行 shell 脚本(只靠 sh、curl 和 awk)搭了一个编程助手的运行框架。它支持 Anthropic 和 OpenAI 的接口,内置 7 种工具,有对话上下文自动压缩、断点续跑和管道模式,还配了 90 个不调 API 的测试用例。没有图形界面、流式输出、图片处理、OAuth 登录,也不支持 Windows。

推荐理由:我会先打个折:这就是个 Show HN 的开源小工具,不是模型或平台发布,别当大新闻看。但它上了 HN 首页,而且 400 行能复现的代码本身就说明问题——把 coding-agent 的核心链路(调模型、给工具、压缩上下文、断点续跑)剥到只剩 shell,依赖极简,对想理解 agent 怎么跑、又不想装一堆依赖的人很友好。正文没披露实际任务成功率,所以别急着说它比别的框架强,但作为教学和轻量集成的起点,这个 featured 给得值。

NVIDIA 博客

NVIDIA 说 OpenClaw 开源智能体项目 60 天拿了 25 万星,但治理成本才是真问题

NVIDIA 这篇博客主要讲了两件事:一是 Peter Steinberger 做的自托管持久化智能体 OpenClaw 在 GitHub 上火了,到 2026 年 3 月已经攒了 25 万颗星,增速超过了 React。二是 NVIDIA 自己推出了 NemoClaw,用 OpenShell 沙箱和 Nemotron 模型来跑智能体。文章真正想聊的是治...

推荐理由:我会先打个折:这是 NVIDIA 官方博客,立场肯定偏向自家 Nemotron 和 NemoClaw,但文章没回避常驻 Agent 最要命的问题——token 成本暴涨和安全边界。OpenClaw 本身是 Peter Steinberger 做的自托管常驻 Agent,NVIDIA 用 OpenShell 沙箱和 Nemotron 模型给它加了网络、数据访问的默认限制,这个加固思路比单纯吹性能更有信息量。文中给出的推理后 token 增 100 倍、自治 Agent 再增 1000 倍的估算,虽然没披露测算口径,但把成本焦虑直接量化了,对做落地的人...

TechCrunch · AI

OpenAI 一边吐槽 Anthropic 搞限量,一边也给自家安全工具 Cyber 上了门禁

OpenAI 要把 GPT-5.5 Cyber 先推给“关键网络防御人员”,普通用户暂时用不上。这个工具能做渗透测试、漏洞发现和利用、恶意软件逆向,相当于帮公司找安全漏洞的武器库。Sam Altman 之前还嘲笑 Anthropic 对 Mythos 搞限量是“恐惧营销”,现在自己用了同一招。正文没披露具体的申请门槛、定价和全面开放时间,想用的人得先填...

推荐理由:我会先打个折:正文只有 RSS 摘要,能确认的就是 GPT-5.5 Cyber 会搞分级访问,先给安全圈子里的人用。至于谁算“关键网络防御者”、要不要付费、什么时候轮到普通用户,这些全没披露。真正值得盯的不是 Cyber 本身有多强,而是 OpenAI 在安全工具上也开始玩分批放量,这跟它之前批评 Anthropic 的姿势放在一起看,就有点意思了。如果是真的为了安全可控,那可以理解;但如果只是换个说法控节奏,那这波操作就挺双标。

TechCrunch · AI

谷歌把 Gemini 助手装进了几百万辆车里

谷歌宣布 Gemini 会逐步替换掉车机里原来的 Google Assistant,首批覆盖的是内置谷歌服务的车型。官方说法是能让车载语音对话更自然、更聪明,但正文没披露具体用了哪个版本的 Gemini 模型、哪些功能会先上、什么时候推完,也没提要不要额外收费。这点先别太激动——目前看更像是一次品牌升级和底层模型切换,实际体验能好多少还得等实车评测。

推荐理由:标题说 Gemini 要上车,规模是“数百万辆”,听着挺唬人。但正文基本就是一句话新闻,没给车型、没给时间、没给功能细节,也没说要不要额外收费。我会先打个折:这事方向对,但落地信息太少,现在激动还太早。对从业者来说,知道 Google 在铺车载渠道就够了,具体怎么打、打不打得赢,还得等后续。

TechCrunch · AI

Stripe 推出 Link 数字钱包,AI 代理也能用它花钱

Stripe 在年度大会上发布了 Link,一个能绑卡、银行账户、订阅和加密钱包的数字钱包。它不只是给人用,还允许你授权 AI 代理(比如帮你订票、买东西的自动化程序)通过审批流程花你的钱。Link 有网页版和 iOS、Android 客户端,可以集中看支出和订阅。但正文没披露代理支付的手续费、额度上限、支持哪些商户,也没说授权边界具体怎么划——这点先...

推荐理由:我会先打个折:正文没披露费率、额度上限和商户覆盖范围,所以实际能用多广还不好说。但让 AI 代理进支付环节这件事,比很多 demo 都实在——它给出了一个具体的控制机制(审批),而不是让模型自己随便刷。这点先别太激动,但方向对,值得盯后续的授权粒度怎么细化。

The Verge · AI

Meta 用“快速致富”风格的广告推销自家 AI 工具

Meta 收购的 Manus 在 Instagram 和 Facebook 上投了一批广告,话术很像“别去打工了,用 AI 躺着赚钱”。广告瞄准的是本地小商家,尤其是那些没有网站或者网站做得很烂的店主,让他们用 Meta 的 AI 工具生成网站。Manus 还花钱请创作者在 Instagram、YouTube 和 TikTok 上发推广内容,其中一些 ...

推荐理由:The Verge 挖出 Meta 花 20 亿美元买的 Manus,在投广告教人用 AI 快速赚钱。套路是找没网站或网站很烂的本地商家,AI 自动建站再电话推销。Manus 还付钱让创作者运营社媒账号,部分 TikTok 账号被问后就下架了。这不是产品发布,是调查报道,但把平台自己搞 AI 垃圾生意的链条扒得很清楚,对行业名声打击不小。

4月30日星期四

MIT Technology Review · AI

Goodfire 发布 Silico,一个能让你像调试代码一样调试大模型内部参数的工具

Goodfire 推出了一款叫 Silico 的工具,让工程师可以在训练过程中直接查看和调整模型的参数,也就是决定模型行为的那些“旋钮”。它能把模型里的神经元和通路画成地图,比如他们在 Qwen 3 里发现一个神经元,激活后模型回答会变成电车难题式的道德困境。Silico 用智能体自动完成了大量原本需要人工做的可解释性工作,目标是让模型开发少点炼丹味,...

推荐理由:HKR 三项都成立:Silico 给出了一个可操作的机械可解释性调试手段。分数停在 76,因为目前只是一家创业公司的产品预览,正文没披露定价,也没有任何实际部署规模或客户数量的数据,所以我会先打个折,不往更高里推。

Ben's Bites

搭东西变简单了:Cloudflare 让 AI 能自己买域名部署,Stripe 给 AI 发了钱包

Ben 这期聊的是工具链在变,他最近迷上了 Codex 应用,用自然语言指挥 AI 写了个恐龙跳跳游戏、搭了套 Gmail 自动分类系统。重点在后面的产品更新:Cloudflare 现在允许 AI 代理自己创建账户、买域名、拿 API 令牌并部署,人只需要最后点个头,中间那些繁琐的后台配置被包装成了 AI 能读懂的接口。Stripe 在 Session...

推荐理由:这是一篇产品线索汇总,不是单一重磅发布,但 Cloudflare 和 Stripe 把代理权限落到了开户、支付、部署这些硬环节上,我会先打个折放在 featured 低段。正文没披露具体延迟或成本数字,如果是真的,代理跑通账号和支付流程确实省钱省事,但权限敞口也大,这点先别太激动。

彭博科技

三星芯片部门利润暴增 48 倍,全靠 AI 数据中心抢内存

三星电子芯片部门在 2026 年第一季度利润同比翻了 48 倍,创下历史新高并超出市场预期。这波增长直接来自 AI 数据中心对内存的疯狂采购,导致供应紧张。不过正文没披露具体的利润金额、是哪种内存(比如 HBM 还是普通 DRAM)以及主要客户是谁。

推荐理由:三星半导体部门一个季度利润翻了48倍,这个涨幅放在任何行业都算炸裂。我会先打个折:正文没写具体赚了多少钱,也没说是哪类内存(HBM还是普通DRAM)在拉动,客户是谁也一概没提。所以这条消息的价值在于信号——AI数据中心在疯狂下单,内存供给可能进一步收紧。如果是真的,对做推理优化和硬件采购的团队来说,成本压力会更大。Bloomberg的报道本身可信度不低,但信息缺口明显,我维持74分,不往上调。

TechCrunch · AI

微软说 Copilot 付费用户超过 2000 万,但没讲清楚大家到底怎么用

微软 CEO 纳德拉在财报会上说,嵌在 Word、Excel 和 Outlook 里的 M365 Copilot 现在有 2000 万个企业付费席位。这个数字说明愿意掏钱的公司确实在变多,但文章没披露活跃度、留存率、每个用户平均贡献多少收入,也没说这 2000 万是怎么统计的——是买过就算,还是真正在用。所以“他们真的在用”这个说法,目前只能先打个折看。

推荐理由:HKR-K 的强度在于微软罕见地公布了付费用户数,这是市场最缺的采纳证据。但正文只说了用户数和参与度在涨,活跃率、留存、ARPU 和统计方法一概没提,所以分数卡在 featured 门槛附近,没往上拉。

彭博科技

Meta 上调 2026 年资本支出到 1250 亿至 1450 亿美元,股价应声大跌

Meta 把今年的资本开支预期从之前的数字拉高到了 1250 亿到 1450 亿美元,CFO Susan Li 解释是因为零部件涨价和数据中心要多花钱。消息一出股价直接跳水。市场担心的不是这一天的涨跌,而是砸这么多钱搞 AI 模型,什么时候才能看到回报——这个问题正文没给出时间表。

推荐理由:Meta 把全年资本开支预期拉到 1250 亿到 1450 亿美元,CFO 解释是组件贵了、数据中心要多花钱,股价应声下跌。这不是模型或产品发布,而是 AI 投入的经济账信号,所以分数没给到 78 以上。

The Verge · AI

Google 搜索量上季度创历史新高,但没公布具体数字

Alphabet 一季度财报电话会上,CEO Sundar Pichai 说 Google 搜索的查询量达到了“历史最高”,搜索广告收入涨了 19%。他把增长归因于 AI 功能(比如 AI Overviews 那种直接在搜索结果顶部给答案的体验)和 Gemini App 的拉动。另外,YouTube 订阅和 Google One 这类付费服务总订阅数超...

推荐理由:HKR 三项全中:Alphabet 报出搜索查询量历史新高、搜索收入涨 19%、付费订阅破 3.5 亿。但正文没给查询量基数,也没拆 AI Overviews 带来的增量,所以信息有缺口。整体够得上 72–77 分的 featured 档位。

r/LocalLLaMA

用 Kokoro 82M 和 Qwen 在本地把 PDF 转成有声书

Reddit 用户 purellmagents 搭了一套完全跑在本地的 PDF 转有声书流程,用 Kokoro 82M 做语音合成,Qwen 3.5 0.8B 或 2B 处理文本,llama.cpp 做推理,整个应用用 Tauri 2.0 打包,在 M1 Mac 上运行。工作方式是先读前 15 句,边读边准备下 15 句,减少等待。作者说真正的难点不在...

推荐理由:HKR 三项都踩中了,但本质是 Reddit 上的个人工作流展示,不是模型或平台发布。具体组件和 15 句预处理窗口让它能进低分 featured 档。我会先打个折:正文没披露代码和表格朗读的具体处理逻辑,这点先别太激动。

彭博科技

Meta 的路易斯安那 AI 数据中心让电力公司 Entergy 追加 140 亿美元,新建 10 座燃气电厂

Entergy 把四年资本开支计划上调了近三分之一,到 570 亿美元,大头是给 Meta 在路易斯安那的数据中心供电。新增的 140 亿美元主要用来建燃气电厂,一共要上 10 座。报道没提这些电厂的总装机容量和投产时间,所以暂时没法判断对当地电价和碳排放的具体影响。Meta 急着要稳定电力,直接跳过电网自己拉专线,这种操作在 AI 大厂里越来越常见,...

推荐理由:这条消息本身够硬——Meta 一个数据中心的用电需求,就让 Entergy 把四年投资计划直接拉高近三分之一,多掏 140 亿美元建天然气电厂。我会先打个折:正文没披露电站具体容量和投运时间,所以没法判断这钱花得划不划算、什么时候能缓解供电压力。但光是这个数字就说明,大模型训练和推理背后的电力账单正在变成基础设施投资的主驱动,不是未来时,是现在进行时。这点先别太激动,但值得放进雷达里让同行看到。

X · @dotey(宝玉)

Hermes Agent 的记忆系统拆解:它用四层设计避开了 OpenClaw 的坑

Hermes Agent 的记忆不是一套,而是四套:高度浓缩的提示词记忆(MEMORY.md 和 USER.md)、可搜索的 SQLite 历史会话存档、像程序记忆一样运作的技能管理,以及可选的 Honcho 深层用户建模。核心思路是冷热分离——把最常用的信息压进极小的提示词快照里(加起来约 1,300 个 Token),以保住大模型的提示词缓存、降低...

推荐理由:这篇文章不是产品发布,更像一篇技术拆解,把 Hermes Agent 的记忆系统讲得很清楚。我会先打个折:它来自单一信源,没有第三方验证,但给出的四层结构、字符限制和缓存优先思路对实际做 agent 的人有参考价值。正文没披露性能对比数据,所以别把它当评测看,当成一个设计思路的分享就好。

4月29日星期三

r/LocalLLaMA

Mistral 发布 Medium 3.5,开放权重但商用要付费

Mistral 推出了新模型 Medium 3.5,权重开放,用的是修改过的 MIT 许可证——非商业用途免费,商业用途得掏钱买授权。帖子本身因为 Reddit 的反爬机制没抓到正文,所以参数量、跑分成绩、API 价格这些关键信息目前都看不到。光看标题和摘要片段,没法判断它跟上一代比强了多少,也不知道具体适合哪些场景。我会先打个折:等官方技术报告或实测...

推荐理由:Mistral Medium 3.5 标题确认上线,开放权重这点对本地部署是好事,但 modified MIT 许可里商用要付费授权,我会先打个折——正文没给参数量、跑分和具体价格,没法判断性价比。HKR 三项都踩中了:模型发布本身有热度,许可细节是新信息,商用收费又戳到本地模型社区的敏感点。不过信息缺口明显,分数停在 74 合理。

The Verge · AI

ChatGPT 下载量增速放缓,可能给 OpenAI 的 IPO 添堵

Sensor Tower 的数据显示,ChatGPT 的卸载量在 4 月同比上升了 132%,用户要么走了,要么去试了竞品。OpenAI 在 2 月跟五角大楼签了合同后,上个月的卸载率更是暴涨了 413%。月活用户的增速也从 1 月的 168% 掉到了 4 月的 78%。

推荐理由:HKR 三项都站得住:钩子是 ChatGPT 增长踩刹车 vs IPO 的故事张力,知识来自 Sensor Tower 的卸载和月活增速数据,相关性直接打在行业对 OpenAI 增长质量和用户流失的焦虑上。分数没给更高,因为数据源是第三方移动端估算,不是 OpenAI 自己的财报或产品发布,我会先打个折。

X · @op7418(歸藏)

DeepSeek 多模态模型全量上线,网页版识图模式能用了

DeepSeek 把多模态模型全量推上线了,现在打开网页版就能用识图模式。从体验看,这应该是一个独立的多模态模型,不是把图片转文字再丢给纯文本模型那种拼接方案。正文没披露模型名字、参数量、定价和 API 开放时间,这些关键信息都还缺着,想接进自己流程的朋友得再等等。

推荐理由:我会先打个折:这条消息本身够重磅,DeepSeek 的多模态终于从传闻变成可试用的东西了。但正文只确认了网页版识图入口,模型叫什么、多大、多少钱、什么时候上 API 全都没说,信息密度其实挺薄的。HKR 三条都踩中了,不过来源只有一条 X 帖,验证不够硬,所以分数压在 78–84 这个区间是合理的。这点先别太激动,等 API 和 benchmark 出来再重新评估。

新智元 · 公众号

谷歌翻译 20 岁,劈柴哥说它换了四代 AI,现在能直接听懂语气了

劈柴哥发帖庆祝谷歌翻译上线 20 年,月活用户到了 10 亿。他梳理了背后的四代技术:最早是统计机器翻译,2016 年换成神经网络翻译,后来用上 PaLM 2 大模型,2024 年一口气加了 110 种语言。最新的是 Gemini 2.5 Flash 的原生音频翻译,不再先把语音转文字再翻译,而是直接处理声音,能保留原话的语调、停顿和节奏。劈柴哥形容这...

推荐理由:核心事件是谷歌翻译过生日和架构回顾,不是新品发布,但 10 亿月活、110 种语言扩增和原生语音翻译的细节撑得起 featured 档位。我会先打个折,因为正文没给出原生语音功能的具体上线时间或实测数据,这点先别太激动。不过它点到了语音 AI 产品眼下最纠结的问题:级联管线 vs. 原生多模态,所以值得从业者看一眼。

量子位 · 公众号

UCL 等团队开源 Avenir-Web,一个不用额外训练就让网页智能体干活更稳的框架,在 ONLINE-MIND2WEB 上跑到 53.7%

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架,主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里,成功率做到了 53.7%。对比一下,用 Gemini 3 Pro 跑的时候,它比 Claude Computer Use 3.7 的 47....

推荐理由:HKR 三项都站得住:标题有记忆点,数字和对比够具体,选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布,不是大厂模型首发,82 分放在 78–84 区间合理。

量子位 · 公众号

DeepSeek 多模态模型开始灰度测试,能识别图片里的饮料和杯子

DeepSeek 研究员确认 V4 视觉版已经在灰度测试,官网首页上线了图片识别入口。一张截图显示,模型花了 4 秒识别出一张文字不多的图片里的饮料种类和杯子类型。正文没披露灰度覆盖范围、API 是否开放以及定价,所以能不能用上、花多少钱还不清楚。

推荐理由:HKR 三项都站得住:DeepSeek V4 视觉灰度测试是实打实的国内旗舰更新,有截图和 4 秒思考样本。分数维持 80,因为正文没披露开放范围、API 怎么接、价格和跑分,信息缺口不小,先别太激动。

量子位 · 公众号

生数科技认领了那个神秘登顶的机器人模型,叫 MotuBrain,在两项评测里拿了高分,还放了个三台机器人接力干活的演示

4 月中旬有个叫 MotuBrain 的模型在 WorldArena 和 RoboTwin2.0 两个榜单上突然登顶,生数科技在 4 月 29 日认领了它。RoboTwin2.0 的干净环境和随机干扰环境分别拿了 95.8 和 96.1 分。演示里用三台不同的人形机器人接力完成了五项任务,核心是一套叫“世界动作模型”的设计,把视频、动作和语言用混合专家...

推荐理由:我会先打个折:分数和 Demo 都来自公司自己,没有独立部署数据,所以 82 分不往上调。但悬念认领加三台机器人实物演示,H 轴直接拉满;RoboTwin2.0 双场景高分和三流 MoT 架构把 K 轴撑实了;视频公司跨进具身智能这条线,R 轴也站得住。整体判断没变,三个轴都过,分数保持。

r/LocalLLaMA

商汤发布 SenseNova-U1:一个原生架构同时搞定看图理解和生图,不再靠外挂适配器

商汤放出了 SenseNova-U1 系列,主打“原生统一多模态”,意思是模型内部直接处理文字和图像,不用再像以前那样给语言模型外接一个图像适配器来翻译视觉信息。这次公开了 8B 和 A3B 两种 MoT(Mixture of Tokens)规格的权重,其中 A3B 的参数量更小,适合本地跑。官方说法是这套架构把视觉理解和生成塞进了同一个模型里,但 R...

推荐理由:HKR 三项都踩实了:单体架构替代适配器这个思路有看头,4 个 MoT 模型加开源权重是实打实的新料,本地可跑的多模态模型正好戳中当下热点。但正文没给任何基准分,来源又是 Reddit,信息缺口明显,所以分数压在 74 这个 featured 门槛上,先别急着往上抬。

r/LocalLLaMA

DeepSeek V4 定价低到离谱,有人算完账开始怀疑自己的技术栈

Reddit 上有人算了笔账:DeepSeek V4-Pro 输入价格是每百万 token 0.145 美元,比 Claude Opus 4.7 便宜约 34 倍。五月有个促销直接砍到 0.036 美元,缓存命中更是只要 0.0036 美元,比 Opus 的缓存价低了约 173 倍。发帖人最在意的是 agent 循环跑起来的成本,但帖子没验证 100 ...

推荐理由:HKR 三项都踩中了:价格冲击力强、数字具体可算、对 agent 场景的成本压力点抓得准。但这是 Reddit 用户自己算的账,不是官方发布或生产环境实测,所以分数压在 77,不往上给。

TechCrunch · AI

微软独家协议刚结束一天,AWS 就把 OpenAI 模型搬上了 Bedrock

OpenAI 和微软修改协议、不再有独家授权后,亚马逊隔天就在 AWS 的 Bedrock 服务里上线了 OpenAI 最新模型、代码工具 Codex,以及一个叫 Bedrock Managed Agents 的新东西,专门用来搭 OpenAI 驱动的 AI 智能体。亚马逊说这只是“更深合作的开头”,但正文没披露具体上了哪些模型、怎么收费、在哪些区域可...

推荐理由:我会先打个折:正文只说了 AWS 要卖 OpenAI 产品,连具体模型名都没列,所以重要性停在 78 是合理的。真正值得盯的是分发渠道从 Azure 独占转向多云,这对企业采购和云厂商竞争格局都有影响。agent 服务被点名,说明 OpenAI 在推让模型进业务流程干活的产品,但没细节就先别太激动。