如果 Jev 说 Arrow:TypeSafe AI 新模型与 Apache Arrow 的结合探索
TypeSafe AI 推出新模型 Jev,可将自然语言和应用状态转化为带类型决策,返回选项、分数和概率并以 JSON 输出。其采用并行采样器与名为 Reinforcement Learning for Calibrated Decisions 的训练方法,在决策工作流中相比通用 LLM 有显著速度和成本优势。
TypeSafe AI 推出新模型 Jev,可将自然语言和应用状态转化为带类型决策,返回选项、分数和概率并以 JSON 输出。其采用并行采样器与名为 Reinforcement Learning for Calibrated Decisions 的训练方法,在决策工作流中相比通用 LLM 有显著速度和成本优势。
TurboGPT 是一个用 CUDA C++ 实现的字节级微型 GPT 训练项目,采用 MIT 协议,可在 13 秒内训练 22KiB 的 Transformer。
HPE 提出,当 AI 从试验走向客服、IT、研究等常驻生产负载,按 token 消费的模式会让支出变成难以预测的月度变动项,企业需按工作负载判断是否转向自有算力。
据知情人士消息,AI 推理基础设施提供商 Modal Labs 正接近完成由 Accel 领投的 7.5 亿美元融资,投后估值 157.5 亿美元,较四个月前 46.5 亿美元的估值增长逾两倍。
World Labs 签了正式协议,要整体并入 AMD。李飞飞会担任 AMD 的执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。Justin Johnson 和 Ben Mildenhall 继续带队,在 AMD 内部组建一个前沿研究部门。两家公司去年就开始在 AMD 的 GPU 上合作搞模型训练和推理优化,这次合并是想把硬件、软件和开放模型打通,...
推荐理由:李飞飞把整个公司卖给 AMD 还当了首席科学家,这事本身就够炸。我会先打个折:正文没披露交易金额和团队规模,所以别急着算估值。但能确认的是双方去年就开始在 AMD 的 GPU 上跑模型训练和推理优化,不是临时起意。合并的逻辑很清楚——把硬件、软件和开放模型捆在一起,想走一条不同于英伟达生态的路。Justin Johnson 和 Ben Mildenhall 继续带队做前沿研究,说明 AMD 要的不只是技术,还有整支能打的团队。这点先别太激动,得看后续 AMD 能不能真把研究转化成产品,但人事和战略层面的信号已经足够强。
Mistral 在慕尼黑开设德国中心,组建专注 Physics AI 与工业 AI 的研究团队,并计划到 2030 年建成 1 吉瓦欧洲算力。该中心将携手 BMW 开展碰撞仿真与工程 AI 合作、与 Siemens Energy 推进工业 AI 应用,并与慕尼黑工业大学(TUM)合作利用风洞设施开发汽车空气动力学数字孪生。
llama.cpp 合并了一个 PR,给 CPU 推理加上了分块矩阵乘法(tiled mul_mat)。简单说就是把大矩阵切成小块算,让 CPU 缓存更友好、内存带宽压力更小——这对跑本地大模型是实打实的优化。不过正文被 Reddit 屏蔽了,没披露具体提速多少、内存省了多少。如果是真的,本地推理延迟应该能降一截。
GitHub Copilot 应用推出 canvas,一种运行在应用内、无浏览器外壳的全栈小应用,可与 Copilot 智能体双向通信,并能在本地执行代码、调用第三方 API。作者认为聊天只是 AI 的通用兜底界面,用户明确任务时更该让智能体生成可复用工具,而非把智能体本身当工具、白白消耗 token。示例包括 Connect 4 游戏、Winget 包管理、SQLite 操作和开发工作流自动化。
Google 的 Project Suncatcher 首颗试验卫星 MVP 将于 10 月 1 日发射,用于验证其轨道 AI 数据中心构想。该卫星约冰箱大小,搭载 4 块 Google 自研 TPU AI 加速器,太阳能板供电约 1 千瓦。
XPRIZE Wildfire 公布 1100 万美元竞赛结果,两大赛道大奖均空缺。太空探测赛道要求 10 分钟内识别澳大利亚大范围火情,SIRIUS Wildfire Alliance 获 50 万美元一等奖;自主响应赛道三支决赛队均在 10 分钟内探测到阿拉斯加高风险火情,但无一完全扑灭。
GitHub Copilot 应用重建了 pull request 视图,以流畅渲染含 2,200 个文件、超百万行改动和 400 多条行内评论的超大 PR。其做法是把文档高度拆成确定性的代码几何与动态评论块两套几何:代码行高提前精确算好,评论高度按块懒测量并锚定到文件、行与侧,避免滚动跳动。
Google DeepMind 公布 Private AI Compute 的新技术能力,将私密的服务端持久记忆引入该平台,使 AI 助手能跨设备保留上下文。数据密封在加密存储中,解锁密钥仅保存在用户设备上,模型访问时通过端到端加密通道进入云端安全隔区,在隔离内存中临时解密并即时重新加密。
推荐理由:原文说明云端持久记忆如何用安全隔区与设备端密钥实现隐私保护,可了解云端 AI 记忆的隐私架构思路。
Modal 工程团队写了一篇长文,拆解他们怎么为 Moonshot AI 的 Kimi K2.6 模型做推理加速,用来驱动编码 Agent。核心成果是把单副本(replica)性能提了 2.8 倍(按单用户交互体验算)和 5.6 倍(按多用户并发吞吐算),让原本贵到没法用的服务变得价格有竞争力。文章先讲工作负载:万亿参数的混合注意力 MoE 模型,输入...
推荐理由:Modal 这篇工程拆解直接甩出两个硬数字:单副本交互体验提了 2.8 倍,多用户并发吞吐提了 5.6 倍,对搞推理优化的人来说是能直接拿来对标的参考。没给更高分是因为这属于基础设施层的优化,不是模型能力或产品更新;但文章把万亿参数 MoE 模型怎么从贵到用不起做到价格有竞争力讲清楚了,对从业者有实际价值。
Simon Willison 发布 llm 0.36。该版本信息由其本人在 9 月 22 日发布,具体更新内容原文未作说明。
Tomasz Tunguz 拿自己生产环境里 98 封邮件实测了两款新工具 Jev 和 SemIf。它们不生成文字,只跑一遍注意力计算就直接输出选项概率,几百毫秒出结果。分类准确率从原来通用模型的 47% 跳到 80% 以上,单次调用成本降到 0.0004 美元,比顶尖大模型便宜 76 到 209 倍。Tunguz 认为这标志着 AI 路线开始分叉:前...
推荐理由:Tunguz 拿自己邮箱里的真实邮件跑了对比实验,准确率和成本数字都有,不是空谈趋势。文章点出了一个值得关注的分叉:通用生成模型和专用决策器开始各走各路。分数维持在 78,因为 Jev 和 SemIf 都太新,没有大规模验证,这点先别太激动。
Simon Willison 发布 llm-keys-ui 0.1 插件,用于在不向 ChatGPT 应用或智能体会话粘贴 API key 的情况下,把密钥配置到远程机器上。
一台型号为 Mac18,6 的设备跑出了 Geekbench 7 单核 4150 分,是目前公开的最高分。这颗 M6 Pro 有 18 个核心,分成 6+12 两组,基础频率 4.78 GHz,配了 48 GB 内存。多核 37565 分。单核成绩比前代 M 系列明显高出一截,说明苹果在单线程性能上还在往前推。不过这只是个跑分,实际功耗、散热和最终量产...
这篇 ICLR'26 的论文提了个很直接的想法:多个大模型协作时,别让它们互相发文字了,直接传“脑内状态”(KV-cache,可以理解成模型思考到一半的中间结果)。作者先做了个验证实验,发现把 KV-cache 里的语义信息搞丰富点,不用加大缓存,回答质量就能变好,说明这条路走得通。于是他们搞了个叫 C2C 的框架,用一个小神经网络把 A 模型的 KV...
推荐理由:ICLR'26的论文,想法很巧:多个大模型配合干活时,别互相发文字了,直接传“脑内状态”(KV-cache)。作者先做了验证,证明把缓存里的语义搞丰富点,不用加大缓存就能提升回答质量,说明这条路走得通。然后他们搞了个C2C框架,用一个小神经网络把A模型的缓存翻译成B模型能懂的格式。有验证有方案,知识密度够,但偏底层优化,不是那种大家一看就想转的日常痛点,所以分数没给更高。
高通与 AWS 宣布多代合作,联合开发数据中心 AI 推理芯片和 1.6Tbps 光互连,但没公布芯片型号和交付时间。Anthropic 安全报告披露,一个俄罗斯自由职业团队用 Claude Code 开发自主攻击无人机软件,做了硬件在环测试,技术就绪度评为 3-4 级,但没有部署证据。25 位菲尔兹奖得主联署声明,批评商业数学评测只看答案分数、忽视方...
三元模型把每个权重存成 -1、0 或 +1,理论上每个权重至少需要约 1.585 比特,实际打包时通常要 1.625 比特。Intel 作者测了 29 个三元大模型,发现零权重占比最高能到 51.5%。他们据此提出 BITCOS,不再用固定打包,而是用一个位图标记哪些位置是零,再单独存非零权重的正负号,这样每权重的存储成本变成 2 减去零权重比例。在 ...
推荐理由:Intel 团队拿 29 个三元模型实测,发现零权重占比最高能到 51.5%,然后提出 BITCOS 编码——不再固定打包,而是用位图标记零位置、非零只存正负号,把每权重存储成本压到 2 减零权重比例,直接捅破 1.58 比特的地板。标题本身就勾人,对做推理优化的人有吸引力,但话题太窄,没有大众传播力,所以 H 和 K 都成立,R 不成立。
NVIDIA 发了一篇博客,核心观点是 AI 工厂(大规模部署 GPU 做推理/训练的数据中心)应该用“每瓦特产出多少 token”来衡量效率,而不是只盯着 GPU 的浮点算力。文章从数据中心设计、散热到推理调优讲了一整套优化思路,想把 AI 工厂跑成生产线。但正文没有披露具体的效率提升数字,也没有提到新硬件型号。如果你在规划数据中心或买卡,这个衡量思...
IEEE Spectrum 发了一篇综述,说2026年是推理硬件革命年。核心观点:过去两年推理效率提升了10倍以上,靠的是芯片架构创新和内存带宽突破。以前芯片都卷训练,现在专门为推理优化——也就是让模型跑起来、跑得快、跑得便宜。文章没点名具体公司或芯片型号,也没给实测数据,更像一个行业趋势判断。如果是真的,部署成本能降一大截,对做应用落地的人是个好消息。
一个开发者把 DeepSeek V4.1 Flash 的 Q4 量化版塞进了 512GB 内存的 M3 Ultra,通过魔改推理引擎 ds4,把生成速度从每秒 16.6 个 token 提到了 31.3 个,开启模型自带的 DSpark 投机解码后能到 40.5 个。速度提升不是靠改模型,而是把 Metal 图形接口的调度指令大幅合并:原来 384 个...
推荐理由:一篇扎实的本地推理优化记录:把 DeepSeek V4.1 Flash Q4 塞进 M3 Ultra,靠合并 Metal 指令缓冲和开启原生 DSpark 投机解码,速度从 16tps 拉到 40tps。技术细节具体,对本地 LLM 玩家直接有用。分数维持 72,因为受众面窄,但在这个圈子里确实是个能让人立刻动手试的帖子。
Reddit 用户 AlexGabbia 给 llama.cpp 提了个 PR(#27000),加入 Maple 20B-A1B 模型架构。总参数量 20B,但每次推理只激活 1B(MoE 的稀疏激活),权重只有三个值:-1、0、1(三值量化),内存和计算量都砍得很低,目标是让普通 CPU 也能跑大模型。正文被 Reddit 屏蔽了,没披露具体性能数字...
Mistral 与 Cloudera 宣布合作,将 Mistral 模型集成进 Cloudera 混合数据平台,企业可在私有云、公有云、本地及完全气隙环境中部署推理并保持完全控制。企业还能在受控环境中用专有数据训练定制模型,数据与模型所有权均归企业,模型基于开放权重。Cloudera 平台上客户管理的数据规模达 30 exabytes。
vLLM 在 AMD MI300X 上测了推测解码(让一个小模型先快速猜一串 token,大模型一次验证,能一次吐出多个 token)。他们试了五种猜法:原生 MTP、Gemma 4 MTP、EAGLE-3、DFlash 和 DSpark,区别在于小模型怎么从大模型拿信息、以及是一次猜一个还是一串猜。结果吞吐提升幅度差别很大,取决于猜法、猜多长、模型类...
有人在 Qwen 35B A4B+ 上试了个 MoE 推理加速方法:每生成一个 token 时多激活几个专家参数,结果推理 token 数少了 8.5%,而且完全不用重新训练或微调。正文没披露具体怎么改的(比如改路由阈值还是硬选专家),也没说输出质量有没有掉。如果是真的,等于白捡一个加速,对部署 MoE 模型的人来说挺实用。
carloslfu 开源了一个叫 Slotstream 的工具,用 MLX 和 Swift 写成。它能让一个 1250 亿参数、4-bit 量化后体积仍有 104GB 的 MoE 模型(Qwen3.8-Flash-Next),在一台只有 48GB 内存的 Mac 上跑起来。原理是不把整个模型塞进内存,而是按需从 SSD 里流式加载专家模块。生成速度大约...
推荐理由:一个个人项目,用流式加载专家模块的办法,让 104GB 的 Qwen 125B 模型在 48GB Mac 上跑到每秒约 12 token。工程思路干净,还给了 Ollama 兼容接口,试错门槛低。扣分是因为目前没有社区验证,正文也没披露长上下文下的稳定性或并发表现,所以我会先打个折。
文章把大家常说的“本地 LLM”拆成了两个市场:成本市场买的是 5 到 20 倍的价差,控制市场买的是 25 到 33 年才能回本的确定性。作者用“权重开闭源”和“按时间/按 token 计费”画出四个格子,指出 OpenRouter 上开放权重模型调用量暴增,其实跑的都是远程 API,不等于本地部署赢了。自建硬件回本周期完全取决于你替代的是哪种云端计...
推荐理由:把“本地 LLM”拆成成本市场和控制市场,用 OpenRouter 调用量数据和硬件回本周期算账,直接回应 infra 决策者最关心的租 vs 买问题。没给更高分是因为它属于评论分析而非产品发布或研究突破,但 HKR 三个维度都踩中了,featured 合理。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全和语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还将在沙特面向受监管行业制定联合市场策略。
Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,在一张 H100 上做到 10 并发请求时,95% 的用户听到第一个字的时间不超过 50 毫秒,且播放不卡顿。他们对比了 vLLM-Omni、SGLang-Omni 等四个引擎,默认设置下最快的 p95 首音延迟也要 277 毫秒。核心优化有两招:一是动态切掉模型开头几十毫秒的静...
推荐理由:Nari Labs 开源了一套 Qwen3-TTS 1.7B 的部署方案,单张 H100 跑 10 个并发请求,95% 的用户在 50 毫秒内就能听到第一个字,比 vLLM-Omni 等引擎默认配置快了五倍以上。文章给了具体 benchmark 和可复现的优化步骤,我会先打个折——这是他们自己测的数据,实际场景里网络抖动和客户端解码还会吃掉一点延迟,但核心思路(动态剪掉开头静音、用 CUDA Graph 合并小算子)确实能帮做实时语音的团队少踩很多坑。
Inco AI 发布了 DFlash 2,在原来一次性并行猜出整段候选词的基础上,加了一个轻量的路径选择器。DFlash 原本是每个位置独立挑最可能的词,但词与词之间可能不连贯,导致验证时整段被砍掉。DFlash 2 的做法是每个位置保留前 16 个候选,然后给相邻词对打分,从中挑出一条最连贯的路径。在 Qwen3.8-27B 上实测,每次验证通过的有...
推荐理由:DFlash 2 是对已有推理加速方法的明确改进,有实测数据,不是空谈。分数没给更高是因为这只是一篇技术博客,不是模型发布或产品上线,影响面集中在推理栈圈子。
Mistral 宣布 Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行,同时 Mistral Priority Tier 进入公开预览,提供自定义速率限制和带 SLA 的可用性承诺。
推荐理由:Mistral 把区域推理端点、SLA 服务层级与第三方开源模型接入放在同一套基础设施上,读者可据此判断欧洲主权 AI 的落地路径。
Dwarkesh Patel 认为,一旦模型能在部署后持续更新权重,整个 AI 格局就会变。他打了个比方:就像学萨克斯,光靠看前人的笔记永远学不会,模型也不能只靠会话间传小纸条来真正干活。这会直接冲击现在的监管思路——不能再指望上线前做一次安全检查就万事大吉,按月或按季度做风险巡检才更合理。对齐研究也得转向,从盯着冻结的权重,变成防止模型在持续更新中被...
推荐理由:Dwarkesh 在 AI 播客圈本身可信度就高,这篇是他自己的预测文章,不是访谈转述,观点浓度够。如果持续学习真的落地,确实会动摇现在的安全框架,K 和 R 都站得住。我会先打个折:持续学习还没成现实,但推演逻辑是通的,所以重要性给 78 不算虚高。
LMSYS 把 SpecForge 的训练流程拆成了两拨独立资源:打补丁的 SGLang 服务器负责从目标模型抓特征,Mooncake 负责传数据,训练节点只管吃特征训练草稿模型。在 8 张 H20 的测试环境里,3 台服务器加 5 个训练节点的吞吐比之前绑在一起的方案高了约 10%。这次更新还一口气支持了 EAGLE3、DFlash、Domino、D...
推荐理由:LMSYS 这次把 SpecForge 的训练流程拆成了三块独立资源——抓特征、传数据、训草稿模型——在 8 张 H20 上跑出了约 10% 的吞吐提升,数字和架构都实在。但话题本身太底层,只对做推理优化的那拨人有直接价值,所以给了 featured 但没给 r。
Baseten 刚融了 130 亿美元,Philip 和 Ali 在这期播客里把推理工程拆开讲透了。他们聊了量化、投机解码、KV 缓存搬运、以及把预填充和解码拆开跑这些技术。一个 GLM-5.2 的实验发现,多量化几层反而让基准测试质量没掉,吞吐还涨了 20%,因为不同层引入的误差会互相抵消。他们还把 Kimi 的视觉编码器直接嫁接给 GLM-5.2,...
推荐理由:Baseten 刚融了 130 亿美元,让这期推理工程深度聊的时效性更强。GLM-5.2 的量化实验和 Kimi 视觉编码器嫁接是具体、少见的技术细节。分数定在 78 而不是更高,因为毕竟是播客文字稿——信息密度高,但结构不如正式技术报告紧凑。
这个开源库把 Llama 3 70B 这样的大模型按层拆开,每次只加载一层到显存里算,算完再换下一层,所以一张只有 4GB 显存的普通显卡也能跑推理,不用多卡并联。它支持 Llama、Mistral、ChatGLM 等主流架构,直接兼容 HuggingFace 上的模型。代价是速度会慢不少,但把本地跑大模型的硬件门槛压到了笔记本级别。
推荐理由:把 70B 模型拆成一层一层轮流塞进显存,不是新思路,但做成开箱即用的库确实省事。正文没给具体延迟数据,速度会打折这点得心里有数,所以分数没往上拉。
OpenAI 把 GPT-5.6 Luna 的价格砍到了每百万 token 输入 0.2 美元、输出 1.2 美元,降幅 80%。Terra 降了 20%,Sol 则多了一个 2.5 倍速模式,价格翻倍但智力不变。最狠的是,Luna 在 AA 基准测试上拿了 51 分,跟今年三月 GPT-5.4 开满推理强度时的分数一样,但 token 成本只有当时的...
推荐理由:四个月把同等智力成本压到十三分之一,这个信号比单纯降价狠得多。AA 基准 51 分直接对标 GPT-5.4 满血推理,让降价有了硬参照,不是拿弱化版糊弄人。文章没展开“递归自优化”具体怎么做的,这点先别太激动,但光看价格和分数,已经够让所有调 API 的人重新打算盘了。
Echo 是 TracerML 做的一个实验性系统,它不单独用某一个模型,而是把 GLM-5.2、Kimi K2.7 等几个开源模型放在一个池子里,每次收到请求再决定调用哪几个模型、怎么组合它们的输出。作者先算了一个理论上限:如果每次都能事后挑出最佳模型组合,性能会远超任何单一模型。Echo 想在不提前知道答案的情况下逼近这个上限。在作者自己搭的评测集...
推荐理由:这是一个 Show HN 项目,核心卖点是动态路由多个开源模型来逼近 Fable 的效果,同时把成本压到三分之一。机制和数字都给了,但我会先打个折:评测集是作者自己搭的,跟 Fable 的对比到底跑了多少样本、在什么任务上比的,正文没细说,这点先别太激动。标题的吸引力在于直接对标一个已知产品并给出具体成本数字,技术思路上用模型池加动态调度也比单纯换模型有嚼头,所以给了 featured。
作者把谷歌的 Gemma 4 26B 模型(一种混合专家模型,每次只激活部分参数)塞进了一台 2013 年的惠普存储服务器,双路至强 E5-2690 v2,没显卡,整机成本不到 300 美元。跑起来后生成速度约每秒 5.2 个 token,跟人阅读速度差不多。过程并不顺利:这 CPU 只支持 AVX1 指令集,而推理引擎 ik_llama.cpp 的优...
推荐理由:这是一篇第一人称的硬核实验,不是泛泛的“本地跑大模型”教程。Gemma 4 26B 这种混合专家模型塞进 2013 年老至强,没显卡,总花费不到 300 美元,每个细节都有实测数据撑着。HKR 三项全中,但本质是个人博客的折腾记录,不是产品发布或研究突破,所以重要性给 72、放 featured 刚好。