PrismML 把推理模型压到 5.9 GB,想在手机和电脑上跑
PrismML 发布了 Bonsai 2 27B,这是阿里 Qwen3.8 27B 的压缩版,体积只有 5.9 GB,内存占用比原版少了 9 到 10 倍,能在 PC 上跑,高端手机也有可能。团队带头人是 Caltech 的压缩技术专家 Babak Hassibi,Databricks 联合创始人 Ion Stoica 担任顾问。公司拿了 2225 万...
PrismML 发布了 Bonsai 2 27B,这是阿里 Qwen3.8 27B 的压缩版,体积只有 5.9 GB,内存占用比原版少了 9 到 10 倍,能在 PC 上跑,高端手机也有可能。团队带头人是 Caltech 的压缩技术专家 Babak Hassibi,Databricks 联合创始人 Ion Stoica 担任顾问。公司拿了 2225 万...
Meta 发了 Muse for Mac,一个需要你明确授权才会动手的桌面智能体。它能整理下载文件夹、帮你找丢失的文件、总结消息和笔记。官方说更多功能在路上,但正文没披露背后的模型细节、隐私边界,也没提 Windows 版什么时候出。
纽约时报起诉 OpenAI 的官司里,一批原本被密封的内部文件公开了。微软自己的内部文档把大模型训练叫做“史无前例的惊人盗窃”,还说这可能是“人类历史上最大的劳动盗窃”。更关键的是,这份文档指出 AI 产品已经启动了一个“末日循环”:它们先抓取创作者的公开内容来训练模型,然后直接在搜索结果里生成答案,导致用户不再点进原网站。微软 CEO 萨提亚·纳德拉...
推荐理由:微软自己内部文件把 AI 训练叫“盗窃”,还描述了模型抓内容→生成答案→截流用户的“末日循环”,这是纽约时报诉 OpenAI 案里目前最狠的证据。三个维度都打满,多家媒体交叉报道。小扣分:404 Media 不是顶级科技媒体,而且文章对“末日循环”的具体数据支撑没展开,更多是微软内部的法律风险自述。
Thomas Ptacek 分享了他用大模型辅助写作的方法,核心是把模型当校对而不是枪手。他定了两条死规矩:第一,模型建议的任何措辞一个字都别用,因为前沿模型会把所有文字都变成杂志标题,读起来像工业糖浆;第二,别让模型夸你,初稿通常很烂,模型的鼓励会让你把糟糕的第一反应锁死在文章里。模型真正好用之处在于机械性地挑毛病,比如被动语态、填充词、段落顺序混乱...
推荐理由:Thomas Ptacek 是知名安全研究员,技术写作一向犀利。这篇文章不是公关稿,而是个人实战经验,两条死规矩有明确边界和理由,不是泛泛的“用好 AI”。信息密度高,直接可操作。扣分点:正文没披露完整文章,只能看到摘要,但核心论点已经足够清晰有力。
Anthropic 自己披露,Claude 现在承担了公司 26% 的研发任务,统计口径是代码提交次数,不是人头或工时。公司说这么干不是为了裁员,而是把工程师往更高层的系统设计和安全对齐上推。我会先给这个数字打个折——这是自报数据,没有第三方审计,而且文章也没说清楚到底哪些活算研发。但就算把比例砍半,一家头部模型公司用自家模型吃掉超过 10% 的研发工...
推荐理由:Anthropic 自报 Claude 承担了 26% 的研发任务,按代码提交次数算,Bloomberg 首发。数字具体,会在行业里引发讨论,但这是自报数据,没有第三方审计,文章也没定义哪些活算研发——所以分数没给更高。
PrismML 开源了 Bonsai 2 27B,这是基于 Qwen3.8 27B 做的三值量化版。它把模型权重压缩到只有 -1、0、+1 三种值,再配合 FP16 的分组缩放,每个权重只占 1.76 比特,整个模型文件只有 5.9GB,比原版小了 9 倍多。跑分方面,综合基准测试得分 83.9,保留了原版 85.4 分 98.2% 的水平,在编程、智...
Liam Nugent 认为,产品团队最难也最有价值的决策不是上线什么功能,而是砍掉什么。他用“文档中心”和“通知中心”举例,说这两个功能一开始看起来简单,但每个利益相关者都会要求“再加一个小功能”,最后变成维护成本极高的“烂 Gmail 克隆版”。他建议用长期运行成本(不是开发成本)来说服团队放弃功能,而不是靠直觉。他还引用 Nature 上的研究,...
Anthropic 发布了一套测量框架和一份内部快照,想让外界能看清前沿 AI 的开发节奏。最抓眼球的一个数字是:Claude 现在主导了 Anthropic 内部 26% 的 AI 研发任务,而今年 2 月这个比例还不到 1%。如果按这个趋势走,到 2026 年底可能冲到 80%。我会先打个折,这个预测的前提是趋势不被打断,而且目前 Claude 还...
推荐理由:Anthropic 第一次公开内部 AI 研发自动化指标——当前 26%、年底预测 80%——是前沿实验室里少见的数据动作。数字具体、趋势清晰,值得放进精选。没给更高分是因为 80% 的预测假设趋势不被打断,正文也没披露测量口径和任务定义,实际落地可能打折。
Google Research 发了一个原型系统,老师输入“光合作用拖拽测验”这种自然语言描述,系统就能自动生成一个可用的互动页面。本质是用生成式 UI 把提示词变成教学工具,不用老师写代码。正文没披露用了哪个模型,也没说是否已上线,只展示了原型和用户测试结果。如果是真的,能省掉老师自己搭互动课件的时间,但生成内容的准确性和可控性还没验证,这点先别太激动。
Bend 是一门新语言,主打三件事:跑得快、自动并行、用证明拦截 AI 生成的错误。它编译后的速度接近 C,同一份代码不用改就能在 CPU 多核和 GPU 上跑,官方在 M4 Max 上测出 GPU 比单核快上百倍。类型检查器本身就是证明检查器,检查一个中型项目只要一秒左右,AI 每次改完代码都能跑一遍。用法是在 LAWS.bend 文件里写规则,比如...
推荐理由:Bend 同时标榜 C 级速度、自动 CPU/GPU 并行和亚秒级证明检查,这三样单拎出来都不新鲜,但打包在一起确实少见。M4 Max 上百倍加速和约一秒的类型检查给了具体参照,让性能承诺没那么虚。我会先打个折:这是语言官方自己测的数据,没有第三方验证,也没提生态成熟度和实际项目落地情况。但它的方向很清晰——用快速证明给 AI 生成的代码上保险,这个痛点选得准。
企业把复杂任务交给 AI 智能体(让模型进业务流程干活)后,碰到了一个审核瓶颈:智能体干活又快又多,人根本看不过来。Hugging Face 那次事故里,近 12,000 个智能体互相配合,速度远超人类能追踪的上限。Redwood Research 的审计员说数据量大到“不可能”不用 AI 来辅助审查。现在的思路是再放一个 AI 进流程当监工。但 Si...
推荐理由:这篇文章用一个具体事故把智能体审核瓶颈讲透了,角度选得好。但它本质上是趋势观察,没有新工具发布或实验数据支撑,所以放在 featured 档刚好。我会先打个折:正文没给出“再放一个 AI 当监工”的具体方案或效果验证,这点先别太激动。
Anthropic 的 CEO Dario Amodei 写了篇近四千字的长文,呼吁全球协调放慢 AI 研发速度,好腾出手来部署安全护栏。Sam Altman 和 Elon Musk 也公开支持这个想法。但批评者不买账,认为头部实验室这么急着喊刹车,更像是想锁死自己的领先地位,而不是真心应对风险。文章把两边观点都摆了出来,但没下结论。
推荐理由:Dario Amodei 亲自下场喊刹车,Altman 和 Musk 跟着附和,这动静本身就够大。TechCrunch 把正反两方的牌都摊在桌上,信息密度不错。没给更高分是因为它本质上是一篇观点综述,没有独家数据,也没亮出自己的判断,读完之后争论还是那个争论。
联合国周四宣布跟谷歌合作,搭建了一个叫“UN System Data Commons”的新平台。简单说,就是把联合国旗下各个机构的统计数据整理好,让人能用大白话搜索,也让 AI 系统能通过 MCP 这个接口标准直接连上来取数。起因是联合国儿童基金会之前拿 6 个大模型做了个测试,让它们回答 13.3 万个关于全球发展指标的问题,结果平均准确率只有 60...
推荐理由:联合国跟谷歌合作把统计数据做成 AI 可读,还用了 MCP 接口,这事有分量。但最抓人的是那个测试结果——6 个模型答全球发展指标问题,平均准确率才 60%,说明现在的大模型在专业数据上还很拉胯。不过话题偏机构化,离开发者日常远,所以 R 没给,分数就定在 featured 这个档。
纽约时报诉 OpenAI 和微软的官司里,新解封的法庭文件显示,一位微软高管曾在内部聊天里把 AI 抓取数据的行为叫做“人类历史上最大的劳动窃取”。文件同时指控两家公司爬了纽约时报的付费内容来建训练数据集,内部还警告过这种做法会掏空出版商。不过,微软公开层面并没有回应这句内部评价。
推荐理由:解封的法庭文件里爆出一句微软高管自己的话,把 AI 抓数据叫成“人类历史上最大的劳动窃取”,这种内部自曝比外部指控更有杀伤力。文件还实锤了爬付费内容、内部警告会掏空出版商这些细节,让指控不再是空口说白话。对创作者群体来说,这等于有人替他们把心里话说出来了,所以三个维度都打满。没给更高分是因为现在还停留在指控阶段,法院没判、也没和解,只是文件公开了而已。
纽约时报在版权官司里甩出新证据,是 OpenAI 员工在内部聊天里的原话。他们当时讨论 AI 搜索摘要功能时,直接说这东西会截走流量和收入,对内容行业是“生存威胁”。OpenAI 的回应是,这只是零散的员工闲聊,不代表公司立场。文章没披露具体是哪些员工、聊天发生在什么时间,所以这些对话在内部有多大分量还不好说。
推荐理由:纽约时报版权官司里扔出的新料,是 OpenAI 员工自己说 AI 搜索摘要对出版商是“生存威胁”,戏剧性和信息增量都够硬。扣分是因为文章没披露具体是谁、什么时间聊的,这些对话在内部有多大分量还不好说,所以我会先打个折。
Anthropic 的 Dario Amodei 带头提议“放慢前沿 AI 研发节奏”,Sam Altman 和 Elon Musk 跟着附和,Google、微软也口头支持。The Verge 直接点出这帮人的动机很可疑——这更像是一次联手卡位,而不是真心搞安全。Meta 明确反对任何减速。文章没给出具体的时间表或技术门槛,只整理了各家的公开表态。
推荐理由:头部实验室集体讨论减速是个信号事件,The Verge 对动机的怀疑让这条稿子没沦为公关汇总。扣在 78 而不是更高,因为正文没给出具体时间线或技术硬指标,目前只是各家公开表态的整理,后续怎么落地还看不清。
彭博社报道,SpaceX 正在考虑从已经倒闭的创业公司购买数据,用于训练自己的 AI 模型。正文没披露具体目标公司、数据类型或交易金额,只说了 SpaceX 在积极找。对 AI 从业者来说,这信号是 SpaceX 认真在搞专有训练数据,不只用公开数据集。
Anthropic 把 Projects 功能又带回了 Claude Code,这次主打的是让用户能指挥一队 Claude Code 代理互相配合工作。从放出的截图看,界面里能同时看到好几个代理在跑,但文章没细说任务具体怎么分配、最多能跑几个代理、以及会不会额外收费。我会先打个折——目前这更像是一次功能回归和视觉展示,实际的多代理协作效果和成本控制还得...
Wispr 推出了一个叫 Canto 的实时语音识别模型,主打真实世界的口述场景。他们在 10 小时、超过 2300 名用户的真实录音上做了测试,Canto 的词错误率(WER)比 Google、OpenAI、AssemblyAI 和 Deepgram 的模型都低。在一个专门挑刺的 3 小时挑战集里(包含噪音、低音量、短句),Canto 在实时模型里排...
推荐理由:这篇值得上推荐,主要是因为它在真实脏数据上做了横向对比,不是实验室自嗨。H 和 K 都站得住:场景够脏、对比够直接,对做语音产品的同行有参考意义。但我会先打个折——Wispr 不是头部玩家,这更像一次产品性能秀,不是行业级事件,所以 R 不成立,分数卡在 featured 门槛上。再往上就得看有没有开源、有没有第三方复现了,正文没提这些。
彭博报道,Anthropic 反复拿 AI 导致人类灭绝说事,把整个 AI 辩论的焦点都拉到了“生存焦虑”上,监管、就业、偏见这些更实际的议题反而被挤到一边。文章认为这种对“末日风险”的执着正在压制近在眼前的讨论。不过正文没披露 Anthropic 拿出了什么新证据,也没提其他实验室的具体回应——所以这点先别太激动,更像是一篇立场评论,不是调查报道。
查尔斯三世在苏格兰邓弗里斯庄园办了一场闭门AI峰会,请来了黄仁勋、OpenAI和Anthropic的负责人、英国新上任的AI部长,连军情六处头头和教皇的AI顾问也到了。国王在会上说,得想办法控制AI,“别等来不及了”。王室平时不碰政治话题,这次主动发声挺少见。正文没披露具体政策建议或下一步动作,所以目前更像一个姿态,不是方案。
Qwen 推出了 Qwen3.8-Omni-Flash,这个模型的重点不再是单纯理解音视频,而是能规划任务、调用工具、完成实际工作,比如视频剪辑、MV 制作、电影解说和实时对话。它支持 100 万 token 的上下文窗口,在 29 项评测里平均分比上一代 Qwen3.5-Omni-Plus 高出 25% 以上。价格降得很猛:音频输入每小时 API 费...
推荐理由:Qwen 把全模态模型从理解推到了任务交付,有具体评测分和定价做支撑,不是空喊口号。分数定在 82 而不是更高,是因为这是发布首日的信息,没有第三方复现或跨源交叉验证,实际稳定性和延迟都还是未知数。
Base Labs(Baseten 拆分出来的研究部门)宣布跟 Hugging Face、Goodfire 合作,专门为开放权重模型搭建安全评估和监控的基础设施。他们计划公开训练和监测方法,直接应对一个现实风险:有人用“abliteration”这类技术把模型的安全限制洗掉,让模型变得危险。abliteration 说白了就是通过修改模型内部参数,抹掉...
推荐理由:Base Labs 联手 Hugging Face 和 Goodfire,专门解决开放权重模型被“洗掉安全限制”的问题。我会先打个折,正文没披露具体的评估指标和延迟数据,但合作方阵容和公开方法的承诺,让这条消息对做模型部署的团队来说很实在。
Pinterest 正在内测一个叫 Restyle 的 AI 功能,用户上传自己房间的照片,AI 就能把里面的家具、装饰和灯光全换掉,效果图里出现的商品可以直接跳转购买。说白了就是把“收藏灵感”这一步直接连到“下单”,缩短从看到买的路径。正文没披露上线时间和支持地区,所以离真正能用还有多远不好说。
Google DeepMind 的经济学家 Julian Jacobs 和 Alex Imas 在这篇文章里,把应对 AGI 冲击的 11 种政策拉出来比了一遍,从全民基本收入(UBI)、政府保障就业、数据分红到利润共享都算在内。他们没站队某一种方案,而是用四个维度打分:福利水平、个人自主权、实施可行性、以及在不同 AGI 发展场景下能不能扛得住。核心...
推荐理由:DeepMind 官方出品,两位署名经济学家,11 种政策四维打分,框架本身有参考价值。扣分是因为这是政策分析而非产品/模型更新,且摘要没给出具体结论或数字,更像一篇讨论稿。
Detail 创始人 Dan Robinson 认为,2026 年上半年很多团队把工作甩给 agent 大军的做法回报很差,行业正处在幻灭期。他判断工程师未来的核心价值是提出好想法和设计好架构,而 bug 修复、前端一致性、增长实验这类工作应该交给 agent 自动完成。文章指出目前还缺几个关键基础能力:agent 能看懂的开发环境、跨工具的全局记忆(...
推荐理由:一篇有真实判断的技术观点文,不是产品软文。作者承认当前 agent 编程投入产出比低,并指出三个关键缺口,讨论价值高。因为是个人博客而非产品发布或论文,分数没给更高。
这篇论文提了一个新架构,核心想法是:用户对话时提供的实时信息(比如补充的事实、纠正的指令)不再塞进提示词里反复读,而是当场生成一小块模型权重,直接修改模型的前馈网络。具体做法是用一个紧凑的超网络,把实时数据转换成对共享基座模型的低秩调制,相当于每次只动一小部分参数。更特别的是,它维护了一个对生成器潜变量的贝叶斯信念,并在对话过程中在线更新,让有效权重随...
推荐理由:这篇论文的架构想法挺新鲜:把用户对话里的实时信息直接变成模型权重,而不是让模型反复读提示词。超网络加贝叶斯在线更新的设计让这个思路有了可操作的机制,不只是概念。但正文没披露任何产品化路径或实验室背景,目前还停留在纸面,对一线干活的人影响有限,所以先打个折,放在 featured 里让大家知道有这么个方向。
AutoBot 是一个 MIT 开源的个人 AI 工作套具,让你用语音给 AI 派长线任务,说完就能放下手机,它会自己把活干完。在 OSWorld 基准测试里拿了 32.41% 的分数,把 Sol Max 从第四名推到了第一,超过了 Opus 5;在 AssistantBench 上得了 50.70%。它靠一个本地账本追踪没做完的输出和完成证据,记忆每...
aclif 把 Salesforce、ServiceNow 这类 SaaS 的 API 包装成统一的命令行工具,AI 代理不用每换一个平台就学一套新工具。它的核心思路是“按需加载”:代理用到哪个命令才去读它的定义,不会像 MCP 服务器那样把所有工具一次性塞进上下文里烧 token。每个命令都自带 --dry-run 和 --schema 这类预览开关...
一个 macOS 应用,实时显示你的 Claude 和 Codex 额度。当余额低于 10% 时,自动打开一个聊天室,让你和朋友在烧额度时互相陪伴。免费,需要邀请码。正文没披露支持哪些具体模型或 API 版本。
Skillsync 是 YC W26 的项目,能把 Claude Code、Cursor、Codex 这类本地编程助手的聊天记录打包成可迁移的上下文。你可以在不同工具之间搬移一个会话,接着干活,不用再跟 AI 重新交代一遍背景。它提供 macOS 桌面应用和命令行工具,主打本地优先、不锁定用户。社区反馈有人几分钟内把 7GB 的 Cursor 会话迁到...
推荐理由:YC W26 的项目,解决的是 AI 编程工具间的上下文锁定问题。有能跑的产品(macOS 应用 + CLI),社区验证也来了——7GB 会话迁移几分钟搞定,三条 HKR 都踩中。但还在早期,用户规模未知,给 72 分放在 featured 档。
直接用大模型做分类,输出的标签没法调阈值,置信度也不靠谱。作者换了个思路:把大模型的判断结果只当成一个特征,喂给逻辑回归或 XGBoost 这类传统模型。这样只需要少量训练数据,就能解决校准和阈值控制的问题。他在 SemEval 2018 的反讽检测数据集上拿 Gemini 3.1 Flash Lite 试了一下,效果不错。如果你觉得模型不够准,也别光...
Noam Brown 是 OpenAI o1 推理模型的核心贡献者,现在在做多智能体系统。他的团队上周用一万个 AI 智能体、花了 1300 亿个 token、跑了 88 小时,解出了一个千禧年大奖难题。Brown 把多智能体看成一种并行的“推理时计算”:单个模型推理久了延迟太高,就多扔几个智能体一起干,用效率换速度。在 5.6 版本的 Ultra 模...
推荐理由:Noam Brown 是 o1 推理线的核心贡献者,这次对谈带着一个具体成果(千禧年难题)和真实数字,不是空谈。多智能体作为并行推理的框架、递归自我改进的对齐前提,这些对正在搭智能体系统的人有直接参考价值。我会先打个折:正文没披露具体是哪个千禧年难题、验证方式也没细说,但信息密度够高,值得推荐。
OpenAI 发了一套新框架,用来追踪、调查和公开模型“不对齐”——也就是模型行为偏离开发者本意——的情况,同时公布了六个内部案例,全都没影响到真实用户。这件事本质上是公关和治理层面的操作:趁监管机构和外部研究者还没动手,自己先把问题的定义权攥在手里。日本媒体盯着数据捏造这类工程细节,西方媒体更爱聊生存风险。风险在于,一家公司自己定义的框架可能会让不良...
Reddit 用户发帖称,单张 AMD Radeon R9700 显卡跑 Qwen3.8 27B 模型(NVFP4 量化),生成速度达到 153 tok/s,8 路并发时冲到 470 tok/s,预填充速度 3619 tok/s。这个速度对本地部署来说相当快,尤其是单卡跑 27B 模型。不过帖子正文被 Reddit 屏蔽了,没披露具体功耗、显存占用、散...
Unsloth 出了 Docker 镜像和桌面应用,号称零配置就能在本地训练和运行 500 多种模型,还带新 GUI 和 notebook 工作流,NVIDIA 和 AMD 显卡都支持。不过正文没披露具体性能数据或完整模型列表,安装指南倒是已经上线了。
华为在华为 Connect 大会上说,下一代 AI 训练芯片昇腾 960DT 将从原计划的 2027 年第三季度提前到第一季度发布。发言人只提了一句“性能逐年翻倍”,但没给具体的算力数字(FLOPS)和制程工艺。我会先打个折——文章完全没提良率、产能,也没说在出口管制下具体找哪家代工厂,这些才是决定能不能按时出货的关键。
推荐理由:华为把下一代训练芯片的发布时间提前了半年,这个动作本身有看点。但文章只给了一句模糊的性能描述,没披露任何算力、制程、良率或代工信息,而这些才是判断能不能按时量产、能不能跟英伟达打的关键。所以点击价值有,但信息密度不够,转发就更勉强了。
皮尤研究中心在 37 个国家做的调查显示,其中 34 个国家的大多数受访者认为 AI 会在未来 20 年内导致失业。调查是在最近那些末日警告之前做的,所以结果可能偏保守。正文没披露具体百分比和样本量,但结论很明确:全球对 AI 抢饭碗的担忧是普遍的。
Martin Fowler 在 2026 年 9 月 17 日的文章里说,他对大语言模型最强烈的感觉不是害怕也不是兴奋,而是不喜欢。他承认这些模型确实有用,引用 Jessica Kerr 的话说“不用才是不负责任”,也提到皮尤民调显示美国人觉得 AI 好用但认为对社会有害。让他不舒服的点在于:大语言模型说话带着一种让人起鸡皮疙瘩的“LLM 腔”,自信满...
推荐理由:Martin Fowler 的署名本身就有分量,在当下 AI 狂热里公开站“不喜欢”是少数声音,值得拿出来。文章有具体论据(LLM 腔、自信胡说),不是纯情绪。扣分点在于这终究是篇个人随笔,没有数据或案例支撑,但作为观点信号够了。
Instinct 和 Meta 刚上线的 Muse 都支持打电话了,用户可以让它们帮忙订餐厅或取消订阅。正文没披露打电话功能的技术细节,比如是否支持多轮对话,也没说 Instinct 的融资额。这两家正在跟 Wajo、Town、Ollie 抢文本助手市场。