跳到正文

#RAG

今日 0 条

9月23日星期三

Hacker News 首页

Stripe 内部上线知识型 AI 平台 Kai,83% 员工每周在用

Stripe 把写代码 agent 的经验搬到了非编程的知识工作上,做了一个叫 Kai 的内部平台。它接入了公司内部超过 1000 个工具,销售、财务、法务都能用它做深度调研、生成文档或者准备合规审查。上线两周大部分 Stripe 员工就开始用了,现在 83% 的人每周都在用,市场销售团队几乎全覆盖。Kai 不是一个单一应用,而是一套 API 加一个叫...

推荐理由:Stripe 自己博客发的单公司案例,没有外部验证,我会先打个折。但 83% 周活和销售团队几乎全覆盖这些数字是硬指标,不是公关话术,所以还是给了 featured。

9月18日星期五

GitHub Blog · AI & ML

GitHub Podcast 拆解 AI 热门观点:该不该读代码、RAG 是否已死、Skills 是否杀死了 MCP

GitHub Podcast 最新一期拆解了五个 AI 热门观点:AI 生成的代码仍需阅读和负责,但审查力度应按风险分级;Skills 与 MCP 解决不同问题,前者是打包的团队经验,后者是连接工具与数据的标准,可组合使用;RAG 并未死亡,它为模型提供训练数据之外的相关信息,减少 token 浪费并让回答更有依据。

9月17日星期四

Hacker News 首页

Manticore Search 新增自动分块功能,长文档向量搜索不再悄悄丢内容

Manticore Search 现在可以在建表时直接设置自动分块。给向量列加上 chunk_strategy,它就会把长文档切成小块,分别做嵌入,搜索时在所有块里找。他们拿 189 页的 Manticore 手册测试,对于超出模型窗口的内容,召回率从 55% 跳到了 83%,代价是内存多用了约 1.5 倍、写入时间变慢约 3 倍。查询端不做分块,只切...

9月15日星期二

r/LocalLLaMA

jinfer:一个纯 Java 写的 AI 推理引擎,把大模型塞进 jar 包,不用装 Python

mukel90 发了个新项目 jinfer,是个完全用 Java 写的推理引擎,支持聊天、视觉、语音转文字、文本嵌入、重排序和语音合成。它不依赖 Python、ONNX 或任何外部进程,能直接读写 gguf 和 safetensors 格式的模型。作者说 CPU 上的性能已经能和 llama.cpp 掰手腕,GPU 支持还在开发中。项目已经接入了 Sp...

9月14日星期一

Hacker News 首页

2026年AI就业市场:谁在被抢、谁在拿高薪、哪些岗位正在消失

Maksim Ilin 把 LinkedIn、世界经济论坛、斯坦福、普华永道和贝恩的数据拼在一起,画出了 2026 年 9 月的 AI 就业图景。最抢手的岗位是 AI 工程师,就是把大模型塞进产品里干活的人,美国周均新增约 1550 个职位,年薪中位数 17.6 万美元。最顶尖的是前沿实验室的研究科学家,Anthropic 年薪中位数约 74.6 万美...

推荐理由:一篇个人博客把几份公开报告的数据揉在一起,给出了 2026 年 9 月 AI 岗位的薪资和需求全景。数字具体、来源可查,对从业者有直接参考价值。扣分是因为本质上是二手数据整合,不是一手调研,权威性有限,所以停在 72 分。

9月7日星期一

Computing Life · Share · 鸭哥调研

裁员潮之后,撞墙的公司正在把人招回来

Klarna 2024年高调宣布AI客服顶700人,14个月后CEO承认质量下滑并重新招人。这不是孤例:IBM、福特、澳大利亚联邦银行都在AI减员后撞墙回撤。根子在于高管看的是平均指标,但损害全发生在最难的那6%的尾部问题上。Meta内部数据更直观:代码变更量涨了220%,用户可见的新功能只涨36%,重大事故涨了40%。Stanford研究发现,22到...

推荐理由:这篇文章不是一手爆料,但把 Klarna、IBM、福特、澳洲联邦银行几个 AI 减员后回撤的案例串在一起,再用 Meta 的内部数据做支撑,形成了一个完整的叙事闭环:从高调替代到悄悄回招。对 AI 从业者来说,这比单纯讲技术突破更有参考价值,因为它直接回答了'现在 AI 落地到底卡在哪'。信息密度和可读性都够,给 82 分。

8月28日星期五

Computing Life · Share · 鸭哥调研

域模型的第三条路:一家175年公司花4000万美元给出的答案

Thomson Reuters花了4000万美元,在阿里的开源模型Qwen上做法律数据的后期训练,自报法律评分超过了Anthropic Haiku 4.5。纯算力成本只要10到20万美元,真正烧钱的是他们175年攒下的判例法数据库、几百位专家的人工标注,以及一套能拉开分数差距的评测系统。三年前,Bloomberg烧了多得多的钱从零训练一个500亿参数的...

推荐理由:这篇文章给出了一个很具体的行业模型路线:不从头训,也不纯靠API,而是拿开源模型做后期训练,用私有数据和专家标注建立壁垒。Thomson Reuters花了4000万,但纯算力成本低得惊人,真正烧钱的是数据资产和评测体系,这点对从业者很有启发。文章还拉了三年前Bloomberg从零训500亿参数模型的失败案例做对比,让结论更扎实。自报评分超过Haiku 4.5这点我会先打个折,毕竟评测集是自己出的,但整体逻辑和成本透明度足够,不是PR稿,值得推荐。

Hacker News 首页

一套不用框架、在 Colab 上免费跑的 AI 工程师实操笔记

calmrocks 在 GitHub 上放出了一组 Colab 笔记本,面向 AI 工程师和前线部署工程师。内容覆盖了模型 API 调用、结构化输出、工具调用、外挂资料库(RAG)、把评测当主心骨的开发思路、从零手写 agent 循环、工具设计、安全护栏、MCP、Skills、微调与 LoRA 的对比、提示词注入攻击、LLMOps 以及客户落地技巧。所...

推荐理由:一套免费 Colab 笔记本,把 RAG、agent、微调、安全这些环节串起来了,而且不依赖任何框架,评测驱动、从零手写 agent 循环。对一线工程师来说实用价值很高。分数定在 72,因为目前还是个人开源项目,没有社区验证或多方讨论,我会先打个折。

8月26日星期三

Hugging Face 博客

Hugging Face 教你微调多向量嵌入模型:一张 RTX 3090、14.5 小时,就能在自家数据上打败通用检索器

Sentence Transformers v6.0 新增了 MultiVectorEncoder 模型类型,专门做 ColBERT 那种“晚交互”检索——也就是查询和文档各自编码成多个向量,最后再逐 token 算分,比单向量模型更精细。这篇博客手把手教你怎么微调这种模型,作者用一张 RTX 3090(24GB 显存)只跑了 14.5 小时,训练出一...

8月25日星期二

Latent Space

吴恩达把 DeepLearning.AI 押注在 AI 工程上,从一万多条招聘里提炼出四项核心技能

吴恩达重新定位了 DeepLearning.AI,不再只教模型,而是教人怎么把 AI 用进工程里。团队扒了一万多条招聘信息,又做了一堆访谈和问卷,最后圈出四个关键能力:第一是构建和部署 AI 应用,核心是跑通严格的评估和错误分析循环,别让系统行为靠运气;第二是软件工程基本功,提醒那些只会“感觉流编程”的人,不懂取舍就指挥不动编程智能体,产出会很差;第三...

推荐理由:吴恩达亲自下场定义 AI 工程师的技能树,而且用了一万多条招聘数据做支撑,不是空谈。我会先打个折,因为这是 newsletter 转述,原文在付费墙后面,细节有限,但信息本身对从业者判断该补什么能力很有参考价值。Featured 级别合理,毕竟这相当于行业老将给了一张新地图。

8月21日星期五

Computing Life · Share · 鸭哥调研

听着厉害,和真的厉害

这篇文章把技术圈里的“厉害”拆成了两种:一种是机制真的顶用,能在生产环境扛住边缘案例;另一种是一句话听着就能改变世界。ChatGPT 靠一个被嫌弃的聊天框和三十秒自证,两个月拉来一亿用户;AutoGPT 用一句“自主完成任务”的漂亮话拿到十万星,核心却只是个 for 循环,跑几步就崩。GraphRAG 句子和机制听着都前沿,但索引一小段文本能烧掉十五美...

推荐理由:一篇把技术圈的“厉害”拆成两种的行业观察:一种是机制真能在生产环境扛住边缘案例,另一种是一句话听着就能改变世界。用 ChatGPT、AutoGPT、GraphRAG 三个案例把叙事泡沫和工程扎实的差距讲透了,每个数字都落在成本、稳定性、验证强度上,不画饼也不写论文摘要。作为观点文章而非突发新闻,信息密度和可读性都到位,但缺少跨信源交叉验证,所以定在 78 分、featured 档位。

8月10日星期一

Computing Life · Share · 鸭哥调研

搜索没有变便宜,但 Agent 把它拆成了新的供应链

2026年冒出一堆Agent Web Search API,不是因为做搜索变简单了,而是交付对象从人换成了模型。模型不看广告,只要干净正文和URL引用,这让原本打包在一起的抓取、召回、解析、压缩可以拆开单卖。Serper直接透传Google结果,Exa缩小索引范围只抓高质量技术站点,Tavily专注给外挂资料库做网页降噪和文本压缩,AWS则把内部爬虫基...

推荐理由:一篇很实在的行业分析,没有产品推销感。作者把 Agent 搜索 API 的四种打法讲得明明白白,核心论点——搜索没变便宜,是供应链被拆开单卖了——有具体的技术对比撑着。扣分点在于对 AWS 那部分的成本拆解偏弱,正文没给出具体定价对比,只能靠读者自己查。

8月6日星期四

Computing Life · Share · 鸭哥调研

OpenAI 内部数据 Agent 把 RAG 的检索对象从原始日志换成了离线精编的高密度上下文

OpenAI 的内部数据 Agent 服务 3,500 多人、覆盖 600 PB 数据,在线部分只用了一个 GPT-5.5 模型和约 13 个工具。真正的工作发生在提问之前:用 Codex 去读数据管道的代码,把表名、字段含义这些藏在代码里的业务逻辑提前写成结构化的描述,在线 RAG 再去检索这些加工好的材料。工程师 Emma Tang 说,给模型更少...

推荐理由:这是目前对 OpenAI 内部数据 Agent 工程做法拆解得最清楚的一篇。离线用 Codex 做语义编撰、在线只跑轻量 RAG 的思路,对正在搭企业知识库和 Agent 的团队有直接参考意义。扣分是因为这是第三方分析,不是 OpenAI 官方发布,部分细节来自推测,我会先打个折。

8月3日星期一

AI HOT 精选

UEmbed:一个模型同时输出稀疏和稠密两种多模态向量

UEmbed 用一个纯解码器模型,在一次前向推理里同时吐出两种向量:稀疏向量(像关键词匹配,但能学到语义)和稠密向量(纯语义压缩)。做法是在输入末尾加 N 个可学习的特殊 token,把整个词表切成 N 份,每个 token 只负责预测自己那份词表上的权重,最后拼成一个完整的稀疏向量。论文发了 2B、4B、9B 三个尺寸,都用公开数据训练。9B 版在 ...

推荐理由:这篇把稀疏和稠密嵌入塞进一个解码器模型,一次前向就出两种向量,对搜索和外挂资料库场景是实打实的简化。9B 模型基准分好看,但正文没披露推理延迟和实际部署情况,这点先别太激动——没落地数据,我只能打个折,给 featured 而不是 must-write。

7月25日星期六

Computing Life · Share · 鸭哥调研

OpenAI Presence:把现场失败修成下次能跑通的规则,装进了产品

OpenAI 在 7 月 22 日发布了 Presence,一个面向客服、外呼销售等具体岗位的企业语音和聊天 agent 产品。它的核心卖点不是模型能力,而是把 agent 卡住转人工之后的改进流程做成了标准功能:系统自动保存失败时的完整运行上下文,团队可以在沙盒里复现问题、修补规则、跑回归测试,再通过 Codex 改代码下发。这相当于把驻场工程师(F...

推荐理由:OpenAI 把企业 agent 部署里最头疼的环节——失败后怎么改——做成了标准产品功能,机制写得够具体。分数没给更高是因为目前只有单篇分析,缺多方验证、官方定价和实际客户规模数据,我会先打个折。

7月24日星期五

Hacker News 首页

大模型还是不会算数、活在旧数据里,我们只是用外挂把坑填上了

作者拿 GPT Sol High 跑了 200 道加法,错了一道。模型不是在算,是在猜下一个数字长什么样。ChatGPT 能算对,是因为外面的程序把题目丢给了 Python 脚本。文章顺着这个思路拆了另外三个老毛病:知识停在训练截止日,靠外挂资料库(RAG)补;上下文窗口有限;模型骨子里还是有毒。真正的进步不在模型本身,而在包在它外面的那层工具。

推荐理由:这篇文章从一道加法错题切入,把大模型四个老毛病——算数靠猜、知识过时、记性短、骨子里有毒——挨个拆了一遍。作者没写公关稿,直接说进步来自外挂工具而不是模型本身,对天天用 AI 写代码的人是个清醒提醒。我会先打个折:正文没给毒性测试的具体样本,但实验部分和判断够实在,值得放在推荐位。

7月19日星期日

Hacker News 首页

AI 狂热正在摧毁全球决策能力

作者过去一年半经手公司销售和技术项目,并和全球约三百位从业者聊过,结论很直接:他看到的企业 AI 项目成功率是 0%。内部聊天机器人没人用,因为公司文档质量差,模型读不到没写下来的东西。对外客服机器人说话自然,但会悄悄丢掉请求——作者找三菱汽车求助,机器人答应回电,六个月过去毫无音讯。管理层回避追踪真实用量,对外却宣称生产力大幅提升。核心问题不全是 A...

推荐理由:这篇不是硬新闻,是作者基于一年半一线经验和三百人访谈写的评论,但信息量够硬:0% 成功率、三菱客服机器人放鸽子、管理层只看宣称不看用量。我会先打个折,因为全是单方观察,没有对照数据,但反叙事角度和具体案例让它值得放在 featured 里。

7月15日星期三

AI HOT 精选

金山办公发布 WPS Comate,一个能直接调用公司数据、跑自动化任务的 AI 办公客户端

金山办公在 2026 AI 生产力大会上推出了 WPS Comate,定位是给员工用的 AI 办公客户端。它不只是聊天框,而是能接入公司的数据、系统和流程,按岗位调用 AI 专家去完成具体业务,比如跑自动化任务,而不是只给文字建议。产品包含六个模块:AI 岗位专家、Skill 技能生态、自动化任务、团队协作空间、Wiki 知识库和应用广场。数据安全方面...

推荐理由:产品形态有区分度——不是套壳聊天框,用技能和自动化把 AI 从建议推到执行。但这是发布会,不是实测,实际跑起来效果未知。金山不是基础模型厂商,行业影响力中等。72 分,我会先打个折,等有真实用户反馈再往上调。

7月8日星期三

Computing Life · Share · 鸭哥调研

模型窗口不是无限大的垃圾桶:为什么智能体需要上下文治理

给智能体接上几十个工具后,用户一句简单提问会被淹没在工具定义、日志和抓取数据里。Anthropic 的 MCP 沙箱把 15 万 token 的工具定义压缩到约 2000 token 的高信号输入;Google ADK 把智能体状态拆成工作上下文、会话记忆和文件制品,中间产物默认不占窗口;Manus 在生产环境里输入输出 token 比约 100:1,...

推荐理由:HKR 三项都踩中了,有新鲜比喻、有跨框架的工程数字对比,读起来不像是公关稿。扣分是因为这是个人博客而非官方发布,且摘要截断在论证中途,信息完整度打了折扣,所以 featured 低段给 78 分。

6月24日星期三

Computing Life · Share · 鸭哥调研

Claude Tag 拆开看:技术上没那么新,但企业授权的对象变了

Claude Tag 把 AI 塞进 Slack 当常驻同事,能主动插话、记住频道聊天。但拆开看,底下还是给 HTTP 端点发请求,记忆存的是原始聊天记录,不是组织经验。真正的变化在另一层:企业开始把 agent 当成需要正经授权、设预算、记审计的非人类执行体来管。微软的 Entra Agent ID 直接把 agent 当企业目录里的一等公民,定价也...

推荐理由:这篇没在复述功能,而是把 Claude Tag 拆成两层:表层是 Slack 里的主动插话和频道记忆,底层还是调 HTTP 端点,记忆也没做结构化提炼。真正的看点被拉到企业授权逻辑的转变上——微软 Entra Agent ID 直接把 agent 当目录里的独立身份来管,配权限、设预算、记审计。这个角度对从业者来说比技术细节更有用,因为落地卡住的往往不是模型能力,而是“这个 agent 到底算谁”。

TechCrunch · AI

Anthropic 推出 Claude Tag,让 AI 同事直接蹲在 Slack 频道里读消息学公司业务

Anthropic 发了个叫 Claude Tag 的新功能,相当于在 Slack 里塞了一个常驻 AI 同事。它不是那种你问一句才答一句的机器人,而是会持续读频道里的历史消息,慢慢攒出一套对公司业务、项目背景和团队默契的理解。你可以直接在消息里 @ 它问事,它会结合之前看过的上下文来回答,不用每次都重新交代背景。这招挺聪明:把组织里散落的信息变成 C...

推荐理由:Anthropic 给 Claude 加了个 Slack 集成,叫 Claude Tag。它不等着你问,而是持续读频道历史消息,自己攒出一套对公司业务和项目背景的理解。你 @ 它问事时,它直接用之前攒下的上下文回答,不用每次都重新交代一遍背景。这个产品形态挺新鲜,不是常见的问答机器人,机制上也和标准的外挂资料库检索不同。TechCrunch 的报道点出了关键:Slack 重度用户会想尝鲜,但也会担心一个 AI 天天读聊天记录的安全问题。我会先打个折,因为正文没披露它具体怎么处理权限和隐私边界,实际落地效果也还没验证。

6月22日星期一

AI HOT 精选

微信在首页左上角灰度测试 AI 助手“小微”,能发消息红包,也能在群聊里读聊天记录

小微目前有两个入口。首页左上角的主入口只能给好友发消息和红包,红包需要手动确认,读不了聊天记录,也不能往群里发消息。群聊和私聊里的“问小微”子入口权限更大,可以读聊天记录,也支持群发。小微能建日程提醒、待办,总结朋友圈,还能打通公众号和视频号来回答问题。它的收藏功能只能看到小微自己建的笔记。内置的“小工具”可以用语音创建简易小程序,暂时不能发布,但可以...

推荐理由:微信的 AI 助手“小微”开始灰度内测,两个入口的权限设计是这次最值得看的地方。首页左上角的主入口只能给好友发消息和红包,红包还得手动确认,读不了聊天记录,也不能往群里发;群聊和私聊里的“问小微”子入口权限更大,能读聊天记录、支持群发。功能上能建日程提醒、待办、总结朋友圈,还能打通公众号和视频号来回答问题,收藏功能只认自己建的笔记。内置的“小工具”可以用语音创建简易小程序,但暂时不能发布。正文没披露灰度范围和全量时间,这点先别太激动。

6月10日星期三

r/LocalLLaMA

ICML 论文提出可预测幻觉的“回答-弃权”闸门,并开源 ntkMirror 免训练实现

这篇 ICML 2026 论文给证据型问答任务设计了一个 ISR=1 的闸门:模型在不确定时直接闭嘴不答,而不是硬编。他们同时放出了 ntkMirror,一个免训练的开源实现,能在本地模型上跑。做法是让模型对同一问题看多份不同排序的证据,如果几次回答不一致就弃权。在留出的审计集上,幻觉率压到了 0.0%–0.7%,代价是大约 24% 的问题被主动弃权。...

推荐理由:这篇 ICML 论文和配套的 ntkMirror 实现,核心思路不复杂:让模型对同一问题看几份顺序不同的证据,回答不一致就闭嘴不答。在审计集上幻觉率确实压得很低,但约四分之一的问题被弃权,这个代价得看场景能不能接受。论文限定在证据型问答,别急着往开放域对话上套。开源免训练能本地跑是个加分项,但正文没披露不同模型尺寸下的延迟和资源消耗,实际部署前最好自己测一下。

6月9日星期二

AI HOT 精选

德国法院裁定:谷歌 AI 概览是谷歌自己的话,说错了要负责

德国慕尼黑地区法院在一项临时禁令中认定,谷歌必须为 AI 概览生成的虚假内容直接担责。起因是谷歌的 AI 概览错误地把两家慕尼黑出版商跟诈骗、订阅陷阱等黑产扯上了关系,而这些指控在 AI 引用的链接原文里根本不存在。法院的核心逻辑是:AI 概览不是传统搜索结果,它会用自己的话重新组织、评判信息,属于谷歌自己生产的内容,所以不能套用搜索引擎的间接侵权保护...

推荐理由:这篇值得看,因为德国慕尼黑地区法院给了一个很具体的判例:谷歌 AI 概览把两家出版商跟诈骗、订阅陷阱扯上关系,但引用的链接原文里根本没这些内容。法院的逻辑是,AI 概览不是简单罗列搜索结果,而是用自己的话重新组织、评判信息,这就算谷歌自己生产的内容,不能再用搜索引擎那套间接侵权保护来免责。我会先打个折,这只是地方法院的临时禁令,不是终审也不是全球规则,但信号已经很明确——模型胡说八道,平台得自己扛。对做 RAG 外挂资料库和 AI 搜索的产品来说,这个判例直接关系到合规风险和产品设计。

The Verge · AI

NotebookLM 换上 Gemini 3.5,能帮你搜资料,还塞了个云端电脑进去

Google 给笔记工具 NotebookLM 换了新模型 Gemini 3.5,官方说回答会更准更靠谱。现在你不用先丢一堆笔记或 YouTube 链接进去,直接问一个话题,它就能用 Google 搜索帮你找相关材料,等于把研究起点又往前挪了一步。另外还提到了一个“云端电脑”功能,但正文没展开讲具体能干什么、怎么用,这点先别太激动。

推荐理由:这是一次中等体量的产品更新,亮点是“云端电脑”和搜索式研究入口,但定价、铺开范围和实际效果正文都没给,所以别急着下结论。HKR 三项都踩中了:概念有钩子、功能有干货、场景够贴地,但信息缺口也明显。

6月7日星期日

AI HOT 精选

Harness-1:一个用强化学习练出来的200亿参数检索子智能体,能记住搜索状态

UIUC 和 Chroma 发布了一个叫 Harness-1 的检索子智能体,参数量 200 亿,基于 gpt-oss-20b 训练。它被放在一个“有状态搜索框架”里用强化学习训练,简单说就是模型在搜索时能记住上一步干了什么,再决定下一步怎么查,而不是每次都从头瞎找。在 8 个基准测试上,它的平均整理召回率是 0.730,比目前最好的开源子智能体高出 ...

推荐理由:HKR三项都站得住:Harness-1把强化学习和有状态搜索结合,机制讲得明白,基准测试结果也给了具体数字。分数定在78-84区间,因为它是个子智能体的研究发布,不是大厂主力模型,但开源圈确实需要这种能打的检索方案。

6月6日星期六

AI HOT 精选

谷歌给企业级 Gemini 搭了个“多代理协作”的外挂资料库框架,查事实类问题准确率最高提升 34%

谷歌研究院和谷歌云一起搞了个叫“跨语料库检索”的框架,用在 Gemini 企业智能体平台上,本质是让多个 AI 代理分工合作:一个负责理解问题并拆解计划,一个负责改写查询词,一个负责把问题路由到最合适的数据库,还有一个反复去搜、去验证。这套流程比传统 RAG(给模型外挂资料库直接查)在事实类数据集上准确率最多高出 34%。文章没细说测试用的具体数据集规...

推荐理由:谷歌把 RAG 拆成多个代理分工干活,在事实类数据集上准确率最多高出 34%,这个数字挺抓人。不过文章没披露测试用的具体数据集规模和难度,所以这个 34% 的含金量得打个折看。另外,框架绑在 Gemini 企业平台上,有给自家云服务带货的味道,所以分数没给到纯研究框架那档。

6月4日星期四

r/LocalLLaMA

英伟达放出 Nemotron-3-Ultra 超大 MoE 模型,550B 总参数但只激活 55B,最低要 8 张 H200 才能跑

英伟达在 Hugging Face 上发布了 Nemotron-3-Ultra-550B-A55B-BF16,一个混合专家(MoE)模型。总参数量 550B,但每次推理只激活其中 55B 参数,相当于用 55B 模型的算力去撬动大得多的知识容量。上下文窗口拉到 1M token,能一口气处理很长的文档。硬件门槛不低,官方列的最低配置是 8 张 H200...

推荐理由:这条消息干货集中在规模和硬件门槛上:550B 总参数、55B 激活、100 万 token 上下文,最低 8×H200 或 16×H100。我会先打个折——正文没给任何基准测试分数、许可证细节和具体开放时间,所以没法判断实际效果和可用性。亮点是硬件要求本身就是一个筛选器,能直接筛出一批会认真评估的人。缺点也明显:没有性能数据,光看参数和上下文长度,只能说明“理论上能处理很长的内容”,但不知道推理质量怎么样。这点先别太激动。整体属于有信息量但缺验证的发布,适合放进 featured 提醒大家关注后续评测。

6月3日星期三

The Verge · AI

英国裁定:谷歌必须让网站主能拒绝内容被 AI 搜索功能抓取

英国竞争与市场管理局(CMA)对谷歌提出新要求:网站主现在可以把自己的内容从 AI 搜索概览(AI Overviews)这类功能里撤出来,也能禁止谷歌拿这些内容去微调自己的 AI 模型。说白了,就是给了内容方一个“别用我的东西训练你”的选项。不过正文没披露这个退出机制具体怎么操作、是统一开关还是按功能细拆,也没说谷歌需要在多长时间内落实。

推荐理由:我会先打个折:正文没写具体时间表和违规处罚,所以重要性停在 80 分。但这条消息本身够硬——英国 CMA 要求 Google 让网站能选择不进入 AI Overviews,并且不能偷偷用这些内容微调模型。对做 AI 搜索和 RAG 的人来说,这意味着外挂资料库的入口可能被掐掉一部分,模型能用的公开数据也会变少。如果是真的落地,出版商至少多了一个谈判筹码,Google 的 AI 搜索训练管道也得改。

5月30日星期六

量子位 · 公众号

帮 Gemini 拿下 IMO 金牌的建模负责人,差点去当了职业钢琴家

这篇文章讲的是 Yi Tay,他在 Gemini Deep Think 拿到 IMO 金牌级成绩时担任建模联合负责人。他 2023 年参与创立了 Reka AI,639 天后又回到了 Google DeepMind。文章还提到他 2012 年就考过了 Trinity 古典钢琴副学士文凭,差点走上职业演奏的路。不过正文因为微信环境验证拦截,具体技术细节和...

推荐理由:这是一篇人物特写,不是 Gemini 能力发布稿。核心价值在于 Yi Tay 在 IMO 金牌成果里的具体角色、他创办 Reka 又回归的经历,以及 639 天这个精确时间跨度。文章没展开技术细节,所以重要性停在人物和行业信号层面,76 分放在 featured 档是合适的。

5月29日星期五

TechCrunch · AI

Glean 年收入突破 3 亿美元,帮企业砍 AI 预算成了它的核心卖点

Glean 的年收入跨过 3 亿美元,一年翻了三倍,哪怕科技巨头也杀进了企业 AI 搜索这个赛道。它现在的核心卖点不是功能多强,而是帮客户省 AI 预算。不过正文没披露利润率、客户数量,也没说清楚具体怎么帮企业砍预算,这点先别太激动。

推荐理由:这篇信息量偏薄,给了收入数字和“省钱”这个卖点,但省钱机制、客户规模和利润情况全是空白。我会先打个折:钩子够抓人,事实有增量,可验证性弱,适合放在 featured 里偏低的档位。

5月28日星期四

The Verge · AI

CNN 起诉 Perplexity,指控其 AI 答案引擎直接复制付费墙后的文章

CNN 在纽约法院起诉了 AI 搜索公司 Perplexity,说它的 AI 答案工具会“逐字”复制 CNN 的报道,甚至把原本锁在付费墙后面的内容直接喂给用户。CNN 在诉状里提到,他们试过屏蔽 Perplexity 的爬虫,但对方没理会,照样抓取记者采写、编辑的内容,既没授权也没付钱。

推荐理由:CNN 告 Perplexity 这事,核心是 AI 搜索把付费内容直接吐给用户,还抄得一字不差。对从业者来说,这直接关系到模型输出怎么规避版权雷区,以及跟媒体谈授权时对方会拿什么说事。目前还只是起诉阶段,没判决也没产品改动,所以先别当定论看,但信号已经够强了。

AI HOT 精选

Mistral 开源了一套搜索工具包,把数据灌入、检索和评测拆成可替换的模块

Mistral 发布了 Search Toolkit 的公开预览版,一个开源框架,把搜索系统拆成数据接入、检索和效果评估三层,每层都定义了统一接口。你可以把它部署在云上、本地机房或者边缘设备上,按需替换里面的组件。官方说这样能省掉重复造轮子的时间,但正文没给出具体的性能基准或延迟数据,实际效果还得自己测。

推荐理由:Mistral AI 把数据喂入、检索和效果评估打包成一个开源框架,叫 Search Toolkit,现在开放公共预览。我会先打个折:这不算大新闻,但信息量够。它支持云端、本地和边缘部署,意味着你可以在自己机器上跑,不用被绑在某个云上。正文没披露具体性能对比和延迟数据,所以别太激动,但开源加评估环节这点对想自己搭资料库的团队挺实用。

5月27日星期三

AI HOT 精选

Perplexity 开源 Unigram 分词器,CPU 占用降了五六倍

Perplexity 把自家重写的 Unigram 分词器开源了,放在 pplx-garden 仓库里。这个分词器主要解决一个实际问题:现在小型的重排序模型和嵌入模型在 GPU 上跑一次只要几毫秒,但 CPU 分词那一步反而成了拖后腿的环节。他们这次重构后,CPU 占用直接降了 5 到 6 倍,等于把分词这步的延迟砍掉一大截,让整体响应更快。正文没提具...

推荐理由:我会先打个折:正文没给独立基准测试、代码仓库细节和实际部署规模,所以 5-6 倍这个数字先别太激动。但分词器确实是重排序和嵌入模型里容易被忽略的 CPU 消耗大户,Perplexity 把这块开源出来,对跑生产 RAG 和搜索管线的团队来说,省下来的算力就是省下来的钱。

5月26日星期二

r/LocalLLaMA

一位律师用 12 块 V100 显卡搭本地集群跑法律文书起草,Qwen3.5-122B 模型跑到约 50 token/秒

Reddit 上一位律师分享了自己用 12 块 32GB 显存的 SXM V100 显卡搭建本地 AI 集群的进展,专门用来起草法律文书。核心模型是 Qwen3.5-122B-A10B,在 4 块 V100 上推理速度大约 50 token/秒。这套流程里还加了一个“验证器”,会在最终文件使用前自动拦截没有真实来源的引用、日期和 Bates 编号(案件...

推荐理由:这是一篇来自Reddit的第一手实验记录,不是厂商通稿。律师自己攒16块V100跑Qwen 122B做法律文书,速度约50 tok/s,还加了引用和日期验证器来拦截幻觉,信息量扎实。我会先打个折:来源是个人帖子,权威性有限,所以放在featured低段而不是p1。但HKR三项全中——故事性强、有可复现数字、切中本地部署和合规痛点,对想自己动手的团队是个不错的参照。

5月25日星期一

r/LocalLLaMA

小模型做智能体流程不流行,不是能力不行,是商业账算不过来

这篇帖子直接点破:小模型搭的智能体方案没成为主流,跟技术能不能跑通关系不大,核心是商业风险和验证成本。作者举了两个例子——Gemma 4 31B 在 tau2-bench 上能跑到 86.4% 的准确率,DeepSeek V4-Flash 的输出 token 价格差不多是 Claude Opus 4.6 的 89 分之一,单看指标和成本都挺能打。但问题...

推荐理由:这篇文章的切入点挺刁钻——小模型 agent 栈没普及,不是性能不行,是验证层掉链子。它拿 Gemma 4 31B 在 tau2-bench 上 86.4% 的成绩和 DeepSeek 低到离谱的输出成本说事,数字本身有说服力。但更值得盯的是那个 7-9B 模型做验证时,一半到三分之二的正确答案推理链其实有缺陷,这个发现直接动摇了用小模型兜底的信心。来源是 Reddit,权威性要打个折,所以分数没给到顶,但话题本身对做 agent 落地的人很解渴。

5月24日星期日

r/LocalLLaMA

在 llama-server 网页里用原生工具做联网资料检索的实操分享

一位 Reddit 用户分享了怎么在 llama-server 自带的网页界面里,直接用 llama.cpp 的原生工具实现联网资料检索(也就是 web RAG)。他的做法分七步:先开启 get_datetime 和 exec_shell_command 这两个工具,然后让模型通过 firejail 沙箱、一个独立的 Linux 用户以及一个 Alpi...

推荐理由:这是一篇社区教程,不是模型发布或产品更新,所以权威性和覆盖面有限,但实操价值高。H、K、R 三项都成立:动手门槛低、步骤清晰、切中本地部署的痛点。我会先打个折,因为来源是个人帖子,验证强度弱,但信息量足够放进精选。

r/LocalLLaMA

视觉模型直接读 PDF vs 先 OCR 再问答:一次长文档实测

作者用 Claude Sonnet 4.5 跑了 MMLongBench-Doc 里的 30 份带图、带表格的 PDF,共 171 道题,对比两种路线:让模型直接看 PDF 画面,和先用 OCR 把文档转成文字再喂给模型。直接看 PDF 的准确率只有 52.0%,在六套方案里排第五,每次查询成本 0.2552 美元。表现最好的是 LlamaCloud ...

推荐理由:作者拿 Claude Sonnet 4.5 直接读 PDF 图片,在 MMLongBench-Doc 上跑出 52.0% 准确率,每题烧掉 0.2552 美元,比 LlamaCloud 的 OCR 管线低了 7.6 个百分点。样本只有 30 份文档、171 道题,结论别急着推广,但至少说明现在原生视觉模型处理带图表的长文档还不稳,而且贵。正文没披露具体文档类型分布和问题难度,这点先打个折。

5月22日星期五

Latent Space

AI 基础设施又添独角兽:Exa、Modal、TurboPuffer 三家同时拿到大额融资

这期主要聊了三家 AI 基础设施公司的融资进展。TurboPuffer 先确认年经常性收入达到 1 亿美元并且已经盈利,这个数字说明做向量数据库的生意可以自己造血了。Exa 完成了 2.5 亿美元的 C 轮融资,估值 22 亿美元,他们做的是 AI 搜索引擎。Modal 融了 3.55 亿美元,估值冲到 47 亿美元,业务是帮开发者更方便地跑模型和部署...

推荐理由:Latent Space 这条汇总把三笔 AI 基础设施融资串在一起,信息密度高。TurboPuffer 做到 1 亿美元年经常性收入并且盈利,说明向量搜索这类基础能力已经有客户愿意持续付费,不是纯烧钱。Exa 拿 2.5 亿美元 C 轮、估值 22 亿美元,Modal 拿 3.55 亿美元 C 轮、估值 47 亿美元,两笔都是大额后期融资,反映资本在往模型训练和推理的底层平台集中。对做 AI 应用的人来说,这些数字能帮你判断下游供应商的稳定性和议价空间。正文没展开各家具体技术指标或客户构成,所以估值背后的溢价逻辑只能看个大概,这点先别太激动。