跳到正文

#RAG

今日 0 条

5月21日星期四

AI HOT 精选

Perplexity 上线查询感知压缩,上下文 token 最多砍掉 70% 但回答质量反而更好

Perplexity 把一项叫“查询感知压缩”的技术用到了线上。它能在搜索时把喂给模型的上下文 token 最多减少 70%,同时回答质量还提升了。核心逻辑是“更好的上下文优于更多的上下文”,也就是先理解你问什么,再挑最相关的信息塞进窗口,而不是一股脑全丢进去。正文没披露具体测试基准和压缩方法细节,所以实际效果我会先打个折,但能省下这么多 token ...

推荐理由:我会先打个折:正文只给了一条 X 帖子,没放基准测试和可复现的设置,所以别太激动。但这条信息本身够硬——Perplexity 在生产环境用查询感知压缩,最多砍掉 70% 上下文令牌,同时回答质量还变好了。对搞外挂资料库和搜索优化的从业者来说,这直接关系到省钱和降延迟,值得看一眼。

5月20日星期三

TechCrunch · AI

Gmail 现在能直接语音问收件箱了,Google I/O 2026 上演示了用 Gemini 翻找邮件细节

Google 给 Gmail 的 AI 收件箱加上了语音对话搜索,你可以直接开口让 Gemini 帮你从邮件堆里挖出具体信息。目前正文没披露这个功能会推给哪些用户、支持什么语言、要不要额外付费、响应有多快,也没说背后是用什么检索机制把邮件捞出来的。

推荐理由:我会先打个折:这功能听起来挺方便,开车时动嘴就能查邮件里的航班号或报销金额。但正文只说了“可以语音搜 Gmail”,没交代支持哪些语言、是不是全球推送、要不要额外付费,也没讲清楚 Gemini 到底怎么从邮件里捞出答案——是直接扫全文还是先建索引。这点先别太激动,等有实测再判断到底省不省事。

5月19日星期二

新智元 · 公众号

港中大和浙大团队认为,现在 AI Agent 的“记忆”只是备忘录,不是真记忆

这篇文章的正文被微信环境验证挡住了,具体实验细节看不到。从标题和现有摘要看,港中大和浙大的研究者戳破了一个常见说法:主流 AI Agent 的记忆模块,本质上是把过往信息存起来、用的时候再检索出来,相当于一个备忘录,而不是真正具备推理能力的记忆。他们指出,处理需要组合多个步骤的任务时,这种检索式记忆需要的案例数会按 k² 增长,成本很高。另外在一个叫 ...

推荐理由:我会先打个折:这篇不是模型发布,而是研究信号,但信号很强。标题把“记忆”的谎言直接戳破,正文用 Ω(k²) 和 90% 攻击成功率两个数字把问题量化得很清楚,不是空谈风险。对做 Agent 和外挂资料库的人,这三个点——记忆退化、检索投毒、案例爆炸——都是实打实的工程隐患,所以 H、K、R 全中。

5月17日星期日

Hacker News 首页

Semble:给 AI 编程助手用的代码搜索工具,比 grep 省 98% 的 token

MinishLab 开源了 Semble,一个专为 AI 编程 agent 设计的代码搜索工具。它把轻量级语义嵌入(Model2Vec)、传统关键词匹配(BM25)和融合排序(RRF)串在一起,最后再用重排序模型精排结果。在 63 个代码仓库的测试里,它的搜索质量达到 NDCG@10 0.854,每次查询在 CPU 上大约只要 1.5 毫秒。最直接的好...

推荐理由:Semble 的卖点很直接:给代码 agent 用的搜索工具,比 grep 加 read 少花 98% 的 token,CPU 上跑一次大概 1.5 毫秒。这个数字我会先打个折,因为基准测试里的 grep 用法可能不是最优的,但方向是对的——用传统检索加轻量重排来替代把整个代码库塞进上下文,确实能省不少钱和延迟。正文没披露重排模型的具体大小和准确率对比,这点先别太激动。整体还是工具链层面的改进,影响力到不了必须写的地步,但对做 coding agent 的人来说值得一试。

5月16日星期六

量子位 · 公众号

阿里健康给医生做了个新工具“青灵子”,把 BMJ 顶刊十年全文和循证流程塞了进去

阿里健康发布了一款叫“青灵子”的医疗 AI,目标用户是中国 500 万医生。它直接拿了 BMJ 集团旗下 70 本期刊过去十年的全文内容做知识底子,不是只搜摘要。回答问题时,模型会按 PICO 框架(把临床问题拆成患者、干预、对照、结局)和 GRADE 证据分级来走流程,相当于先框定问题结构再给答案,而不是自由发挥。产品还拉了 300 多位临床专家做审...

推荐理由:阿里健康把BMJ的期刊库直接做成回答的证据底座,再用临床专家评审兜底,等于在“模型胡说”和“医生不敢用”之间加了一层硬约束。正文没披露评审通过率、更新频率和实际延迟,这些会直接影响医生愿不愿意买单。我会先打个折:方向对,但落地效果还得看真实诊疗场景的反馈。

5月15日星期五

r/LocalLLaMA

实测外挂资料库客服机器人:最贵的模型表现最差,真正管用的是这几招

作者搭了一个客服用的外挂资料库(RAG)问答机器人,用模型当裁判打分,把质量分从 6.62 拉到了 7.88,同时单次会话成本从 $0.002420 砍到 $0.000509,降了将近八成。最反直觉的发现是:最贵的模型反而是表现最差的。真正起作用的动作包括给检索环节加日志、对召回的资料块做去重、收紧模型回答时对资料的依赖程度,以及用五款模型做了一轮横向...

推荐理由:我会先打个折:这是个人实验,不是大规模生产验证,样本量和场景都有限。但作者把调优过程拆得很细,从最贵的模型翻车开始,一步步讲怎么换模型、调检索参数、改 prompt,最后质量涨了成本还大降。对正在搭外挂资料库问答的工程师来说,这些实操细节比论文里的基准分有用得多。正文没披露具体用了哪些模型和评估集,这点有点可惜,但不妨碍它作为一份诚实的调参笔记入选。

AI HOT 精选

Databricks 把 GPT-5.5 接进企业智能体工作流,在 OfficeQA Pro 上首次突破 50% 准确率

Databricks 通过自家的 AI Unity Gateway,把 GPT-5.5 用在了 AgentBricks 和 Agent Supervisor API 搭建的智能体工作流里。在专门考验模型处理扫描件、老旧文件和长文档能力的 OfficeQA Pro 基准上,GPT-5.5 比上一代 GPT-5.4 的错误率降低了 46%,成了第一个准确率...

推荐理由:GPT-5.5 被 Databricks 接进企业智能体工作流,在 OfficeQA Pro 上准确率首次过半,错误比 GPT-5.4 少了 46%。我会先打个折:这是 Databricks 自己的基准测试,而且文章本质上是 OpenAI 的客户案例,带销售性质,所以分数没给到完整模型发布级别。但对企业 AI 团队来说,这条信息在选型和落地判断上确实有参考价值。

AI HOT 精选

IBM 开源多语言嵌入模型 R2:不到 1 亿参数,32K 上下文,检索跑分在同级里最高

IBM 在 Hugging Face 上发了两个新的多语言嵌入模型,都走 Apache 2.0 协议。小号 9700 万参数,在 MTEB 多语言检索上拿了 60.3 分,正文说这是目前所有开源同尺寸模型里最高的。大号 3.11 亿参数,得分 65.2,在 5 亿参数以下的开放模型里排第二。两个模型都基于 ModernBERT,支持 200 多种语言(...

推荐理由:HKR 三项都过:一个不到 1 亿参数、支持 32K 上下文的多语言嵌入模型,给 RAG 开发者提供了一个轻量开源选项。影响面不如前沿模型发布那么大,放在 featured 档刚好。

AI HOT 精选

OpenEvidence 覆盖 65% 美国医生,靠医生自己拿执照号注册,医院一开始不知道

OpenEvidence 说它已经覆盖了 65% 的美国医生,4 月临床场景用了 2700 万次,平均每个医生一个月用 41 次。医生是自己在手机上用执业编号注册的,医院起初并不知情,Mount Sinai 的 AI 负责人管这叫“影子 AI”,意思是基层医生自己先大规模用起来了,医院后来才追着签企业合作。OpenEvidence 把这说成是美国医疗史...

推荐理由:我会先打个折,因为正文没披露收入模型、责任划分和效果验证,这些缺口让分数没法再往上走。但 65% 医生覆盖和 2700 万次月使用量是实打实的规模数据,加上医院不知情的影子 AI 叙事,对从业者来说既有冲击力又有警示意义,所以保持在 82 分是合理的。

r/LocalLLaMA

MOOSE-Star:用 7B 小模型和 10 万篇论文做科学假设发现,ICML 2026 接收

MiroMind 放出了 MOOSE-Star 系列,包含三个 7B 模型和一个叫 TOMATO-Star 的数据集,里面有 108,717 篇 NCBI 论文。其中 MS-IR-7B 在“灵感检索”任务上准确率到了 54.37%,底子是 DeepSeek-R1-Distill-Qwen-7B,fp16 跑起来大概占 14GB 显存,支持 llama....

推荐理由:我会先打个折:正文没披露 54.37% 这个准确率是在什么基准上测的、对比了哪些方法,所以这个数字先别太激动。但整套东西的钩子很实在——用 7B 小模型加 10.8 万篇 NCBI 论文搭一个科学假设发现的流程,fp16 才 14GB,本地就能跑。对想做科研 RAG 或让模型进文献分析流程的团队来说,这是个现成的起点,数据集和模型权重都公开了。

5月14日星期四

AI HOT 精选

OpenSquilla 用本地路由和缓存把大模型传输量砍掉九成以上

OpenSquilla 这个开源项目把模型路由决策放在本地跑,不花 token 就能判断问题难易:简单问题丢给便宜模型,复杂问题才上强模型。它靠增量发送和缓存命中把实际传输的 token 量压到原来的十分之一以下。记忆模块会在上下文快满时自动挑重点压缩,还支持混合检索。正文没披露具体测试场景和模型阵容,所以这 90% 的降幅在什么任务上测出来的还不清楚...

推荐理由:我会先打个折:信息来自一篇 X 上的项目帖,仓库实际活跃度、测试环境和局限性正文都没披露,所以别急着全信。但它的思路很实在——用本地路由和缓存把要传给大模型的 Token 砍掉九成,等于把“外挂资料库”和推理优化打包成一个开源工具。对正在想办法压推理成本的小团队来说,哪怕只实现一半效果也值得关注。

5月13日星期三

AI HOT 精选

开源 psql_bm25s:让 PostgreSQL 做 BM25 检索,比 pg_search 快 23 倍

团队把 psql_bm25s 开源了,它是一个 PostgreSQL 原生访问方法,直接在数据库里跑精确的 BM25 检索。在标准基准测试上,它比 pg_search 快大约 23 倍。这个速度提升意味着,在多智能体系统里,检索不再拖后腿,也不用额外烧钱,智能体查数据能快很多。正文没披露具体测试用的数据集、硬件配置和查询类型,所以这个 23 倍先打个折看。

推荐理由:我会先打个折:这是单方开源发布,没有独立复现和线上生产环境的约束说明,所以别急着当最终结论。但“23 倍”这个数字确实抓人,它说明用原生访问方法在 Postgres 里跑 BM25 可以省掉不少外部依赖和延迟,对把 Postgres 既当主库又当检索库的团队是个省钱省运维的信号。正文没披露并发写入下的性能退化、索引构建耗时和资源占用,这点先别太激动。

TechCrunch · AI

Anthropic 也下场了,给律所做了五类文书自动化工具

Anthropic 发布了一套面向律所的工具,覆盖文档检索与审阅、判例法资源查找、庭前证词准备、文书起草等五类事务性工作。文章没披露具体定价、上线时间和背后用的是哪个模型,也没给出实际律所的测试数据。我会先打个折——目前看更像是一个产品方向声明,能不能在合同审查这种容错率极低的场景里用,还得等更多验证。

推荐理由:Anthropic 这次不是发模型,是直接卖法律行业工具,把文档搜索、审查、判例调取、证词准备和起草这五件事串成一个产品。我会先打个折:正文没披露定价、客户数量和底层模型有没有专门为法律微调,所以现在还看不出是认真做行业方案还是先占个坑。但方向本身值得关注,因为法律文书工作量大、容错率低,能跑通一部分就能验证 AI 在专业服务里的付费意愿。这点先别太激动,等看到实际律所采用数据和准确率再说。

5月10日星期日

r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

5月7日星期四

Computing Life · Share · 鸭哥调研

Agent 文件系统:从“喂给模型记忆”到“让模型自己翻文件”

这篇文章梳理了 AI agent 外置记忆方案的三代演化:从把所有东西塞进上下文窗口,到用向量数据库做外挂记忆,再到 2025 年下半年兴起的“把文件系统当上下文用”。核心转变是让 agent 自己按需去文件系统里找信息,而不是开发者预先推送。文章解释了为什么这个模式现在成立:模型天生会操作文件系统、上下文窗口的成本已经高到不可忽视、渐进式披露能利用模...

推荐理由:这是一篇设计评论,不是产品发布或论文。它把 Agent 文件系统拆成三代,对比了 Turso、Anthropic、Vercel 和 Manus 的不同判断,还点出四个盲区,对做 Agent 的人有参考价值。信息量和相关性都够,但性质偏评论,所以放在 featured 而不是更高一档。

5月6日星期三

The Verge · AI

Google 的 AI 搜索摘要开始引用 Reddit 帖子了

Google 更新了 AI 搜索功能,会在摘要里直接展示来自 Reddit、社交媒体和论坛的“第一手观点”预览,把搜索词和相关的网络讨论串起来。官方说这是为了满足越来越多人在搜索时想看到真人建议的需求。不过公告没提这个功能具体什么时候、在哪些地区上线。对搜索团队来说,核心问题是 AI 摘要如何引用和排序这些用户生成内容来源。

推荐理由:我会先打个折,因为正文没写覆盖范围和上线时间,所以重要性停在 76 的产品更新档位是合理的。钩子够强——Google 把 Reddit 这种论坛内容塞进 AI 摘要,搜索的流量分配逻辑可能又要变。新事实是 perspectives 预览机制,但具体怎么触发、哪些讨论会被选中都没说。风险点很实在:UGC 来源的引用和排序机制一旦偏了,小站和原创作者会更难拿到流量。这点先别太激动,等看到实际覆盖数据再调整判断。

r/LocalLLaMA

一个用公司内部数据测 RAG 的开放基准,模拟了 9 种数据源和 10 类检索失败模式

EnterpriseRAG-Bench 放出了一个 50 万文档的语料库,专门用来测 RAG 在公司内部数据上的表现。它模拟了 Redwood Inference 的 9 种数据源,并围绕 10 种检索失败模式设计了 500 个问题。基线测试显示,BM25 在整体上优于向量检索,而基于 agent/bash 的检索方式虽然完整度最高,但成本和延迟也明显更高。

推荐理由:HKR 三项都站得住:基准瞄准了企业 RAG 的真实痛点,50 万文档加上 BM25 反直觉的结果有话题性。不过来源只有一篇 Reddit 发布帖,信息密度还不到当天必写的程度,所以放在 featured 里。

5月5日星期二

Hacker News 首页

Airbyte 给 AI 助手做了个“统一资料库”,查多系统数据能省 90% 的 token

Airbyte 推出了 Airbyte Agents,核心是一个叫 Context Store 的东西。你可以把它理解成一个专门给 AI 助手用的预索引资料库,把 Slack、Salesforce、Zendesk 这些业务系统里的数据提前整理好。这样助手在回答问题时,不用再现场去调几十次 API 拼凑信息。作者举了个例子:一个原本要跑 47 步才能回答...

推荐理由:HKR 三项都站得住:预索引这个角度比市面上又一层 MCP 包装有信息量,给了可复现的 token 节省数字,痛点也打在企业数据接入的成本和可靠性上。Airbyte 不是前沿模型厂,所以留在 featured 低段。正文没披露 Context Store 的索引延迟和更新频率,这点先别太激动。

5月4日星期一

r/LocalLLaMA

Gemma 4 E2B 在 8GB 安卓手机上跑得动,还搭了个本地语音笔记 App

一位 Reddit 用户把 Gemma 4 E2B(2.4GB 模型)塞进 8GB 内存的 OnePlus CE 5 手机里,做了个完全离线的语音笔记应用。流程是:Whisper Small(244MB)先把语音转成文字,Gemma 4 E2B 再负责把文字拆成笔记并打标签。录一段 10 到 15 秒的语音,从转录到出结果总共花 12 到 15 秒。搜...

推荐理由:这是 Reddit 个人项目帖,不是官方发布,但信息量够。作者把 Whisper Small 转写和 Gemma 4 E2B 分类都塞进手机,还搭了检索管道(查询扩展、多路全文搜索、RRF 融合,可选 Gemma 重排,超时 15 秒回退),工程细节比很多官方 demo 实在。我会先打个折:没提功耗、发热和长时间稳定性,12-15 秒延迟对语音笔记算可用但不算快。如果是真的,2.4GB 模型在 8GB 手机上跑通整套流程挺省钱,对想做离线 AI 应用的人有参考价值。

5月3日星期日

r/LocalLLaMA

Upskill 开源了一个技能注册表,让 AI 代理动手前先查“说明书”,已收录超 1 万个技能

Autoloops 把 Upskill 做成了开源项目,相当于给 AI 代理配了一本可检索的技能黄页,目前索引了超过 1 万个技能。代理在干活前会先来这里查一下有没有现成的工具或流程可用。搜索靠的是 Postgres 全文检索、1024 维向量匹配,再按收藏数、安装量和反馈做重排序,尽量把靠谱的技能往前排。入库时有专门的对抗性审查,用大模型拦下了几百个...

推荐理由:Autoloops 这个 Upskill 开源项目,本质是给 Agent 配一个可查询的技能黄页,1 万+ 索引量不算大但起步够用。我会先打个折:正文没披露实际检索延迟和重排效果数据,也没说这 1 万+ 技能的质量分布,所以实用性还得看社区后续填充。安全侧的 LLM 对抗审查是个加分项,但拦截几百个技能这个数字本身说明不了漏检率。整体是个方向对、实现也实在的开源工具,Agent 开发者值得关注,但别指望开箱即用。

4月27日星期一

Hacker News 首页

TurboQuant 走读:把 AI 向量压到每个数 2–4 比特,还不怎么掉精度

这篇交互式文章把 TurboQuant 的核心思路拆了一遍。它要解决的是怎么把模型里的高维向量(比如 KV 缓存、嵌入向量)压到每个坐标只占 2 到 4 个比特。做法很取巧:先给向量随机转个方向,转完之后每个坐标的数值分布就固定了,近似一个钟形曲线。接着用一套提前算好的通用码本去套所有输入,省掉了给每组数据单独算缩放因子的开销,也不需要训练或校准。文章...

推荐理由:我会先打个折:这不是模型或产品发布,只是一篇技术走读,所以重要性停在 76。但 HKR 三项都站得住——钩子够具体,机制解释有新东西,成本角度也切中当前推理优化的刚需。正文没给大规模验证数据,这点先别太激动,但思路本身值得一看。

4月23日星期四

TechCrunch · AI

Google 要把 AI 概览塞进你的工作 Gmail 里了

Google 在 Cloud Next 大会上宣布,会把类似搜索结果的 AI 概览功能搬到企业版 Gmail 里。你可以用大白话提问,比如问项目进度、发票情况或差旅细节,AI 会直接跨多封邮件抓取信息,生成一段简短的总结,不用你一封封点开看。这个功能默认开启,前提是管理员已经打开了 Gemini for Workspace 和 Workspace In...

推荐理由:Google 要把 AI 自动摘要塞进企业版 Gmail,不是给单封邮件划重点,而是跨多封邮件直接生成总结。这点和普通邮件摘要不一样,更像是在收件箱里加了一层工作流收束。但正文没写什么时候上线、哪些套餐能用、背后模型是什么,所以我会先打个折。HKR 里 K 和 R 都过了,H 偏弱,整体放在 featured 低档就行。

4月22日星期三

X · @dotey(宝玉)

Google 把 Gemini Deep Research 拆成两个版本:一个求快求省,一个烧算力出深度报告

Google 把 Gemini Deep Research 拆成了标准版和 Max 版,背后都是 Gemini 3.1 Pro 模型。标准版走速度和成本优先路线,适合嵌在产品里做即问即答;Max 版会反复搜索、推理、打磨报告,官方举的例子是分析师下班前丢一个尽调任务,第二天早上收完整报告。这次最大的变化是支持 MCP,能把 FactSet、S&P、Pi...

推荐理由:这是一次有分量的产品更新:Gemini Deep Research 拆成标准版和 Max 版,在付费 API 里公开预览,标准版偏速度和成本,Max 版给更多算力、反复搜索和推理。HKR 三项都站得住,但官方没公布定价、调用限制和两版实际性能差距,所以分数压在 78-84 这个区间。

4月18日星期六

量子位 · 公众号

RAG 搜对了文档却答错?德国萨尔大学团队找到病根,ACL 2026 长文收录

萨尔大学团队发现,很多 RAG 系统翻车不是因为没搜到资料,而是模型读不懂搜回来的文档。他们提出 Disco-RAG,在检索和生成之间加了一层“阅读理解”:先用修辞结构理论把文档拆成论证树,再建跨段落关系图,最后生成大纲来引导回答,全程不用额外训练。论文在 Loong、ASQA、SciNews 几个数据集上都有提升,但正文没给出具体分数,这点先别太激动。

推荐理由:这篇论文的卖点不是又刷了一个榜,而是把 RAG 的故障点拆开了:检索没问题,问题出在生成前的理解环节。我会先打个折,因为正文没完整披露三个基准上的具体分数,外部复现也还没看到,所以分数停在 80。但诊断结论本身对从业者有用,值得放进 featured。

4月17日星期五

TechCrunch · AI

Google 的 AI Mode 现在能在桌面端 Chrome 里把网页和对话窗口并排打开

Google 在 4 月 16 日给桌面端 Chrome 的 AI Mode 加了一个并排浏览功能:你在 AI Mode 里点开一个链接,网页会在右侧打开,左侧的对话窗口不会消失。这样你一边看网页,一边可以接着问 AI 问题,AI 会结合当前页面内容和全网信息来回答。比如挑咖啡机时,你可以让 AI 直接告诉你某款好不好清洗。正文没提这个功能的具体推送范...

推荐理由:Google 把搜索对话和网页浏览塞进同一个工作流里,不再是“搜完就走”或“聊完再点”。正文给了上下文保留和页面+全网回答的机制,但覆盖范围、上线节奏和地区限制都没说,所以重要性先打个折,放在 featured 里观察。

4月7日星期二

X · @dotey(宝玉)

Milla Jovovich 和开发者发布开源记忆系统 MemPalace,声称 LongMemEval 满分,但被指只测了检索、没测端到端问答

MemPalace 想解决 AI 对话一结束就失忆的问题:不靠 AI 自己挑重点,而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来,全部本地运行,不依赖云服务。它配套了一个叫 AAAK 的压缩语法,号称能把上下文压到 30 倍,但实测压缩后检索准确率从 96.6% 掉到 84.2%,差了 12 个百分点,无损压缩不会这样。项目宣称的 LongMem...

推荐理由:我会先打个折,满分这事别太激动。项目亮点是全本地运行、不用云服务,AAAK 压缩语法号称能把上下文压到原来的三十分之一,MCP 接入后能调 19 个工具翻历史记录。但 Penfield Labs 直接指出这个满分只测了检索,不是端到端问答,而且用上 AAAK 后检索准确率反而从 96.6% 跌到 84.2%,说明压缩是有代价的。正文没披露模型规模、硬件要求和实际延迟,这些缺口让实用性还不好判断。明星光环和开源旗号能带来关注,但技术验证还得看后续实测。

4月4日星期六

X · @dotey(宝玉)

Mintlify 给 AI 文档助手造了个假文件系统,启动从 46 秒降到 100 毫秒

Mintlify 把 AI 文档助手的检索方式从向量 RAG 换成了 ChromaFs——一套用数据库查询模拟 grep、cat、ls 的假文件系统。AI 以为自己在一个真实的文件系统里翻文档,实际上每个命令都被拦截翻译成 Chroma 查询。效果是会话启动时间从沙箱方案的 46 秒压到 100 毫秒,每次对话的边际计算成本几乎为零。按他们月均 85 ...

推荐理由:Mintlify 这篇工程博客写得很实在,没有吹概念,而是把方案和取舍摊开来讲。核心思路是把文档页映射成“文件”、章节映射成“目录”,让模型用熟悉的命令行工具去探索,背后实际是数据库查询。效果很直观:启动时间从 46 秒砍到 100 毫秒,边际计算成本接近零。我会先打个折——这个方案强依赖文档本身有清晰的层级结构,正文也承认不适合无层级知识库,所以别把它当成万能 RAG 替代品。但它的真正价值不在省钱,而在检索范式的切换:不是把资料塞给模型,而是让模型自己动手翻。这点对正在折腾 agent 检索链路的人,比单纯跑分更有启发。

4月3日星期五

X · @claudeai

Claude 全系套餐都能直连微软办公三件套了

Anthropic 把 Microsoft 365 连接器开放给了所有 Claude 付费套餐,不再只限高价版本。你可以把 Outlook 邮件、OneDrive 文档和 SharePoint 文件直接拽进对话里,让 Claude 帮你翻邮件、总结文档或从公司资料库里找东西。帖子确认了覆盖范围和对接的应用,但没提权限边界怎么划、管理员要不要额外配置、有...

推荐理由:这是一条中等体量的 Claude 产品更新:Anthropic 把 Microsoft 365 连接器铺到所有方案,改变了 Outlook、OneDrive 和 SharePoint 的实际接入范围。HKR 三项都踩中,但正文没披露价格、权限边界、地区限制和管理后台条件,所以只能放在 featured 低段。我会先打个折——全量放开比加新功能更值得盯,但缺的信息让人没法判断企业能不能直接推。

X · @op7418(歸藏)

Karpathy 用 Obsidian 和大模型搭了一套本地知识库,把原始资料自动整理成可提问、可写报告的 Wiki

Karpathy 的做法是把原始资料扔进一个叫 RAW 的文件夹,让大模型自动生成摘要、索引、概念页、相互链接和可视化图表,最终形成一个本地 Markdown Wiki。之后可以直接在这个 Wiki 上提问,模型会查索引、读相关文档再给出回答或生成新文件、网页甚至 PPT,并把输出存回知识库。他特别提到 AI 生成的内容会污染语料,要把可信来源和 AI...

推荐理由:HKR-H 和 HKR-R 都站得住,因为 Karpathy 这种级别的从业者公开自己的本地 Wiki 工作流,本身就自带讨论度,而且他点出的“AI 生成内容会污染库,最好跟可靠来源分开”是个很实际的痛点。HKR-K 靠的是 RAW→LLM→摘要/索引/互链这条具体管线,但正文没披露用了什么模型、资料规模多大、自动化脚本怎么写,所以知识增量卡在中等偏上,分数停在 76 合理。

2月27日星期五

36 氪 · 直链

抖音把资讯交给AI:长文上限提到8000字,AI写的新闻摘要也要进信息流了

抖音在2025年底正式上线了长图文功能,字数从内测时的4000字放宽到8000字,目前只能在网页端发布。内容多是深度故事、社会新闻这类非即时性的东西。同时,抖音热点频道里多了个“AI智选资讯”,AI会实时抓取全网热点,自动生成新闻摘要和总结。内部人士说,这些AI资讯很快会进入抖音的信息流,跟原创长文抢同一批流量。字节的思路很明确:用AI把内容生产成本打...

推荐理由:抖音把长文和 AI 资讯塞进同一个流量池,但正文没交代推荐权重、版权怎么谈、事实错了谁兜底。我会先打个折:功能上线是真的,可责任边界没画清楚之前,别急着把它当内容生态升级。

2月9日星期一

36 氪 · 直链

小红书把搜索框改成了语音问答,想让你用说话代替打字来搜生活经验

小红书在1月27日全量上线了“语音问一问”,用户在搜索页长按就能用语音提问,最长能说三分钟,也支持外语和方言。它给出的答案不是通用百科,而是把站内用户分享的真人经验总结成结构化回复,比如剪头发怎么跟理发师沟通这种非标问题。正文没披露背后的语音识别和模型技术方案,也没提延迟和准确率数据。这次改动的核心是把搜索从三四个字的关键词匹配,拉长到口语化的长句提问...

推荐理由:小红书把搜索框改成能长按语音提问,这事我会先打个折——正文没披露用的什么语音识别方案、模型延迟和准确率,所以实际体验稳不稳还不好说。但值得盯的是,它把原本短关键词搜索变成了长语音问题入口,等于在抢更细颗粒度的查询需求。对AI从业者来说,这是内容平台用语音+外挂资料库做搜索的落地样本,虽然技术细节缺位,但产品方向和上线节奏本身就有信号意义。

1月19日星期一

Import AI

我的 AI 特工已经在干活了,你的呢?

Jack Clark 描述了他让多个研究型 AI 特工在他爬山、睡觉时替他读论文、交叉比对数据、生成分析报告的经历。这些活如果他自己干,每份报告得花一周,而特工们几小时就搞定了,读的论文还比他多。他还提到,让 Claude 帮他爬自己网站、做嵌入向量、搭本地搜索和图形界面,以前试了好几年都因为各种卡顿没做成,这次不到一小时全跑通了。正文没披露具体模型版...

推荐理由:Jack Clark 用自己走路睡觉时 agents 并行处理几千篇论文的例子,把 agent 从概念拉到了实操。可复现的机制是多代理检索、交叉核验和报告生成,但正文没披露模型版本、成本、失败率和评测数据,所以先别太激动。真正值得盯的是工作流摩擦已经低到可以忽略,AI 开始从单次问答转向持续代办,这点对从业者来说比任何 benchmark 都更有说服力。

1月6日星期二

NVIDIA 博客

NVIDIA 把跑千亿参数大模型的机器塞进了桌面

NVIDIA 在 CES 上展示了两台桌面设备 DGX Spark 和 DGX Station,能在本地跑 1000 亿到 1 万亿参数的开源模型。DGX Station 有 775GB 的统一内存,可以把模型压缩到 NVFP4 格式,压缩率最高 70%,跑 llama.cpp 时推理速度平均提升 35%。现场还演示了每秒处理 25 万个 token ...

推荐理由:HKR 三项都站得住:桌面跑大模型的 hook 够强,性能数字和演示数据把事实撑住了,而且整件事指向本地开发闭环能不能替代部分云端迭代这个真问题。不过说到底这是英伟达的产品发布,性能证据都来自厂商自己的演示,我会先打个折,所以重要性停在 75 分。

2025年5月28日星期三

2025年5月27日星期二

Mistral AI

Mistral 发布 Agents API,内置连接器与 MCP 工具

Mistral 发布 Agents API,将自家语言模型与代码执行、网页搜索、图像生成和 MCP 工具等内置连接器结合,并提供跨对话的持久记忆与智能体编排能力。

推荐理由:官方给出 Agents API 的连接器、记忆与编排能力,读者可据此判断智能体平台的落地方式。

2025年4月9日星期三

2025年3月11日星期二

OpenAI News

OpenAI 发布 Responses API 和 Agents SDK,把搜索、操作电脑等工具直接做进接口里

OpenAI 在 3 月 11 日推出了专门用来搭 AI 代理的一套新工具。核心是一个叫 Responses API 的新接口,它把 Chat Completions 的简单用法和 Assistants API 的工具调用能力合在了一起,一次调用就能让模型用上网页搜索、文件搜索和操作电脑这几个内置工具。同时发布的 Agents SDK 用来编排单代理或...

推荐理由:我会先打个折:这不是一次普通的功能追加,而是 OpenAI 在 agent 开发入口上的一次明确换轨。Responses API 当天开放,内置了网页搜索、文件搜索和电脑操作三个工具,计费方式也透明——按标准 token 和工具用量算,不额外收 API 费。更值得盯的是迁移信号:OpenAI 计划在功能对齐后,于 2026 年中让 Assistants API 退役。这对已经在 Assistants API 上搭了东西的团队来说,是个必须关注的倒计时。正文没披露具体功能对齐的清单,也没说迁移工具什么时候给,这点先别太激动。

2025年3月7日星期五

Mistral AI

Mistral AI 发布文档理解 OCR API Mistral OCR

Mistral AI 发布光学字符识别 API Mistral OCR,可接收图片和 PDF,按顺序输出交错的文本与图像,并理解表格、公式、LaTeX 等复杂版式。

推荐理由:官方给出 Mistral OCR 的基准对比、多语言表现与定价,可据此判断文档解析在 RAG 流程中的可用性。

2025年2月10日星期一

OpenAI News

OpenAI 与北欧最大媒体集团 Schibsted 达成合作,把旗下报纸内容直接接进 ChatGPT 做新闻摘要

ChatGPT 会开始用 VG、Aftonbladet 等北欧大报的文章来回答用户的新闻类问题,覆盖 3 亿用户。回答里会标明出处和媒体品牌,方便读者去原站核实。公告没提授权费怎么分、合同签了多久、具体能用哪些文章。Schibsted 的 CEO 说这是为了在 AI 平台越来越影响信息获取方式时,早点进去摸索怎么让高质量新闻在 AI 环境里继续赚钱。他...

推荐理由:OpenAI 自己发的合作消息,产品效果很具体:Schibsted 旗下几家报纸的内容会以带来源标注的摘要形式出现在 ChatGPT 里,覆盖 3 亿用户。我会先打个折,因为正文没写合作期限、授权范围和钱怎么分,这些关键信息都空着。但值得留意的是,授权新闻正进一步嵌入 ChatGPT 的主回答链路,不再只是外挂搜索导流,这对媒体分发和平台信息控制权都有影响。

2025年1月15日星期三

OpenAI News

OpenAI 和 Axios 达成内容合作,还出钱帮它在美国四个城市扩张本地新闻

OpenAI 宣布跟 Axios 签了内容合作协议,同时提供资金,帮 Axios 把本地新闻业务开到匹兹堡、堪萨斯城、博尔德和亨茨维尔这四个新城市。OpenAI 说现在合作的媒体机构接近 20 家,覆盖 160 多个新闻出口、几百个内容品牌和 20 多种语言。ChatGPT 的搜索功能会展示合作方的摘要、节选、出处和原文链接。正文没披露这次合作的具体金...

推荐理由:OpenAI和Axios的合作本身不算大新闻,但公告里透出的规模数字和Search展示方式挺实在。我会先打个折,因为资助金额和技术条款都没说,没法判断Axios到底拿了多少好处、模型具体怎么用他们的内容。不过对做AI应用和媒体的人来说,这相当于看到了一张更清晰的“AI搜索引用地图”:160多家机构、20多种语言,意味着引用和流量分配的模式在快速定型。这点值得留意,哪怕公告本身有点PR味。