跳到正文
r/LocalLLaMA

ByteBell 开源了一套代码索引方案:用 LLM 给每个文件生成语义信息存进图数据库,比向量、语法树和暴力塞上下文都管用

We tried vectors, ASTs, and brute-force context stuffing for code retrieval. Graphs with LLM-generated semantics worked best. Here's what we learned.

他们试了三种路线:向量相似度搜代码、用抽象语法树(AST)结构化匹配、以及直接把代码块塞进大窗口模型。最后发现,让 LLM 先给每个文件提炼出用途、摘要、业务背景、实体、类、函数、关键词和依赖关系,存到 Neo4j 图数据库里,再用全文搜索去查,效果最好。正文没披露具体评测指标和对比数据,这点先别太激动。工程上有个省钱设计:用 SHA-256 比对文件...

推荐理由:我会先打个折:文章来自 Reddit 分享,没有给出系统性的对比数据和量化指标,所以不能当正式评测看。但它的价值在于把一条反直觉的工程结论讲清楚了——向量、AST、暴力塞上下文都试过,最后是语义图赢了。做法也够具体:逐文件跑 LLM 摘要写入 Neo4j,用 SHA-256 diff 做增量更新,只重建改过的文件。这对正在搭代码检索或 agent 的人是个直接可抄的思路,踩坑记录比方法论更有用。信息缺口是没披露用了哪个模型做摘要、图查询的延迟和成本也没给,这点先别太激动。

读原文 ↗导出 Markdown