想让 AI 学会你自己的数据?
这周群里有条本地新闻:有成员查到,Anthropic 在新西兰注册了公司(新西兰公司注册处有记录)。头部 AI 公司开始在本地落地——而几乎同一时间,群里另一场讨论也绕着"本地"转,只不过这次是技术层面:怎么让 AI 学会你自己的数据?
话头是一位从基督城来的新成员起的:
"群里有没有人在研究 self-learning 的 AI 系统?比如让 AI 把一个系统里所有的数据库、Laravel model 自己学会,然后用户可以去问它这个系统里的所有信息。" —— 群友(Christchurch)
这是几乎每个想给自己业务上 AI 的人都会撞到的问题。韦红松一句「自建本地知识库?」先点出了方向,群里的讨论随后收敛出三条现实的路。
三条路:RAG、LORA、本地部署
把文档切块、建向量索引,提问时先检索出相关段落,再让模型基于这些段落回答。最主流、最快上手,答案有出处。群里多位成员的第一反应都是它。
给大模型挂一个轻量的 LORA 适配器,用你的领域数据训练,让模型"记住"你的专业。数据太专、太多时,比纯 RAG 更贴合。
本地 embedding + 向量索引 + 本地大模型——数据全程不出内网。这正好接上上一篇《数据能不能出国?》:涉 PII 的行业,让 AI 学会数据的前提,是数据不出境。
先搞懂几个词
讨论里飞了一堆术语。如果你是非技术背景,先花一分钟把这几个词弄明白,后面就好懂了:
- RAG(检索增强生成)
- AI 回答前,先去你的资料库里"查资料",把最相关的段落找出来喂给它,再作答。好处是答案有出处、资料随时能更新、不用重新训练模型。
- Embedding(向量化)
- 把一段文字变成一串数字(向量),意思相近的文字数字也相近。这是"按意思检索"的地基——搜"怎么退款"能找到写着"退货流程"的段落,靠的就是它。
- 向量库 / 向量索引
- 专门存这些数字向量的数据库。提问时它能在海量段落里,秒级找出意思最接近的几段。
- LORA(低秩适配微调)
- 不动原模型,给它挂一个很小的"外挂补丁",用你的数据训练这个补丁,让模型带上你的领域知识与风格。比重训整个模型便宜得多。
- Gaussian Splatting(高斯泼溅)
- 群里聊到的 3D 街景重建技术:用一大团带颜色的"光点云"表示空间,能从普通照片重建出可自由转视角浏览的 3D 场景。
RAG 到底行不行?
讨论里出现了分歧,也正是最有价值的地方。有成员泼了冷水:
"感觉 RAG 出来的效果不好。科研项目做论文库用过,但和 Claude 这种超大参数模型一起用,有点多余。" —— 满天星
Rorschach 补充了更细的判断:数据太专太多时,还是得找个开源模型做 LORA 或加 RAG;他还提到 Claude 有个 "dream" 功能,但本质还是在整理上下文。胡小奕也建议,RAG 可以先拿一些开源方案试试看。
Arthur 的回应,是这场讨论里最实用的一段——它把"RAG 行不行"这个是非题,拆成了一组工程参数:
"不能只是说 RAG 的效果不行。它有很多实现方式。真正要考虑的是:知识库的大小、形态(文字和图片类的,还是视频类的)、以及 embedding 的方式。这些参数调整不同,都会影响模型输出的效果。" —— Arthur
换句话说,"RAG 不好用"往往不是 RAG 的错,而是知识库形态和 embedding 没调对。同样一套 RAG,喂纯文本和喂图文混排,效果天差地别。
前沿一瞥:不用 RAG 的新方向
有意思的是,Arthur 正好在研究一个可能颠覆这套流程的新架构——Google 开源的 Always-On Memory Agent。它的主张很激进:不要向量库、不要 embedding、不要 RAG,只让一个 LLM 持续不断地读、想、写,就能构建出真正可用的长期记忆。
它最像人脑的一点:有个组件会每 30 分钟自主运行一次,像人在睡眠中整理白天的记忆一样,回顾未整合的信息、寻找关联、生成跨领域的洞察——不需要任何提示词。它自己生成过的一条洞察,恰好点破了这件事:
"AI 工具的下一个瓶颈,是从静态 RAG 向动态记忆系统的转型。"
不过别急着抛弃 RAG。这类新架构还很早期,而 RAG 仍是当下最成熟、最可控、出错也最好排查的方案。知道有新方向在路上,比盲目追新更重要。
更深一层:四种范式之争
把这场讨论拉高一层看,"让 AI 用上你的数据"其实有四种范式,它们解决的是不同的问题——想清楚区别,选型就不会乱:
知识放在模型外面,用时现查。知识可随时更新、答案有出处、成本低——但模型每次只看到检索命中的碎片,缺乏全局理解,检索没命中就答不好。
2026 年主流模型的上下文窗口已到百万 token 级,很多场景可以把整份资料直接塞进去让模型一次读完。简单直接,但更贵、更慢,而且资料一多,中间部分容易被"读漏"(大海捞针问题)。
把知识和风格训进模型权重,让它"成为"某个领域的专家。擅长塑造风格与专业语感,但知识固化、更新要重训,而且常常学会了腔调却记不准事实。
如 Always-On Memory,让 AI 持续读写、自主整理记忆。最接近人类意义上的"真正学会",但目前最不成熟、最难控制。
真正的前沿趋势,不是"谁取代谁",而是融合:长上下文让 RAG 少检索几次、每次给得更全;Agentic RAG 让 AI 自己决定何时查、查几轮、要不要换个问法再查;GraphRAG(把知识连成图谱再检索)补上了普通 RAG 缺的全局关联;而记忆架构想把这一切整合成一个会自我进化的系统。四条线正在往中间走。
但对本地落地的中小企业,务实的顺序反而很清晰:先用 RAG 跑通(便宜、可控、有出处);数据大而专了,再上 LORA;需要全局理解时,用上长上下文;记忆架构这类,放进观察清单,别拿生产系统当小白鼠。技术选型的成熟度,永远要匹配你能承受的试错成本。
没有唯一答案
这场讨论和上一篇《数据能不能出国?》是一条线的两截:数据留在本地之后,下一个问题就是怎么让本地的 AI 真正"学会"这些数据。RAG、LORA、本地部署,还是新的记忆架构——选哪条,取决于你的数据规模、形态和场景,不存在一个放之四海皆准的答案。