先说清楚 RAG 是什么
RAG 是”检索增强生成”的英文缩写。一句话讲明白它的工作方式:
把你自己的文档(合同、法规、笔记、PDF)切成小块,用嵌入模型变成向量,存进向量数据库;你提问时,系统先去向量库里找出最相关的几个片段,再把这些片段连同问题一起交给大模型,由模型生成答案。
关键点在于:答案的来源是你自己的资料,不是模型凭空编的。这也意味着,整套链路——向量库加上模型推理——都可以完全跑在你自己的设备上,数据不出家门。
家用 NAS 能搞一套工作知识库吗
能,但有一个原则要先立住:别把 NAS 当成跑模型的地方。
网络附加存储设备的定位是”存储加文件同步加轻量容器”,真正的模型推理放在你的个人电脑(尤其是苹果芯片的 Mac)上跑。这样一套全部本地、零出域,体验上完全可以复刻市面上的云端知识库产品,而且数据始终在你手里。
为什么 NAS 跑不了模型
检索发生时,显存(或统一内存)要同时扛两样东西:
- 嵌入模型:把文档和问题变成向量,本身是小模型,但查询时实时跑;
- 大模型推理:生成答案,查询时才加载。
显存等于两者相加。常见档位(量化之后)大致是这样:
- 八亿参数规模,约五吉字节模型加嵌入,八吉字节显存放得下;
- 一百四十亿参数,约九吉字节加嵌入,十六吉字节舒适;
- 三百二十亿参数,约二十吉字节加嵌入,三十二吉字节以上舒适;
- 七百亿参数,约四十吉字节加嵌入,六十四吉字节以上。
家用 NAS 的低配机型,无论是处理器性能还是内存、有没有独立显卡,都远远不够跑大模型。但它的处理器和内存跑一个向量库容器绰绰有余——所以分拆才是正解:存储和向量库交给 NAS,推理交给电脑。
一套零额外采购的落地架构
假设你已有:一台苹果芯片 Mac(二十四吉字节统一内存、一太字节固态硬盘),加一台网络附加存储设备(内网地址形如 192.168.1.x),加千兆内网。
- 存储设备负责:存原始文档,跑向量库容器(轻量,不需要显卡);
- 苹果芯片 Mac 负责:用本地推理框架跑大模型(一百四十亿参数规模量化版是甜点,二十四吉字节实测舒适),配一个对话前端做检索编排,定时把新文档嵌入后写入向量库;
- 全程在内网完成,零出域。
为什么苹果芯片是低成本最优解:它的统一内存直接当显存用。二十四吉字节跑一百四十亿参数甜点,四十八吉字节跑三百二十亿参数甜点,不需要独立显卡,推理框架会自动走硬件加速。
不同规模下的硬件档位
如果你想搭一套给小团队用的本地知识库,硬件需求取决于选多大参数的模型:
- 个人或小工作室,一百四十亿参数档:约十六到二十四吉字节统一内存;
- 专业档,三百二十亿参数:约三十二到四十八吉字节;
- 前沿档,七百亿参数:六十四吉字节以上。
规律很简单:模型越大,对统一内存的要求越高。先用小模型把流程跑通,比一上来追参数要务实得多。