ragflow知识库搭建全流程

RAGFlow知识库搭建全流程——小白也能上手的保姆级教程

你是不是也这样?电脑里堆满了PDF、Word、网页收藏,真正要用的时候翻半天找不到。想做个AI知识库,一看教程全是代码,头都大了。别慌,今天手把手教你用RAGFlow搭建自己的本地知识库,全程30分钟,不需要你会写代码!

一、什么是RAGFlow?为什么要搭建自己的知识库?

先说说RAGFlow是什么。简单讲,它是一个开源的知识库搭建工具,能把你电脑里的各种文档(PDF、Word、TXT、Markdown等等)导入进去,然后你就可以像跟ChatGPT聊天一样,问它文档里的内容。

举个例子:你导入了公司的员工手册,以后想知道"年假怎么休",直接问一句,它就能从手册里找到答案并告诉你,还会标注出答案出自哪一页。

这就是RAG(检索增强生成)技术——大模型不直接瞎编,而是先在你的文档库里"翻书",找到相关内容,再结合大模型的理解能力给你回答。这样既保证了答案的准确性,又不会产生幻觉。

更重要的是,所有数据都存在你自己的电脑上,不上传云端,隐私安全有保障。

二、准备工作:硬件、软件与模型

开始之前,先检查一下你的电脑够不够格。

1、硬件要求与系统支持

  • 内存:建议16GB以上(8GB也能跑,但会有点吃力)
  • 硬盘:预留至少20GB空间
  • 系统:Windows、macOS、Linux都支持

放心,普通家用电脑完全够用。

2、Docker环境安装

RAGFlow是基于Docker部署的,所以先得装上Docker。别被"Docker"这个词吓到,你可以把它理解成一个"应用商店",RAGFlow就是商店里的一个应用。

Windows用户
去Docker官网下载Docker Desktop,双击安装,一路下一步就行。安装完后重启电脑,桌面上会出现一个鲸鱼图标,打开它,等左下角显示绿色就说明好了。

Mac用户
同样去官网下载Docker Desktop,拖进Applications文件夹,打开后等顶部菜单栏的鲸鱼图标变绿。

Linux用户
打开终端,执行:sudo apt install docker.io docker-compose(Ubuntu为例)

3、获取大模型

RAGFlow本身不包含大模型,你需要准备一个。推荐用Ollama来管理模型,它就像一个"模型管家",下载和运行模型都很简单。

去Ollama官网下载安装,装好后打开终端,执行:

ollama pull deepseek-r1:7b

这条命令会下载DeepSeek的7B模型,大概4GB左右,等它下完就行。如果你电脑配置一般,也可以下载更小的模型,比如qwen2:1.5b

三、RAGFlow部署:三步搞定

这一步最核心,跟着我来,不会有问题。

1、拉取项目代码

打开终端(Windows叫命令提示符或PowerShell),执行:

git clone https://github.com/infiniflow/ragflow.git
cd ragflow

如果你电脑上没有Git,直接去RAGFlow的GitHub页面点击"Download ZIP"下载压缩包解压也行。

2、修改配置文件(可选)

用记事本打开docker-compose.yml文件,找到端口映射那几行。默认是80:80,如果你电脑上80端口已被占用,可以改成8080:80,这样之后访问就用http://localhost:8080

3、启动容器服务

在ragflow目录下执行:

docker compose up -d

第一次启动会下载镜像,大概需要几分钟到十几分钟,取决于你的网速。看到终端里出现"done"字样就说明启动成功了。

打开浏览器,访问http://localhost(如果你改了端口就是http://localhost:8080),能看到登录界面,说明部署成功!

四、创建你的第一个知识库

1、登录RAGFlow管理界面

默认账号密码是admin/admin,登录后记得改密码。界面是中文的,非常友好。

2、接入大模型

进入"设置"→"模型提供商",点击"添加模型"。选择Ollama,填入你本地Ollama服务的地址(一般是http://localhost:11434),然后在模型列表里选择你刚才下载的deepseek-r1:7b

同样的方式,再添加一个Embedding模型(向量化模型),推荐用bge-m3bge-large-zh,这些都是免费的开源模型。

3、上传文档并创建知识库

回到首页,点击"创建知识库",给它起个名字,比如"我的工作资料"。然后点击"上传文档",把你电脑里的PDF、Word、TXT文件拖进去就行。

RAGFlow支持多种格式:PDF(含扫描件)、DOCX、PPTX、Excel、Markdown、TXT、图片等等,基本覆盖了日常所有文件类型。

4、设置解析参数

上传完文档后,需要设置"解析器"。这个简单理解就是告诉系统"怎么读你的文档":

  • General:通用模式,适合大多数文档
  • QA:如果你的文档是问答格式,选这个效果更好
  • Manual:适合说明书、操作手册类文档

切片大小一般用默认的就行,不用改。

点击"开始解析",等进度条走完,你的知识库就建好了。

五、测试效果:让AI回答你文档里的问题

1、创建对话应用

在左侧菜单找到"对话"或"应用",点击"创建应用"。给应用起个名字,然后在"知识库"一栏勾选你刚才创建的知识库,模型选择你接入的DeepSeek模型。

2、提问测试

现在你就可以在对话框里提问了。比如你上传了员工手册,就问:"请病假需要什么手续?"

系统会先在你的文档里检索相关内容,然后生成回答。注意看回答下方,会有引用标注,点一下就能跳转到原文对应的位置,非常方便。

试试问几个你真正关心的问题,感受一下效果。如果回答准确率不高,别急,下一节有优化方法。

六、进阶技巧与避坑指南

1、切片大小怎么调?

切片大小直接影响检索效果。切得太小,可能丢失上下文;切得太大,检索精度下降。

一般建议:技术文档用512-1024字符,新闻文章用256-512字符。你可以在知识库设置里调整,多试几次找到最适合你文档的数值。

2、选什么Embedding模型?

Embedding模型决定了"AI理解你文档的能力"。推荐几个:

  • BGE-M3:BAAI出品,中英文都好用
  • BGE-large-zh:中文场景首选
  • text2vec-large-chinese:中文效果好

这些都可以通过Ollama一键下载,不用折腾。

3、常见报错怎么办?

"端口被占用":改docker-compose.yml里的端口号,比如改成8080。

"Ollama连接不上":检查Ollama服务是否在运行,终端执行ollama list看看。

"解析失败":换一种解析器试试,或者检查文档是否损坏。

"回答不准确":先确认你的文档里确实有相关内容,再调整切片大小或换Embedding模型。

七、总结:你的私人知识管家已上线

到这里,你的RAGFlow本地知识库已经搭建完成了。回顾一下整个流程:

  1. 装好Docker和Ollama
  2. 用Docker启动RAGFlow
  3. 接入大模型
  4. 上传文档创建知识库
  5. 开始提问

整个过程不需要写一行代码,全部通过界面操作。以后不管是工作文档、学习资料还是个人笔记,都可以交给RAGFlow来管理。想查什么就问什么,比翻文件夹效率高太多了。

当然,如果你不想折腾Docker这些环境配置,也可以试试像AI材料柜这类开箱即用的工具,导入文档就能直接用,同样支持本地存储,更省心一些。

如果你在搭建过程中遇到问题,欢迎在评论区留言。也别忘了把这篇教程收藏起来,说不定哪天就用上了!

posted @ 2026-07-08 11:00  叉里巴巴  阅读(46)  评论(0)    收藏  举报