如何快速搭建 WeKnora:RAG 知识库与智能问答完整上手指南 如何快速搭建 WeKnoraRAG 知识库与智能问答完整上手指南【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnoraWeKnora 是一个开源的 LLM 知识平台把散落的 PDF、Word、网页变成一套可检索、可推理的私有知识库文档上传后自动解析分块并建立向量索引提问时走 RAG检索增强生成流程返回带引用标注的回答。此外它还内置一个自主推理的智能体Agent和会自动维护的 Wiki 模式。读完本文你能在一台 Docker 机器上把它从零跑起来并理解答案为什么准。它能替你做三件事 场景一让合同、手册、规范文档答得上来你要做什么扔进来一堆 PDF、Word、Excel然后直接问退货条款怎么写的它怎么处理docreader 解析器把 10 多种格式统一转成文本和图片描述切成分块后向量化入库入口在 docreader/parser/你得到什么几秒内给出答案并标注答案来自哪个文档哪一段可直接点击核对场景二跨多步的复杂问题你要做什么问一个先查内部资料、再查最新公告、最后汇总的复合问题它怎么处理ReAct 智能体模式自主规划步骤循环调用知识库检索、MCP 工具和网页搜索引擎在 internal/agent/engine.go你得到什么一次对话完成多步任务每一步调了什么工具都可见场景三把原始文档变成活的 Wiki你要做什么不希望知识库是一堆死文档它怎么处理Wiki 模式让智能体把原始文档蒸馏成结构化、互相链接的 Markdown 页面你得到什么一份带编辑历史、行级 diff 和一键回滚的可维护 Wiki还能渲染成知识图谱原理拆解一份文档如何变成问不倒 入库管线输入 → 处理 → 输出文档上传后进入异步任务队列docreader 解析表格转文本、图片走 OCR/视觉模型VLM视觉大模型生成描述按标题层级切成带上下文的小片段chunk这是检索的基本单位切分逻辑在 internal/infrastructure/chunker/每段生成嵌入向量把文本变成一串数字语义相近的文本数字也相近 关键词写入向量库查询管线混合检索为什么准提问时不是只靠语义相似一种方式而是双路召回再融合BM25 关键词检索基于词频的经典算法精确命中错误码、产品型号这类专名向量检索召回用词不同但意思相同的片段两路结果融合去重后重排模型rerank精排取 Top K 组装成上下文交给 LLM 生成带引用的回答融合逻辑就在 internal/application/service/knowledgebase_search_fusion.go 里。为什么快解析、向量化全部走异步队列不阻塞前端pgvector 默认使用 HNSW 索引加速近似最近邻查询。为什么可溯源每个回答片段都保留knowledge_idUI 上的引用抽屉能直接定位来源。动手上手WeKnora 最小环境要求Docker Docker Compose必需Git磁盘至少 10 GB内存 4 GB 起步一个可用的 LLM API KeyOpenAI 兼容接口、DeepSeek、通义千问等 20 多家均可或本机 Ollama 跑开源模型WeKnora Docker 部署四步启动git clone https://gitcode.com/GitHub_Trending/we/WeKnora cd WeKnora cp .env.example .env预期看到什么本地多出一个 WeKnora 目录.env已复制成功。.env里用WEKNORA_VERSION控制版本、FRONTEND_PORT控制前端端口默认值一般不用动。docker compose pull docker compose up -d预期看到什么拉下 app、frontend、数据库等镜像后docker compose ps里各容器状态为 running/healthyapp 容器启动时会自动执行数据库迁移无需手工初始化。浏览器访问http://localhost。预期看到什么注册页。先注册账号然后在设置里配置 LLM 模型——选提供商、填 API Key用内置的模型测试器确认连通。模型没配好之前后面所有问答能力都无法使用这是新手最常卡住的一步。WeKnora 最小可运行流程上传到提问新建知识库上传几份文档PDF/Word/Markdown 均可。预期看到什么文档状态从解析中变为就绪左侧出现与上传目录一致的文件夹树进入会话页提问例如这个产品的退货期限是多久。预期看到什么流式输出的回答正文里带引用角标点开引用抽屉能看到命中的具体片段和来源文档走到这里整条文档 → 索引 → 混合检索 → 带引用回答的链路你已经亲手跑通了。进阶与落地选型、常见坑与排查按需启用可选模块compose profile 机制不用就不占资源--profile neo4j启用 Neo4j 知识图谱适合需要跨文档实体关系推理的场景如产品手册 故障案例的关联问答--profile minio对象存储切到 MinIO多机部署或文件量大时建议开启默认本地卷单机够用--profile langfuse接入 Langfuse 做追踪能看到每次推理的 token 消耗和工具调用链--profile full一次启用全部常见坑与排查思路端口被占用.env里改FRONTEND_PORT重启 compose容器反复重启docker compose logs app看最后一批错误九成是端口或.env变量问题提问报模型错误先跑一遍设置页的模型测试器私有网络注意 API Key 权限和出网限制文档一直解析中看文档列表里的解析进度条定位卡在哪一步再对照容器日志检索不准优先调整检索阈值与重排模型而不是急着换向量库官方文档在 website-docs/约 360 个 API 端点、150 个环境变量都有说明排障 FAQ 在 docs/QA.md。下一步拿你手头真实的 10 份文档跑一遍上传 → 提问 → 核对引用再决定要不要开 Neo4j 和 IM 渠道——让同事直接在飞书、Slack 里问你的知识库比任何演示都更有说服力。【免费下载链接】WeKnoraOpen-source LLM knowledge platform: turn raw documents into a queryable RAG, an autonomous reasoning agent, and a self-maintaining Wiki.项目地址: https://gitcode.com/GitHub_Trending/we/WeKnora创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考