justawe 发表于 2026-9-14 14:38

小团队搭建知识库AI助手有什么推荐

主要存放一些合同、财务报告、调研资料等,配合大模型检索问答。扫描件比较多需要OCR识别,有一台现成的极空间NAS所以想最好本地存储,请教用什么工具比价好?
之前试着自己搭了Dify,一直卡在扫描件的识别上,偶尔能用但是很不稳定,经常上传个新文件卡住,然后整个知识库的检索都失效了

dualist 发表于 2026-9-14 14:52

充个GPT 20X 叫CODEX GPT6直接帮你搭,给他全部SSH权限 其他都别管了,没钱的话Gemini 3.8 flash 叫他找开源方案

c月光咖啡 发表于 2026-9-16 15:41

建议别折腾,RAG知识库这种玩意谁都在做但是谁都没做好,可以试一下开源的LangChain,Nas应该能塞进去。OCR+emb带来的问题是文本被切割,召回率会非常感人,后期成本极高

Dify这种人嫌狗厌的玩意更加做不好了

德尔惠净水器 发表于 2026-9-16 15:45

我用过的rag效果都很不理想,不知道是不是用法不对

c月光咖啡 发表于 2026-9-16 15:58

本帖最后由 c月光咖啡 于 2026-9-16 16:01 编辑

不是用法不对,而是向量化语义被分割的问题,OCR入库就更复杂了

OCR遇到非标准格式比如左右分栏,是无法识别左右分栏语料的相关性的,比如

我今天浏览了S1,上面    |   AI具有强大的思考
的坛友真有趣但是也很    |   和信息整理能力,
变态                           |    可以帮你推演

入库时变成:
1,我今天浏览了S1,上面AI具有强大的思考
2,的坛友真有趣但是也很 和信息整理能力,
3,变态可以帮你推演

LLM根据这种匪夷所思的输入也只能理解为:
1,S1的AI很强大
2,坛友有信息整理能力
3,变态能帮你推演

表格在OCR下的输出更加车祸现场,基本无法召回。

这是第一层的,还有第二层的割裂,因为向量库dump切割一个分片不能太大,在同一个分片里才有很高的相似度,如果分大了影响性能同时也会降低准确性,分小了语义割裂,例如


“我今天浏览了S1,上面的坛友真有趣但是也很变态”找坛友有趣的相关性为0.7

分3片:


我今天浏览了S1, | 上面的坛友真有趣 | 但是也很变态

找坛友有趣的相关性为0.95

分2片:
“我今天浏览了S1,上面的坛友 |真有趣但是也很变态”



找坛友有趣的相关性为0.2

大概是这样吧,复杂场景更难分,所以一直做不好

c月光咖啡 发表于 2026-9-16 16:21

我自己做的知识库,不得已提供了问答和精确两种模式,自动测试+优化,估计要一段时间才能优化出理想的结果

目前精确的命中率大概在95%,但是无法进行理解
问答则只有70%,经常塞一些无关的信息进来

若荼泱 发表于 2026-9-16 16:23

腾子的 weknora,我们部门正在用,效果还可以。OCR 可以配本地的 paddle OCR 服务器来解决。

—— 来自 Google Pixel 7a, Android 17, 鹅球 v4.0-alpha

德尔惠净水器 发表于 2026-9-16 16:25

c月光咖啡 发表于 2026-9-16 15:58
不是用法不对,而是向量化语义被分割的问题,OCR入库就更复杂了

OCR遇到非标准格式比如左右分栏,是无法识 ...

我想过让ai自己去grep分段的文本,不知道效果怎么样

c月光咖啡 发表于 2026-9-16 16:31

德尔惠净水器 发表于 2026-9-16 16:25
我想过让ai自己去grep分段的文本,不知道效果怎么样

我一开始也是这样的,但是还是达不到要求。我觉得这种粗暴向量化不是解决办法,一定要重新组织

德尔惠净水器 发表于 2026-9-16 16:35

字节的rag实践手册
https://www.cdut.edu.cn/__local/E/5B/B6/39E6C9ADF20836A45F7C765C31E_B2F36ACF_167F1B.pdf

c月光咖啡 发表于 2026-9-16 16:46

德尔惠净水器 发表于 2026-9-16 16:35
字节的rag实践手册
https://www.cdut.edu.cn/__local/E/5B/B6/39E6C9ADF20836A45F7C765C31E_B2F36ACF_167F1 ...

基本上都按这个逻辑去做,但是里面始终没有提到的是输入文本的质量,估计字节对于输入文本是有一定规范和质量要求的,OCR输入就是灾难,恶梦

德尔惠净水器 发表于 2026-9-16 16:53

c月光咖啡 发表于 2026-9-16 16:46
基本上都按这个逻辑去做,但是里面始终没有提到的是输入文本的质量,估计字节对于输入文本是有一定规范和 ...

涉及到数据质量评定,这个估计是内部秘密

JasonBourne 发表于 2026-9-16 18:26

腾讯开源了一个整套方案,没试过:https://weknora.weixin.qq.com/

noahhhh 发表于 2026-9-16 19:19

c月光咖啡 发表于 2026-9-16 16:46
基本上都按这个逻辑去做,但是里面始终没有提到的是输入文本的质量,估计字节对于输入文本是有一定规范和 ...

我看现在都是 OCR 过后先用 LLM 处理过一遍再入库

c月光咖啡 发表于 2026-9-16 19:49

noahhhh 发表于 2026-9-16 19:19
我看现在都是 OCR 过后先用 LLM 处理过一遍再入库

理论上都一样,MS早就论证过了,哪怕是规范的输入,各种优化后的RAG正确率在80%,如果只是当客服聊聊天错了还能再改这没问题。但是如果企业用法律、医学用,错几次就没人信任了

做过一次真的用过你就明白了

古畑任三郎2015 发表于 2026-9-16 19:52

反正我是把自己绝大部分材料全部md化用obsidian 管理的

思绪云骞 发表于 2026-9-17 00:52

看看飞牛应用商店里面的知识库商店都有哪些,用来做参考

—— 来自 S1Fun
页: [1]
查看完整版本: 小团队搭建知识库AI助手有什么推荐