PDF 知识库问答

在自己的论文与资料范围内检索和回答,给出上下文与出处,减少脱离材料的回答。

资料攒到几百份之后,最常见的困境不是没有,而是找不着:记得某篇论文里提过一个数据,但想不起是哪篇;想对比几份报告里同一个指标,得一份份翻。搜索文件名解决不了这个问题,因为你要找的是内容。

知识库问答把你上传的资料变成可以直接提问的对象。你问一个问题,它在你的资料范围内检索、读相关段落、给出回答,并标明这个答案来自哪一份文件的哪一部分。资料里没有的,它会直接说没有,而不是用通用知识补上一段听着像那么回事的话。

可以完成什么

答案带出处

每个回答都指明来源文件与位置,可以点回去看原文。这一点决定了这些答案能不能被引用。

资料里没有就说没有

检索不到支撑时会明确告诉你知识库里没有相关内容,而不是拿模型的通用知识顶上。这个区分对研究场景非常关键。

跨文件对比

可以一次问跨多份资料的问题,比如同一个指标在几份报告里分别是多少,它会逐份找出来并列出对照。

持续积累

知识库是长期的,新资料随时加入,之前的内容不受影响,越用覆盖面越全。

它是怎么做到的

  1. 建库与上传按主题建立知识库,批量上传 PDF 等资料,系统逐份解析建立索引。
  2. 提问检索用自然语言提问,系统在库内检索相关段落,而不是只做关键词匹配。
  3. 读原文再回答把检索到的相关段落读过之后再组织回答,答案与出处一同给出。
  4. 追问与深入可以在回答基础上继续追问,也可以让它把某个主题的相关内容汇总成一份材料。

用法示例

在自己的文献库里找证据

我这个库里有哪些研究报告了这个干预措施的副作用?分别是什么样本量?

列出命中的几篇文献、各自报告的副作用与样本量,并标明来自哪一篇的哪一节。

内部资料快速查证

我们去年的技术方案里对这个接口的超时是怎么定的?出处给我。

给出具体数值与出处文件段落;如果几份文档说法不一致,会把不一致之处一并指出来。

常见问题

知识库能放多少资料?

支持持续积累,资料可以随时追加。库变大之后检索仍在全库范围内进行,不会只在最近上传的文件里找。

它会不会用模型自带的知识乱答?

设计上区分得很清楚:知识库内检索到的内容会标出处,检索不到时会明确说明库里没有。这个区分是研究场景能不能用的前提。

支持哪些文件格式?

PDF 为主,也支持常见的文档与表格格式。扫描件会先做文字识别。

我的资料安全吗?

资料属于你自己的知识库,仅用于响应你的提问,不会被用于训练模型。