跳到主要内容

Chat 问答与 RAG

Attune Chat 是一个以你的本地知识库为上下文的 AI 对话界面。

基本用法

  1. 点击顶部导航 Chat 标签页
  2. 在输入框输入问题,按 Enter 或点击发送按钮
  3. Attune 自动检索相关文档片段,组装成 LLM 上下文,返回答案
示例问题:
"最近上传的合同里有哪些交货日期?"
"总结一下我的研究笔记中关于 Transformer 注意力机制的部分"
"帮我比较两份报价单的价格差异"

成本提示:发送前,输入框旁会显示预估 token 用量和费用(如 ~1.2K tok · $0.0004)。

RAG 检索流程

Attune 使用三阶段混合检索:

用户问题

1. BM25 全文检索(tantivy, jieba 分词)
2. 向量检索(HNSW, bge embedding)
3. RRF 融合排序

4. bge-reranker 精排(本地,无 token 消耗)

5. 动态注入预算裁剪(按相关度截断)

组装 LLM prompt(含 citations 锚点)

LLM 生成答案(含 [1][2] 引用标注)

引用号(Citations)

答案中的 [1][2] 等编号对应检索到的原文片段。点击引用号可以:

  • 查看原文上下文
  • 跳转到对应文件
  • 在文件中定位到具体段落

多轮对话

Attune Chat 支持多轮对话,上下文持续保留在当前会话中。每轮问答后,相关文档片段会被合并进 context window(受 token 预算限制,旧轮次自动压缩)。

文件范围限定

在 Chat 界面上方可以切换检索范围

范围说明
全部知识库默认,搜索所有已入库文件
当前文件夹只在选定目录中检索
指定文件选中 1-5 个文件后,只在这几个文件内问答

隐私与成本

操作成本层说明
文档检索(BM25 + 向量)🆓 零成本全本地
Reranker 精排⚡ 本地算力bge-reranker ORT 模型
LLM 生成答案💰 时间/金钱显式触发(按 Enter),永不后台偷跑

L1 级 PII 内容(手机号、邮箱等)在发送给 LLM 前自动替换为 placeholder,LLM 返回后还原。详见 隐私模型

与普通 ChatGPT/Claude 的区别

对比项普通 AI 聊天Attune Chat
知识来源训练数据(截止某日期)你的本地文件(实时最新)
文件私密性上传到第三方服务器只在本地处理
引用来源无(可能幻觉)有,可溯源到原文段落
历史对话保存在服务商保存在本地 vault

常见问题

Q: 为什么答案没有引用号?

引用号需要 LLM 支持,且检索到相关文档才会出现。若 Attune 判断问题与知识库无关(如"天气怎么样?"),会直接调用 LLM 通用知识回答,不带引用。

Q: 回答速度很慢?

LLM 响应速度取决于:选择的 LLM 提供商(本地 < 云端)、生成长度、网络条件。等待期间顶部显示加载指示器,不会卡死界面。

Q: 能关掉 RAG,只用 LLM 聊天吗?

可以。在 Chat 界面右上角切换"仅 LLM"模式,此时 Attune 直接发送问题给 LLM,不检索知识库。