Chat 问答与 RAG
Attune Chat 是一个以你的本地知识库为上下文的 AI 对话界面。
基本用法
- 点击顶部导航 Chat 标签页
- 在输入框输入问题,按 Enter 或点击发送按钮
- Attune 自动检索相关文档片段,组装成 LLM 上下文,返回答案
示例问题:
"最近上传的合同里有哪些交货日期?"
"总结一下我的研究笔记中关于 Transformer 注意力机制的部分"
"帮我比较两份报价单的价格差异"
成本提示:发送前,输入框旁会显示预估 token 用量和费用(如
~1.2K tok · $0.0004)。
RAG 检索流程
Attune 使用三阶段混合检索:
用户问题
↓
1. BM25 全文检索(tantivy, jieba 分词)
2. 向量检索(HNSW, bge embedding)
3. RRF 融合排序
↓
4. bge-reranker 精排(本地,无 token 消耗)
↓
5. 动态注入预算裁剪(按相关度截断)
↓
组装 LLM prompt(含 citations 锚点)
↓
LLM 生成答案(含 [1][2] 引用标注)
引用号(Citations)
答案中的 [1]、[2] 等编号对应检索到的原文片段。点击引用号可以:
- 查看原文上下文
- 跳转到对应文件
- 在文件中定位到具体段落
多轮对话
Attune Chat 支持多轮对话,上下文持续保留在当前会话中。每轮问答后,相关文档片段会被合并进 context window(受 token 预算限制,旧轮次自动压缩)。
文件范围限定
在 Chat 界面上方可以切换检索范围:
| 范围 | 说明 |
|---|---|
| 全部知识库 | 默认,搜索所有已入库文件 |
| 当前文件夹 | 只在选定目录中检索 |
| 指定文件 | 选中 1-5 个文件后,只在这几个文件内问答 |
隐私与成本
| 操作 | 成本层 | 说明 |
|---|---|---|
| 文档检索(BM25 + 向量) | 🆓 零成本 | 全本地 |
| Reranker 精排 | ⚡ 本地算力 | bge-reranker ORT 模型 |
| LLM 生成答案 | 💰 时间/金钱 | 显式触发(按 Enter),永不后台偷跑 |
L1 级 PII 内容(手机号、邮箱等)在发送给 LLM 前自动替换为 placeholder,LLM 返回后还原。详见 隐私模型。
与普通 ChatGPT/Claude 的区别
| 对比项 | 普通 AI 聊天 | Attune Chat |
|---|---|---|
| 知识来源 | 训练数据(截止某日期) | 你的本地文件(实时最新) |
| 文件私密性 | 上传到第三方服务器 | 只在本地处理 |
| 引用来源 | 无(可能幻觉) | 有,可溯源到原文段落 |
| 历史对话 | 保存在服务商 | 保存在本地 vault |
常见问题
Q: 为什么答案没有引用号?
引用号需要 LLM 支持,且检索到相关文档才会出现。若 Attune 判断问题与知识库无关(如"天气怎么样?"),会直接调用 LLM 通用知识回答,不带引用。
Q: 回答速度很慢?
LLM 响应速度取决于:选择的 LLM 提供商(本地 < 云端)、生成长度、网络条件。等待期间顶部显示加载指示器,不会卡死界面。
Q: 能关掉 RAG,只用 LLM 聊天吗?
可以。在 Chat 界面右上角切换"仅 LLM"模式,此时 Attune 直接发送问题给 LLM,不检索知识库。