# RAGView

RAGView 用于基于真实业务数据评测和选择 RAG 方案，帮助您无需复杂部署，即可快速对比不同 RAG 策略在检索质量、回答表现、响应速度和资源消耗等维度的差异，选出更适合自身业务场景的 RAG 路线。

RAGView 目前提供以下两个核心模块：

- **RAG 空间**：展示平台已接入、可评测的 RAG 路线，支持查看路线详情并进入评测。
- **RAG 竞技场**：上传文档、添加多条 RAG 路线后进行同题对比，直观查看各路线的回答结果与运行指标。

> 评测过程会使用模型和应用沙箱资源，将按照实际资源用量计费。

## 支持范围

- 当前支持对平台已适配并标注为「可评测」的 RAG 路线进行在线评测，路线及版本以「RAG 空间」页面展示为准。
- 文档支持 PDF、DOCX、TXT、MD、XLSX 格式，单文件不超过 10MB。

## 准备工作

在使用 RAGView 前，请确认：

1. 项目下已创建可用的 API Key，且该 Key 拥有沙箱权限和所需文本模型及 Embedding 模型的调用权限。
2. 账户余额满足评测所产生的模型及沙箱资源费用。

## 快速开始

RAGView 的完整评测流程分为四步：

| 步骤 | 操作 | 说明 |
| --- | --- | --- |
| 01 | 上传文档 | 上传文档作为知识库来源 |
| 02 | 准备测试问题 | 输入测试问题、参考答案和参考上下文（可选） |
| 03 | 选择 RAG 路线 | 从多种 RAG 路线中选择评测和对比对象 |
| 04 | 开始评测 | 配置模型、评估器后提交任务 |

## 发现 RAG 路线

进入 **模型服务平台 > 体验中心 > RAGView**，默认展示 **RAG 空间** 页面。

页面以卡片形式展示平台已上线的 RAG 路线，每张卡片包含：

| 信息 | 说明 |
| --- | --- |
| 路线名称 / 版本 | RAG 路线标识及当前最新可用版本 |
| 简介 | 路线的使用场景和技术特点 |
| 开源状态 | 展示是否已开源；开源路线同时展示开源协议、来源（GitHub）和 Stars 数 |
| 可评测标记 | 标记「可评测」的路线可直接发起评测 |


## 使用 RAG 竞技场评测

点击进入 **RAG 竞技场** 标签页。竞技场用于对多条 RAG 策略进行单题对比，评估回答差异。

### 1. 上传文档

在左侧「文档」区域，单击 **选择文档** 上传一份文档，作为本轮评测的知识库来源。

- 支持 PDF、DOCX、TXT、MD、XLSX，单文件不超过 10MB。
- 上传完成后可单击 **更换文件** 替换文档。
- 评测任务提交时将对文档生成快照，之后更换文档不影响已提交的任务。

> 文档内容将传入云端沙箱用于构建知识库。请避免上传包含明文密钥、个人敏感信息的文件。

### 2. 配置评估器（可选）

在左侧「评估器」区域勾选需要计算的评测指标。

如需指标评测，当前仅支持平台预置的评估器，各指标的详细定义与计算逻辑可在「评估器」页面查看。部分评估指标需要依赖 LLM 模型、Embedding 模型、参考答案和参考上下文。


### 3. 添加 RAG 路线

在右侧「对战区」单击 **添加路线**，从可评测路线中选择要对比的方案，最多可添加 4 条路线。

添加后，每条路线以独立卡片展示，可查看路线名称与版本，并支持单独删除。

### 4. 提问并对比结果

在页面底部输入框输入测试问题并发送，所有已添加路线将并行执行检索和问答。提问后会使用模型和沙箱资源，将以实际资源用量计费。

评测过程中，每条路线卡片顶部实时展示运行状态（运行中 / 已完成 / 运行失败），执行中展示当前阶段日志。

运行完成后，每条路线卡片展示：

| 信息       | 说明                                             |
| -------- | ---------------------------------------------- |
| 生成回答     | 该路线针对问题生成的完整回答，支持 Markdown 排版                  |
| TTFT     | 首 Token 延迟，从发起请求到返回首个 Token 的耗时                |
| 总用时      | 本次问答的执行总耗时                                     |
| Token 用量 | 本次问答消耗的 Token 总数                               |
| 召回上下文    | 该路线本次检索到的上下文片段数，单击可展开查看内容明细                    |
| 评估器得分    | 各勾选评估器对本条回答的评分明细                               |
| 错误信息     | 若运行失败，展示失败原因（如 inference failed）；单条路线失败不影响其他路线 |

## 查看评估器

点击进入 **评估器** 标签页，可查看平台预置的全部评估指标。单击指标卡片的 **查看说明**，可在侧边面板查看该指标的完整定义：

| 信息   | 说明                                                |
| ---- | ------------------------------------------------- |
| 分类   | 指标类型：LLM 或 Code                                   |
| 目标   | 指标标识及评估目标                                         |
| 来源   | 指标来源                                              |
| 输入参数 | 指标计算所需的字段及格式，如 question、contexts、reference_answer |
| 输出参数 | 指标输出的类型和取值范围                                      |
| 函数逻辑 | 指标的代码实现或 LLM Prompt，可直接查看和复制                      |

## 计费说明

- RAGView 本身不收取功能费用，仅对评测过程中实际消耗的**模型调用**和**应用沙箱资源**计费。
- Token 用量、沙箱运行时长以账单为准，可在 **消费中心 > 导出记录** 中查询 RAGView 来源的消耗明细。
- 勾选 LLM 类评估器时，计算指标会使用评估器 LLM 模型产生额外 Token 消耗，建议根据评估精度要求选择合适的模型。

## 常见问题

### 为什么路线卡片显示「运行失败 / inference failed」？

常见原因包括：生成模型无调用权限、账户余额不足、文档解析失败或沙箱资源异常。请依次确认 API Key 权限、账户余额和文档内容后重试；单条路线失败不影响其他路线的评测结果，可删除失败路线后重新添加。

### 评测结果可以导出吗？

目前仅支持在页面内查看各路线的完整回答、召回上下文与评分明细。评测任务与结果的保存与导出能力将在后续版本提供。