# Fusion 混合推理模型

> Every model has its blind spots

每个模型都有自己的盲点，可能遗漏上下文 或 偏向某一种分析视角。Fusion 让多个模型从不同视角独立分析同一个问题，再识别它们之间的共识、冲突和遗漏后生成最终回答。

## 工作原理

一次 Fusion 请求分为两个阶段：

![fusion](https://cdnv2-cache.udelivrs.com/2026/09/b2b5c2e34ed7e9268bf5159485637b1b_1788228486616.png)

1. **Panel：** 多个异构模型同时、独立地分析同一个问题。每个 Panel Member 使用不同的角色提示词，从预设侧重点形成候选答案。
2. **Synthesis：** Synthesizer 阅读原始对话和全部有效候选答案，识别共识、冲突与遗漏，然后独立生成最终回答。

Fusion 不是对候选答案进行简单投票，也不会直接拼接多段回答。最终内容仍由 Synthesizer 根据原始问题和 Panel 结果统一组织。

## 当前模型组合

当前 `ucloud/fusion` 使用三个 Panel Member 和一个 Synthesizer：

| 阶段 | 模型 | 侧重点 |
|---|---|---|
| Panel | `MiniMax-M3` | 问题主线：直接分析问题，给出准确、可验证的候选答案和关键理由 |
| Panel | `kimi-k3` | 完整性与边界：检查事实完整性、边界条件和潜在遗漏 |
| Panel | `deepseek-v4-flash-0731` | 反例与风险：检查反例、风险和可执行性 |
| Synthesis | `glm-5.3-flash` | 综合候选答案，识别共识、冲突和遗漏，生成最终回答 |

每次请求都会尝试并行调用全部 Panel Member。部分成员失败或超时后，只要至少有一个有效候选答案，系统仍可继续执行 Synthesis。

> 模型组合由 UCloud 根据模型稳定性、成本和 Benchmark 结果维护，后续可能调整。实际调用模型以 Modelverse 模型日志为准，暂不支持用户自定义。

## Fusion 和 AUTO 的区别

AUTO 解决的是：这个问题应该交给哪个模型来回答？
Fusion 是另一种尝试：这个问题是不是可以同时让几个模型从不同角度做一遍，再综合它们的结果？

| 能力 | AUTO | Fusion |
|---|---|---|
| 执行方式 | 从候选模型中选择一个模型 | 多个模型并行分析，再统一综合 |
| 主要目标 | 在质量、成本、时延和可用性之间选择合适模型 | 增加复杂任务的视角覆盖和交叉检查机会 |
| 适合请求 | 通用问答、实时交互和大部分日常调用 | 高价值、复杂且允许等待更久的任务 |
| Cost | 接近单模型调用 | 更多 Token 和更长时延 |

## 快速调用

Fusion 使用 OpenAI-compatible Chat Completions 接口。只需要把模型名替换为 `ucloud/fusion` 即可无缝接入

### cURL

```bash
curl -N https://api.modelverse.cn/v1/chat/completions \
  -H "Authorization: Bearer ${MODELVERSE_API_KEY}" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "ucloud/fusion",
    "messages": [
      {
        "role": "user",
        "content": "分析一下 Fusion 混合推理适合哪些业务场景"
      }
    ],
    "stream": true
  }'
```

### Python

```python
from openai import OpenAI

base_url = "https://api.modelverse.cn/v1"
api_key = "your api key"
model = "ucloud/fusion"

client = OpenAI(
    base_url=base_url,
    api_key=api_key,
)

res = client.chat.completions.create(
    model=model,
    messages=[
        {
            "role": "user",
            "content": "分析一下 Fusion 混合推理适合哪些业务场景",
        }
    ],
    stream=True,
)

for chunk in res:
    print(chunk.choices[0].delta.content or "", end="")
```

## 适用场景

Fusion 更适合回答质量和信息覆盖优先、能够接受较长推理时间的任务，例如：

- **深度分析与研究型任务：** 对已有材料进行归纳、交叉检查和观点综合。
- **商业分析与决策辅助：** 比较多个方案，寻找共识、分歧、潜在遗漏和执行风险。
- **高价值内容生产：** 生成研报、解决方案、分析报告和其他强调完整性的长内容。

Fusion 不适合简单问答、低延迟交互或对 Token 消耗敏感的批量任务。这类请求更适合直接调用单模型或使用 AUTO 路由。

## 效果、成本与时延

我们使用 DRACO Benchmark 对当前 Fusion 组合和高性能单模型 `gpt-5.6-sol (reasoning max)` 进行了内部对比。在成功完成并获得有效评分的回答中，两组结果处于相近水平，Fusion模型有 0.25 分的微弱优势：

| 指标 | Fusion | `gpt-5.6-sol` |
|---|---:|---:|
| DRACO benchmark | 55.59 | 55.34 |
| 单题平均 Token | 约 23,065 | 约 5,229 |
| TTFT P50 | 约 294 秒 | 约 84 秒 |
| 整体时延 P50 | 约 349 秒 | 约 86 秒 |
| 预估调用成本 | 约为对照模型的 1/5 | 基准 |

从 `DRACO benchmark` 结果来看，Fusion 受限于多模型并行推理，token消耗量、TTFT 和整体时延均为约为单模型的 3～4 倍；但整体成本仅为 `gpt-5.6-sol` 的 1/5，这得益于 Modelverse 自建推理能力、国内模型组合和 DeepSeek 谷时售价。

评测口径说明：

- 表中得分为成功完成并获得有效评分的回答结果，不代表线上 SLA。
- 成本根据本次模型组合和谷时价格估算，实际费用以 Modelverse 账单为准。
- 模型升级、Panel 组合、提示词和上游负载变化都可能影响结果，UCloud 会持续进行回归验证。

## 注意事项与常见问题

### Fusion 如何计费？

一次 Fusion 调用会触发多个子请求，使用的模型、Token 和费用可以在 Modelverse 模型日志中搜索，并通过 AstraFlow 控制台查看账单明细。由于不同问题产生的候选答案长度不同，每次 Fusion 请求的实际费用可能存在差异。

### 每个请求都会调用完整 Panel 吗？

当前版本中，显式调用 `ucloud/fusion` 每次都会执行完整的 Panel 和 Synthesis 流程。后续会逐步与 AUTO 路由结合，判断一个请求是否需要、也是否值得执行混合推理。

### 可以自定义 Panel 模型吗？

目前不支持。模型组合由 UCloud 根据 Modelverse 自建推理能力、模型稳定性、成本和 Benchmark 结果统一选定，并持续更新和调优。这样可以避免未经验证的组合导致质量、成本或稳定性不可控。

### 为什么 Fusion 响应更慢？

Fusion 需要先等待多个 Panel Member 完成独立分析，再执行 Synthesis。当前内部测试中，其 TTFT 和整体时延约为高性能单模型的 3～4 倍，因此更适合能够接受等待的高价值任务。

### Fusion 能替代所有单模型调用吗？

不能。Fusion 是面向特定复杂任务的一种推理策略，不是所有请求的默认最优选择。普通问答、实时交互和成本敏感的批量任务仍建议使用单模型或 AUTO；只有在多视角、交叉检查和回答完整性值得额外等待时，才建议使用 Fusion。
