教程

DigitalOcean 模型合成教程:多模型并行推理与成本优化

DigitalOcean 模型合成工具已进入公开预览。本文说明如何用预设或自定义面板并行调用多个模型、选择合成器、控制推理成本,并给出 Chat Completions API 示例与生产检查清单。

DigitalOcean 模型合成教程:多模型并行推理与成本优化

复杂研究、架构评审和事故复盘往往很难由单个模型稳定覆盖所有角度。DigitalOcean Inference Engine 在 2026 年 7 月 23 日推出了公开预览版模型合成(Model Synthesis)工具:同一次请求中并行运行多个分析模型,再由一个合成器模型比较结果并输出统一答案。开发者无需自行搭建多模型编排服务。

本文面向已经使用 DigitalOcean Serverless Inference、Dedicated Inference 或 Inference Router 的开发者,重点说明模型合成的工作方式、API 配置、成本边界和上线检查。公开预览功能、字段和模型支持范围可能变化,生产使用前应核对官方文档。

模型合成适合解决什么问题

模型合成的价值来自“多角度分析 + 集中审阅”,适合答案需要广度、交叉验证或多种推理路径的任务,例如:

  • 技术方案和云架构选型,需要同时比较可靠性、成本、安全与迁移难度。
  • 研究、尽调和竞品分析,需要从多个来源归纳证据并识别冲突。
  • 事故复盘和策略评审,需要检查单一分析遗漏的假设与边界条件。
  • 高价值内容生成,需要先产生多个候选结论,再统一结构与表达。

简单分类、短摘要、固定格式抽取或对延迟高度敏感的在线请求通常不需要模型合成。对于这些任务,单模型或 Inference Router 往往更经济。模型合成能增加覆盖面,但不保证事实正确,高风险决策仍需要人工复核和来源验证。

面板模型与合成器如何协作

一次模型合成请求包含两个角色:

  • 分析模型面板:最多并行运行八个模型,对同一任务分别分析。面板可以使用不同模型,也可以为推理深度设置统一策略。
  • 合成器模型:读取面板输出,比较一致与冲突之处,并生成最终响应。顶层 model 决定合成器,工具配置中的 analysis_models 决定面板。

模型越多并不等于结果一定越好。建议先用两个互补模型建立基线,再根据离线评测决定是否增加面板规模。合成器的选择会直接影响最终答案的结构、取舍和成本。

开始前的准备

  1. 在 DigitalOcean 控制台的 Feature Preview 页面启用 Model Synthesis。
  2. 创建 Model Access Key,并仅放在服务器端环境变量中。
  3. 选择 Chat Completions、Responses 或 Messages API;三类 API 均支持模型合成。
  4. 准备一组能代表真实业务的测试问题和人工评分标准。

以下示例使用 DO_INFERENCE_KEY 环境变量。不要把访问密钥写进源码、浏览器脚本、日志或版本库。

使用 balanced 预设快速验证

预设让平台管理面板、合成器和推理配置。budgetbalancedquality 分别侧重成本、均衡和质量;平台可能随着模型、价格和评测结果更新预设的内部组合。

curl -X POST https://inference.do-ai.run/v1/chat/completions   -H "Authorization: Bearer $DO_INFERENCE_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "比较两种生产推理架构,并列出证据、风险和建议。"
      }
    ],
    "tools": [
      {
        "type": "model_synthesis",
        "preset": "balanced"
      }
    ]
  }'

预设适合先确认 API、权限和响应结构是否正常。正式上线前仍应记录实际调用的模型、输入输出 token、延迟与答案质量。

自定义模型面板

需要固定模型组合时,可以直接指定面板。下面使用 GLM 5.2 作为合成器,并让 GLM 5.2 与 Kimi K2.6 并行分析:

curl -X POST https://inference.do-ai.run/v1/chat/completions   -H "Authorization: Bearer $DO_INFERENCE_KEY"   -H "Content-Type: application/json"   -d '{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "评审这个迁移计划,指出遗漏、冲突和验证步骤。"
      }
    ],
    "reasoning_effort": "high",
    "tools": [
      {
        "type": "model_synthesis",
        "model": "glm-5.2",
        "analysis_models": ["glm-5.2", "kimi-k2.6"],
        "reasoning_effort": "high"
      }
    ]
  }'

顶层 reasoning_effort 控制合成器,工具内部同名字段控制分析面板。上线前应检查当前模型 slug 和支持的推理参数,避免把示例长期当作固定契约。

如何估算成本与延迟

模型合成工具本身不收取单独的附加费,但一次请求可能调用多个面板模型、合成器以及可选的 Web Search 或 Web Fetch。最终账单按各模型的实际 token 用量和相关 Web 工具调用计费,因此不能只按顶层模型估算。

  • 先用两个模型和 balanced 预设建立质量、延迟、token 与失败率基线。
  • 把简单请求路由到单模型,只对复杂任务启用模型合成。
  • 限制输入上下文、面板规模、推理强度和 Web 工具使用次数。
  • 为请求设置超时、预算上限、重试策略和可观测字段。
  • 模型或价格更新后重新跑测试,并以实时定价页为准。

生产上线检查清单

  1. 用真实任务离线评测单模型、预设和自定义面板,人工核对事实与引用。
  2. 确认公开预览已启用,API Key 权限最小化且已配置轮换。
  3. 记录每个面板模型、合成器、token、延迟、工具调用和错误码。
  4. 为超时、429、5xx 和部分模型失败定义可控降级路径。
  5. 对法律、医疗、财务、安全等高风险输出保留人工审批。
  6. 定期复查官方模型支持、字段、定价和公开预览状态。

与单模型选型和 Inference Router 的关系

如果任务是选择 Sol、Terra 或 Luna 之一,请先阅读DigitalOcean GPT-5.6 模型选型与 API 教程。Inference Router 用于按规则为一次请求选择合适的单模型;模型合成则在同一次复杂任务中调用多个模型并汇总结果,两者可以配合使用。

官方资料

了解 DigitalOcean Inference Engine,先用代表性测试集比较单模型、balanced 预设和自定义面板,再决定哪些生产请求值得启用模型合成。