DigitalOcean 模型合成教程:多模型并行推理与成本优化
DigitalOcean 模型合成工具已进入公开预览。本文说明如何用预设或自定义面板并行调用多个模型、选择合成器、控制推理成本,并给出 Chat Completions API 示例与生产检查清单。

复杂研究、架构评审和事故复盘往往很难由单个模型稳定覆盖所有角度。DigitalOcean Inference Engine 在 2026 年 7 月 23 日推出了公开预览版模型合成(Model Synthesis)工具:同一次请求中并行运行多个分析模型,再由一个合成器模型比较结果并输出统一答案。开发者无需自行搭建多模型编排服务。
本文面向已经使用 DigitalOcean Serverless Inference、Dedicated Inference 或 Inference Router 的开发者,重点说明模型合成的工作方式、API 配置、成本边界和上线检查。公开预览功能、字段和模型支持范围可能变化,生产使用前应核对官方文档。
模型合成适合解决什么问题
模型合成的价值来自“多角度分析 + 集中审阅”,适合答案需要广度、交叉验证或多种推理路径的任务,例如:
- 技术方案和云架构选型,需要同时比较可靠性、成本、安全与迁移难度。
- 研究、尽调和竞品分析,需要从多个来源归纳证据并识别冲突。
- 事故复盘和策略评审,需要检查单一分析遗漏的假设与边界条件。
- 高价值内容生成,需要先产生多个候选结论,再统一结构与表达。
简单分类、短摘要、固定格式抽取或对延迟高度敏感的在线请求通常不需要模型合成。对于这些任务,单模型或 Inference Router 往往更经济。模型合成能增加覆盖面,但不保证事实正确,高风险决策仍需要人工复核和来源验证。
面板模型与合成器如何协作
一次模型合成请求包含两个角色:
- 分析模型面板:最多并行运行八个模型,对同一任务分别分析。面板可以使用不同模型,也可以为推理深度设置统一策略。
- 合成器模型:读取面板输出,比较一致与冲突之处,并生成最终响应。顶层
model决定合成器,工具配置中的analysis_models决定面板。
模型越多并不等于结果一定越好。建议先用两个互补模型建立基线,再根据离线评测决定是否增加面板规模。合成器的选择会直接影响最终答案的结构、取舍和成本。
开始前的准备
- 在 DigitalOcean 控制台的 Feature Preview 页面启用 Model Synthesis。
- 创建 Model Access Key,并仅放在服务器端环境变量中。
- 选择 Chat Completions、Responses 或 Messages API;三类 API 均支持模型合成。
- 准备一组能代表真实业务的测试问题和人工评分标准。
以下示例使用 DO_INFERENCE_KEY 环境变量。不要把访问密钥写进源码、浏览器脚本、日志或版本库。
使用 balanced 预设快速验证
预设让平台管理面板、合成器和推理配置。budget、balanced 与 quality 分别侧重成本、均衡和质量;平台可能随着模型、价格和评测结果更新预设的内部组合。
curl -X POST https://inference.do-ai.run/v1/chat/completions -H "Authorization: Bearer $DO_INFERENCE_KEY" -H "Content-Type: application/json" -d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "比较两种生产推理架构,并列出证据、风险和建议。"
}
],
"tools": [
{
"type": "model_synthesis",
"preset": "balanced"
}
]
}'
预设适合先确认 API、权限和响应结构是否正常。正式上线前仍应记录实际调用的模型、输入输出 token、延迟与答案质量。
自定义模型面板
需要固定模型组合时,可以直接指定面板。下面使用 GLM 5.2 作为合成器,并让 GLM 5.2 与 Kimi K2.6 并行分析:
curl -X POST https://inference.do-ai.run/v1/chat/completions -H "Authorization: Bearer $DO_INFERENCE_KEY" -H "Content-Type: application/json" -d '{
"model": "glm-5.2",
"messages": [
{
"role": "user",
"content": "评审这个迁移计划,指出遗漏、冲突和验证步骤。"
}
],
"reasoning_effort": "high",
"tools": [
{
"type": "model_synthesis",
"model": "glm-5.2",
"analysis_models": ["glm-5.2", "kimi-k2.6"],
"reasoning_effort": "high"
}
]
}'
顶层 reasoning_effort 控制合成器,工具内部同名字段控制分析面板。上线前应检查当前模型 slug 和支持的推理参数,避免把示例长期当作固定契约。
如何估算成本与延迟
模型合成工具本身不收取单独的附加费,但一次请求可能调用多个面板模型、合成器以及可选的 Web Search 或 Web Fetch。最终账单按各模型的实际 token 用量和相关 Web 工具调用计费,因此不能只按顶层模型估算。
- 先用两个模型和
balanced预设建立质量、延迟、token 与失败率基线。 - 把简单请求路由到单模型,只对复杂任务启用模型合成。
- 限制输入上下文、面板规模、推理强度和 Web 工具使用次数。
- 为请求设置超时、预算上限、重试策略和可观测字段。
- 模型或价格更新后重新跑测试,并以实时定价页为准。
生产上线检查清单
- 用真实任务离线评测单模型、预设和自定义面板,人工核对事实与引用。
- 确认公开预览已启用,API Key 权限最小化且已配置轮换。
- 记录每个面板模型、合成器、token、延迟、工具调用和错误码。
- 为超时、429、5xx 和部分模型失败定义可控降级路径。
- 对法律、医疗、财务、安全等高风险输出保留人工审批。
- 定期复查官方模型支持、字段、定价和公开预览状态。
与单模型选型和 Inference Router 的关系
如果任务是选择 Sol、Terra 或 Luna 之一,请先阅读DigitalOcean GPT-5.6 模型选型与 API 教程。Inference Router 用于按规则为一次请求选择合适的单模型;模型合成则在同一次复杂任务中调用多个模型并汇总结果,两者可以配合使用。
官方资料
- DigitalOcean 模型合成发布与评测说明
- How to Use Server-Side Tools
- DigitalOcean Inference 功能说明
- DigitalOcean Inference 定价
- DigitalOcean Changelog
了解 DigitalOcean Inference Engine,先用代表性测试集比较单模型、balanced 预设和自定义面板,再决定哪些生产请求值得启用模型合成。
