
在构建 AI 应用时,开发者需要能够灵活地将流量路由到最适合任务的大模型,而不必硬编码端点或自行管理开源代理。为了解决这一痛点,Google Cloud API Gateway 现已推出模型路由(Public Preview 公开预览版)。它提供一个轻量级、无服务器(serverless)的接入层,可接收兼容 OpenAI 的请求,并动态地将它们路由到 Gemini、Claude 或 OpenAI OSS-GPT。这种 AI 网关模式通常被称为 LLM 网关或统一的 LLM 端点。
API Gateway 既可以单独使用,以实现基于简单规则的路由、限流和 token 用量统计;也可以与 Google Cloud 更广泛的 AI 网关体系以及 Gemini Enterprise Agent Platform 无缝配合。例如,你可以让 Agent 的出站流量先经过 Agent Gateway 进行严格的安全治理,然后再交由 API Gateway 处理 Google 自托管 LLM 的动态路由。下面是配置路由逻辑的分步指南。
路由你的流量
这为你所有的 LLM 流量提供一个统一、稳定的端点,使你可以在不修改客户端代码的前提下,在中央位置新增或替换后端模型。而且由于应用是向网关进行身份认证,而不是直接对接模型服务商,因此客户端鉴权与后端 LLM 鉴权相互独立,你可以轮换或更改后端凭证而无需触碰应用本身。
- 配置路由规则: 你可以直接在 OpenAPI 3.x 规范中,使用新增的
x-google-api-management扩展块,将虚拟模型名称映射到具体的后端目标。
openapi: 3.0.4
info:
title: OpenAPI 3.x spec using Model Routing
description: Using Model Routing in an OAS 3.x spec
version: 1.0.0
x-google-api-management:
backends:
gemini-35-flashlite:
address: >-
https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/google/models/gemini-3.5-flash-lite:generateContent
deadline: 60.0
pathTranslation: CONSTANT_ADDRESS
anthropic-claude-opus-47:
address: >-
https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/anthropic/models/claude-opus-4-7:rawPredict
deadline: 60.0
pathTranslation: CONSTANT_ADDRESS
openai-gpt-oss-120b:
address: >-
https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/endpoints/openapi/chat/completions
deadline: 60.0
pathTranslation: CONSTANT_ADDRESS
ai:
models:
routing:
routers:
# Router 1:在 Gemini(默认)与 Claude 之间路由
gemini-claude-router:
defaultModel:
backend: gemini-35-flashlite
targetModel: google/gemini-3.5-flash-lite
rules:
- model: "claude-opus-4-7"
backend: anthropic-claude-opus-47
targetModel: anthropic/claude-opus-4-7
# Router 2:在 OpenAI GPT(默认)与 Gemini 之间路由
openai-gemini-router:
defaultModel:
backend: openai-gpt-oss-120b
targetModel: openai/gpt-oss-120b-maas
rules:
- model: "gemini-3.5-flash-lite"
backend: gemini-35-flashlite
targetModel: google/gemini-3.5-flash-lite
servers:
- url: "https://my-gateway.example.com"
paths:
/v1/chat/gemini-claude:
post:
summary: "端点:默认使用 Gemini,并可选用 Claude。"
operationId: "chatGeminiClaude"
x-google-model-router: gemini-claude-router
responses:
'200':
description: "OK"
/v1/chat/openai-gemini:
post:
summary: "端点:默认使用 OpenAI,并可选用 Gemini。"
operationId: "chatOpenAIGemini"
x-google-model-router: openai-gemini-router
responses:
'200':
description: "OK"
注意: 被同一路由器引用的所有后端必须共享相同的主机(例如 aiplatform.googleapis.com)。路由功能是在该共享的 Agent Platform 主机上选择不同的模型和路径,并不会跨不同主机进行路由。
-
部署网关: 部署你更新后的 API 配置,使网关处于激活状态并准备好处理流量。
-
发送标准请求: 你的应用只需发送一条标准的 OpenAI 请求,例如
POST /v1/chat/gemini-claude或POST /v1/chat/openai-gemini。网关会拦截该请求,将负载转码(transcode)为后端的原生 schema,添加所需的 Agent Platform 身份认证令牌,并实时完成路由。以下是一个示例(请根据实际情况替换$API_KEY和my-gateway.example.com):
curl -X POST "https://my-gateway.example.com/v1/chat/gemini-claude" \
-H "content-type: application/json" \
-H "x-api-key: $API_KEY" \
-d '{
"model": "claude-opus-4-7",
"messages": [
{"role": "user", "content": "Introduce yourself in 5 words"}
]
}'
立即开始
模型路由功能现已在 API Gateway 中以公开预览版(Public Preview)的形式上线。若你希望摆脱繁杂的代理管理、统一你的 AI 流量,可以查阅我们的文档,立即部署你的第一个模型路由器。
这些模型路由能力是 Google Cloud 更广泛的 AI 网关体系的一部分:包括基于 Apigee 的强大 API 与工具管理,以及 Gemini Enterprise Agent Platform 中由 Agent Gateway 提供的端到端 Agent 治理。你可以从轻量级的方案入手,在需要时再平滑扩展到更完整的能力。