Google Cloud API Gateway 新增模型路由功能

发布时间 2026-09-23 8 天前
来源 Google Developers Blog
字数 3,021 字
查看原文

AI智能总结

Google Cloud API Gateway 公测模型路由功能,开发者可在 OpenAPI 3.x 中配置虚拟模型名映射,将请求动态转发至 Gemini、Claude 或 OpenAI OSS-GPT 等后端,免去自建代理。

Model Routing via API Gateway 标题图

在构建 AI 应用时,开发者需要能够灵活地将流量路由到最适合任务的大模型,而不必硬编码端点或自行管理开源代理。为了解决这一痛点,Google Cloud API Gateway 现已推出模型路由(Public Preview 公开预览版)。它提供一个轻量级、无服务器(serverless)的接入层,可接收兼容 OpenAI 的请求,并动态地将它们路由到 Gemini、Claude 或 OpenAI OSS-GPT。这种 AI 网关模式通常被称为 LLM 网关或统一的 LLM 端点。

API Gateway 既可以单独使用,以实现基于简单规则的路由、限流和 token 用量统计;也可以与 Google Cloud 更广泛的 AI 网关体系以及 Gemini Enterprise Agent Platform 无缝配合。例如,你可以让 Agent 的出站流量先经过 Agent Gateway 进行严格的安全治理,然后再交由 API Gateway 处理 Google 自托管 LLM 的动态路由。下面是配置路由逻辑的分步指南。

路由你的流量

这为你所有的 LLM 流量提供一个统一、稳定的端点,使你可以在不修改客户端代码的前提下,在中央位置新增或替换后端模型。而且由于应用是向网关进行身份认证,而不是直接对接模型服务商,因此客户端鉴权与后端 LLM 鉴权相互独立,你可以轮换或更改后端凭证而无需触碰应用本身。

  1. 配置路由规则: 你可以直接在 OpenAPI 3.x 规范中,使用新增的 x-google-api-management 扩展块,将虚拟模型名称映射到具体的后端目标。
openapi: 3.0.4

info:
  title: OpenAPI 3.x spec using Model Routing
  description: Using Model Routing in an OAS 3.x spec
  version: 1.0.0

x-google-api-management:
  backends:
    gemini-35-flashlite:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/google/models/gemini-3.5-flash-lite:generateContent
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

    anthropic-claude-opus-47:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/publishers/anthropic/models/claude-opus-4-7:rawPredict
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

    openai-gpt-oss-120b:
      address: >-
        https://aiplatform.googleapis.com/v1/projects/YOUR_PROJECT_ID/locations/global/endpoints/openapi/chat/completions
      deadline: 60.0
      pathTranslation: CONSTANT_ADDRESS

  ai:
    models:
      routing:
        routers:
          # Router 1:在 Gemini(默认)与 Claude 之间路由
          gemini-claude-router:
            defaultModel:
              backend: gemini-35-flashlite
              targetModel: google/gemini-3.5-flash-lite
            rules:
              - model: "claude-opus-4-7"
                backend: anthropic-claude-opus-47
                targetModel: anthropic/claude-opus-4-7

          # Router 2:在 OpenAI GPT(默认)与 Gemini 之间路由
          openai-gemini-router:
            defaultModel:
              backend: openai-gpt-oss-120b
              targetModel: openai/gpt-oss-120b-maas
            rules:
              - model: "gemini-3.5-flash-lite"
                backend: gemini-35-flashlite
                targetModel: google/gemini-3.5-flash-lite

servers:
  - url: "https://my-gateway.example.com"

paths:
  /v1/chat/gemini-claude:
    post:
      summary: "端点:默认使用 Gemini,并可选用 Claude。"
      operationId: "chatGeminiClaude"
      x-google-model-router: gemini-claude-router
      responses:
        '200':
          description: "OK"

  /v1/chat/openai-gemini:
    post:
      summary: "端点:默认使用 OpenAI,并可选用 Gemini。"
      operationId: "chatOpenAIGemini"
      x-google-model-router: openai-gemini-router
      responses:
        '200':
          description: "OK"

注意: 被同一路由器引用的所有后端必须共享相同的主机(例如 aiplatform.googleapis.com)。路由功能是在该共享的 Agent Platform 主机上选择不同的模型和路径,并不会跨不同主机进行路由。

  1. 部署网关: 部署你更新后的 API 配置,使网关处于激活状态并准备好处理流量。

  2. 发送标准请求: 你的应用只需发送一条标准的 OpenAI 请求,例如 POST /v1/chat/gemini-claude 或 POST /v1/chat/openai-gemini。网关会拦截该请求,将负载转码(transcode)为后端的原生 schema,添加所需的 Agent Platform 身份认证令牌,并实时完成路由。以下是一个示例(请根据实际情况替换 $API_KEY 和 my-gateway.example.com):

curl -X POST "https://my-gateway.example.com/v1/chat/gemini-claude" \
  -H "content-type: application/json" \
  -H "x-api-key: $API_KEY" \
  -d '{
        "model": "claude-opus-4-7",
        "messages": [
          {"role": "user", "content": "Introduce yourself in 5 words"}
        ]
      }'

立即开始

模型路由功能现已在 API Gateway 中以公开预览版(Public Preview)的形式上线。若你希望摆脱繁杂的代理管理、统一你的 AI 流量,可以查阅我们的文档,立即部署你的第一个模型路由器。

这些模型路由能力是 Google Cloud 更广泛的 AI 网关体系的一部分:包括基于 Apigee 的强大 API 与工具管理,以及 Gemini Enterprise Agent Platform 中由 Agent Gateway 提供的端到端 Agent 治理。你可以从轻量级的方案入手,在需要时再平滑扩展到更完整的能力。