AI Gateway 不只是把请求转发给模型。它需要同时处理模型协议差异、身份与配额、路由与重试、流式响应、可观测性、成本以及生产环境中的背压和故障隔离。
这个专题解决什么问题
- 如何划清 AI Gateway、通用 API Gateway、模型服务和 LLMOps 平台的能力边界。
- 如何实现 OpenAI、Anthropic 等模型协议之间的可靠转换,特别是流式、思考块和工具调用。
- 如何设计限流、路由、重试、熔断、降级、配额与多模型治理策略。
- 如何定位 SSE、协程调度、下游慢消费和频繁 flush 导致的运行时性能问题。
- 如何在多云、高可用和复杂网络环境中选择并落地网关。
适合哪些读者
适合 AI 平台工程师、后端/架构工程师、网关研发人员,以及正在建设模型统一接入层、LLMOps 平台或企业级大模型基础设施的团队。
推荐阅读路径
- 建立边界:什么样的网关,才算好的 AI 网关?,先明确职责与评分维度。
- 理解底座:Apache APISIX 架构浅析,掌握数据面、控制面和插件执行模型。
- 进入协议层:Anthropic → OpenAI 协议转换插件实战,关注流式和工具调用边界。
- 进入生产现场:API7 AI 网关 CPU 饱和故障复盘,理解背压与协作式调度。
- 扩展到部署与选型:多云高可用网关架构与南北入口网关选型。
关键术语与常见决策
- 协议与响应:OpenAI-compatible、Anthropic Messages、SSE、Tool Calling、Thinking Block。
- 流量治理:模型路由、负载均衡、重试预算、熔断、限流、Token 配额。
- 运行时:OpenResty、Lua 协程、事件循环、背压、连接池、长连接。
- 可观测性:TTFT、TPOT、Token 用量、模型错误码、重试链路与成本归因。
- 关键决策:网关是否做语义层能力、协议转换放在哪里、何时重试、如何隔离租户和模型供应商。