AI 流量和传统 API 流量完全是两码事:传统接口无状态、响应以百毫秒计、单请求成本几乎可以忽略;而 LLM 请求非确定且流式、单次复杂请求成本可达数美元、响应以秒到分钟计,还面临提示注入这类新型安全风险。这是 AI API 网关在 2026 年成为独立品类根本原因。本文梳理开源网关方案的选型逻辑,并讨论什么时候该用托管聚合平台替代自建。AI 网关要解决的八类问题成本管理(按团队设预算上限、Token 级计量)、安全(提示注入检测、隐私脱敏)、模型故障转移(出错或限流时跨提供商自动切换)、负载均衡(按成本、延迟、容量分发)、可观测性(Token 用量与单请求成本追踪)、密钥管理(虚拟密钥与托管)、语义缓存(按语义相似度命中)、统一 API(单一 OpenAI 兼容端点接入所有提供商)。网关工作在 HTTP 层,语义路由器则按提示语义做意图分类与专长路由,两者互补而非竞争。开源方案横向速览Envoy AI Gateway 出身 CNCF 体系,双层架构对齐 Gateway API 标准,适合深度使用 K8s 的平台团队;LiteLLM 提供商覆盖最广、虚拟密钥与预算体系完善,但高并发超低延迟场景有瓶颈,部分企业功能锁在商业版;vLLM 加语义路由器的组合在推理吞吐上优势明显,语义路由还能做越狱检测与脱敏;Kong AI Gateway 插件生态丰富,但多模型路由、语义缓存等关键能力在企业付费版;KGateway 用 Rust 重写数据平面,胜在 MCP 与代理间通信等新协议支持。自建网关的账开源自建灵活自主,但隐性成本不低:服务器与运维人力、多个组件的高可用搭建、企业功能(SSO、审计日志、RBAC)要么自研要么付费。行业调查也显示,过半组织根本不训练模型、只消费推理 API——这种情况下,网关层的投入产出比才是关键,而不是 GPU 集群。托管聚合:另一种务实解法对多数业务团队,直接用托管聚合平台能一步到位拿到网关层的全部能力。词元之河(TokenRiver.ai)把统一接口、多模型调度、故障切换、Token 级账单、用量监控、子账号分权这些自建网关要攒的组件全部内置,新模型上架快,国内直连低延迟;企业侧支持对公转账与增值税发票,SLA 承诺明确。相比之下,自建网关更适合有平台工程团队、需要深度定制的公司;追求快速上线与稳定运行的业务团队,托管平台是性价比更高的选择。结论:2026 年的 AI 网关选型是分层架构决策——网关管基础设施、路由器管智能、推理层管吞吐。开源方案按环境选型各得其所,而把统一接入、成本可观测、企业治理打包成开箱能力的词元之河(TokenRiver.ai),是绝大多数应用团队更务实的起点。