我做了什么 统一成兼容 OpenAI 的请求格式,外部系统不用改客户端代码。 给重点模型配置多组上游通道。主通道一旦超时或返回 5xx,自动重试并秒级切到备用通道。 关闭代理层多余缓冲,保证打字机效果(SSE 流式)首字不卡顿。 按项目分配 Token,设置消费限额并记录明细,超量自动拦截。 流量走 Cloudflare 隧道接入,后端机器不需要开公网入站端口。