主题
网络、延迟与超时
Cloud AI 请求链路包含客户端、Cloudflare、Cloud AI 网关和上游模型服务。 任一环节波动都可能增加首字延迟或导致流式连接中断。
延迟为什么会超过 30 秒
模型排队、长提示词、复杂推理和上游拥塞都会增加等待响应头的时间。 上游可能已经接受并计入请求,但客户端在收到首个响应前超时,因此使用记录中可能有用量, 本地却显示失败。
推荐超时
| 场景 | 建议 |
|---|---|
| 短对话 | 总超时至少 120 秒 |
| 长推理 | 读取超时 5 分钟或更长 |
| 流式输出 | 使用空闲超时,不要只设置固定总时长 |
| 自动探测 | 与真实客户端分开,降低探测频率 |
主动探测状态
渠道状态页当前按固定周期发起小请求:
- 正常:请求成功且延迟不超过 20 秒。
- 降级:请求成功但延迟超过 20 秒。
- 错误:请求失败、上游返回错误或超过监控超时。
状态页反映最近探测和历史可用率,不代表每个用户请求都会得到相同结果。
流中途断开
看到 stream disconnected before completion 时:
- 确认客户端使用流式读取。
- 检查本地代理、公司网络和安全软件。
- 查看渠道状态是否正在降级。
- 对可重试任务等待后重试一次。
- 检查使用记录,避免重复计费式重试。
Cloudflare 502
如果错误正文明确标注 origin_bad_gateway,说明 Cloudflare 收到了源站无效或不完整响应。 若错误域名属于上游,只有上游运营方能从根本上处理;Cloud AI 可以切换账号池或在可重试状态码下重试, 但不能把真实上游故障伪装成成功。
基础连通性测试
bash
curl -I https://cloud.examplea.xyz1
该命令只能验证网站入口,不能验证密钥、模型和完整推理链路。最终应使用最小 API 请求测试。