超时指调用方为等待响应设置的时间上限。达到上限后客户端中断这次请求并抛出错误,但服务端可能仍在处理,甚至已经完成并计费。模型 API 的响应时间随输入长度与输出长度显著变化,因此超时值需要按任务类型分别设定,而不是全局用一个数字。

模型调用的超时和普通接口不一样

普通 Web 接口几百毫秒就该返回,模型接口可能需要几十秒——输出越长,生成时间越长。用普通接口的超时值(比如 5 秒)去调模型,会把大量正常请求误判为失败。

合理做法是按任务分级:短问答给一个较小的值,长文生成给一个明显更大的值,批量任务单独配置。

常见误解

  • 超时不等于对方没处理。 你放弃了,服务端可能仍在生成,甚至已完成并计费。因此超时后的重试可能产生重复请求与重复扣费。
  • 超时不等于网络问题。 连接根本没建立是网络问题;连接建立了但响应太慢,是处理时间问题。两者的处理方式完全不同。
  • 调大超时不能解决所有问题。 如果真实原因是输出太长,正确做法是限制最大输出长度或改用流式输出,而不是一味等更久。

和流式输出的关系

开启流式后,首个分片到达得很早,空闲超时(多久没收到新数据算失败)比总超时更有意义。这也是为什么很多客户端在流式场景下要分别配置这两个值。

本站哪里会遇到

网页端「回答说到一半断了」的排查顺序见 AI 工具提示网络错误的原因与排查;代码侧的重试策略见指数退避