容量规划场景
vllm-sr-sim 回答仅靠第一性原理无法解决的机队规划问题:拆分阈值设在哪、在真实排队动态下机队是否真能达标、某工作负载下哪种 GPU 最便宜、何时应预置下一档资源。
全文使用的 GPU 单价:
| GPU | $/hr | $/yr |
|---|---|---|
| A10G 24 GB | $1.01 | $8.85 K |
| A100 80 GB | $2.21 | $19.4 K |
| H100 80 GB | $4.02 | $35.2 K |
P99 TTFT = P99(KV 槽排队等待) + 平均 prefill 时间。
每个 KV-cache 槽在模型中相当于 M/G/c 排队的一个服务台。
何时拆分池 — 简短版
在打开模拟器前,先用下列筛选:
重尾服务时间(智能体 / 长上下文)?
→ 必须拆分。同构池无论加多少 GPU 都无法满足 SLO。
ctx 比例 R = long_max_ctx / B_short,长请求比例 f:
R ≤ 2× 或 f > 30% → 同构通常更便宜;拆分为隔离延迟
R ≥ 4× 且 f < 10% → 高流量(λ > ~100 req/s)下拆分更便宜
R ≥ 16× 且 f < 5% → 任意有意义流量下拆分更便宜
以下各「谜题」是单靠经验法则无法解决的。