0%

买 token 到底买的是什么

答案

  1. 智能:不同的模型,智能水平差距还是挺大的
  2. 时间:相同模型,不同供应商的耗时也差距不小

智能

这个是最直观的,同样的百万 token,最新的 SOTA 模型,比起一年前的 SOTA 模型,能干得活多了很多。

时间

这个通常不太提及,因为大多数时候,作为普通用户的我们没得选…

做 Agentic 应用的创业者,会比较多关注这个,毕竟他的用户还是关心任务完成时间的。

回顾上一篇,大模型推理,本质上是一个批处理计算,为了提升 GPU 上的吞吐,提升并发度,是最常用的策略。

但是,提升并发度之后,针对单个用户请求的吞吐速率就慢了…

时延 vs 成本

举个生活中的例子,同样的点外卖

一对一闪送,肯定是最快的,但是,价格是要更贵的。这就相当于推理的小并发推理

普通外卖,骑手都是好几单同时送的,顺路要接其他单的,速度肯定要慢的。这就是推理中的大并发推理

推理并发度类比外卖

真实中的推理,不同的响应速度,成本可能要差个几倍,一般都是可以建模出来的。

当然,造成响应速度差异的,也有很多其他因素,咱们这里就不细究了。

作为用户的启示

如果是个人开发者,其实 token 消耗量不会很大,通常都是模型能力 > 时延 的筛选逻辑。

如果是 token 消耗量很大的 Agentic 应用创业者,通常都有很好的成本意识。

比如会去选合适的模型,优化长上下文,来降低成本。

长远来看,控制好任务的耗时预期,也是值得考虑的优化方向。

比如有些应用场景下,如果对时延要求不高,是可以找 MaaS 供应商谈个好价钱的。

当前,这些都是体量大了才有的操作,0-1 的创业期,用最好的就对了。

对 MaaS 平台的观察

国外的 token 供应商,提供不同的响应速度的服务,比如 OpenAI、Anthropic 的模型服务都有快速模式,更快的速度,更贵的价格。

国内的算力确实紧张,体量也小不少,没有标准化的提供不同时延的服务等级。不过,我估计,体量到位了,只要肯付溢价,应该还是谈个更快速度的。

aiping 数据分析

最近抓 aiping 的数据做了个方便查询历史的汇总,针对近两周数据也做了一些分析。

发现大部分都是这个规律:0点 - 6点这个时段,周末的时段,明显会快很多。

归一化后的速率热力图,还是非常明显的。

星期与时段的速率热力图

这确实很符合国内的波峰波谷特征,但是,也说明,大家的弹性策略,做得确实也都不咋样。

当然,也有相对做得好的,阿里云百炼的速率,相对保持的不错,有几个 Qwen 系列的模型,非常的平稳。

我估计是做了深度的建模,做了 SLO 感知的调度。

阿里云百炼 Qwen3.7-Plus 速率曲线

有意思的推测

还有几个有意思的推测,也挺好玩的

  1. 金山云的 GLM 5.2 都有 TPS 100 以上的,估计用 B 卡在跑推理了
  2. 硅基流动的 DeepSeek V3/R1 系列,TPS 只有 20 左右,估计是跑在国产卡上了 …

未来预测

随着国内算力的充足,token 体量的增长,不同时延 SLO 档位 token 服务,估计也会变成标准化的服务能力。

供应侧,不同代际、供应商的卡,能跑出来的水位是不一样的。

需求侧,token 体量大了,也会更关注成本,context 优化之类手段榨干之后,控好时延,大概率也是要用上的。

即使未来演进,只要模型参数量摆在这,推理还在追求计算强度,那么时延和成本之间的冲突就一直会存在。

好了,下一篇预告,聊聊供给侧,如何做好(赚钱)的 MaaS。