本质
MaaS(Model as a Service)本质上是一个科技房地产的生意。
最近跟一大佬聊天,他的这个总结,我觉得还是挺精辟的。
随着模型智能的提升,前沿模型的 token 单价也在水涨船高,做一家赚钱的 MaaS 这个叙事更加通顺了,今儿就来大体上的聊聊。
房地产
做 MaaS 首先得有卡,这就像房地产一样,需要囤地皮,这是一个重资产的游戏。
但是卡跟卡也不一样,什么时候,买什么样的卡,就跟判断趋势,什么时候,囤什么地段的地皮,是一个逻辑。
卖卡大师,黄教主说:买得越多,赚得越多。The more you buy, the more you make.
意思是说,NVIDIA 的 GPU 卡是黄金地段,客流量高,肯定卖得好,大家都囤起来。
要是没有出口管制,这话放在当下,也是事实。
但是在当下的政策环境,以及考虑到长远(肯定也不希望市面上只有一个卖地皮的),什么时候,买多少,买哪家的卡,也挺考虑战略眼光的。
科技
从卡到 token 的生产过程,就考验团队的技术实力了,也是想探讨的重点。
这里的本质是:服务质量 + 运营效率。
服务质量
服务质量又分为两块:
可用性:包括各种模型能力是否都支持,比如 tools call 这种的,还有长期运行的稳定性等,三天两头出故障,用户也跑没了。这块算是入场券,是门槛性质的要求,就不展开了。
时延:也就是单个用户感受到的出字快慢,通常用单用户的吞吐 token/s 来衡量,这也是 MaaS 比较特别、需要着重关注的地方。
上一篇我们有过简单介绍:用户买的就是时间(时延),但是,推理的时延跟吞吐(效率)是一个取舍关系。
简单说:为了用户满意,希望时延要低,但是成本想降低,希望时延要高。
定价建模
中间的一个平衡点,就是价格。
什么价格,提供什么样的时延服务保障,这个也很讲究。
核心是,MaaS 厂商自己得有建模,心里有数,才好跟客户谈价。
其次是,这个时延 vs 价格,也得有足够的吸引力,毕竟主流模型是开源的,客户也会多处询价(国外不开源的前沿模型,人家有这个垄断优势,那就另说了)。
运营效率
分为两块:单点效率 + 集群效率
单点效率
单点讲的是最小单元的效率。
衡量指标是:给定模型,给定时延 SLO 要求,给定流量 pattern 下,产出的单位 token 的成本。
单点效率优化的成果,正是上面定价建模的输入,主要工作是,推理引擎侧的优化。
常用的优化方向包括:
- 切分策略,包括:TP、DP、EP、CP 这些。
通常是,针对指定的模型,指定的计算卡,设计适合的切分策略,已经算比较成熟的常规操作了。 - 量化:主流 SOTA 模型,都往 FP4 走了
国内存量硬件原生支持 FP4 的不多,即使算力上有吃亏(比不过 B 系列的原生支持),量化也是有很大收益的。 - 投机采样:不仅提升单用户的吐字速率,整体计算效率也有提升
硬件喜欢大矩阵乘,投机是搞大矩阵的有效途径之一 - 算子优化,通算融合:
这种算比较偏硬件底层的优化了,主流模型、主流硬件上,开源的也不差,也是现在 AI 投入较多的方向。
集群效率
集群是说规模化的效率,比如万卡集群的整体效率。
衡量指标就比较多了:
- Prefix KVCache 命中率
- 时延 SLO 稳定度
- 资源利用率
Prefix KVCache 命中率
两点先讲清楚:
- Prefix KVCache 命中率,最开始的依赖是推理引擎得做好,但是没放单点里,因为这已经算推理引擎的默认要求了。
- 现在 KVCache 是多层混合存储的了,这里的命中率就包括了每层的命中率,都有要求。
除了推理引擎的最基础支持,保证命中率,关键是这两个:
- 全局 KVCache 池化,这是整个集群 KVCache 命中率的基础保障,有 DRAM 的存储加持,基本可以做到接近理论命中率。
- Cache 亲和路由,这是为了提升 HBM 上的 L1 命中率,以及本机 DRAM 上 L2 命中率,可以很好的降低 TTFT 和各级传输带宽。
这两个是相互配合的关系,少哪个都会很别扭。
我听过一些比较极端的暴论,比如有了全局 KVCache 池化,就不需要 Cache 亲和的,我只能说他没搞过大规模生产服务。
KVCache 的传输开销是可以建模计算出来的,后续有空再细聊了。
同样,只有 Cache 亲和,没有全局 KVCache 池化,让 Cache 亲和来背命中率,也是戴着镣铐跳舞,很被动。
因为路由层的调度,还要承担更重要的时延 SLO 的任务。
时延 SLO 稳定度
上一篇也铺垫了不少,给定已经部署好的推理集群,时延和集群吞吐是取舍关系。
时延太高了,破了给用户承诺的 SLO 阈值,用户会投诉。
时延太低,也说明集群吞吐是下降的,毛利会降低,甚至会亏损。
因此,时延如果稳定在承诺的 SLO 那条线,是利润最高的点。
国外的我不知道,国内的大部分是低峰期的时延明显要低,很明显,这个时候毛利肯定是更低的了。
少数的供应商,部分模型上,时延很稳定,说明品控做得不错。
如何做到时延稳定呢,后续有空单独开篇细聊了。
资源利用率
回到房地产的比方,资源利用率就是出租率,空置的房子是不产生收益的。
应对低峰期,最赚钱的方式是,在满足时延 SLO 的情况下,对在线服务做缩容,也就是我们常说的弹性伸缩。
缩下来的资源,可以拿来跑离线任务,就像淡季把空置的物业转作他用,把资源充分利用起来。
虽然现在离线任务的规模还不够大,但是只要把产品做好了,价格到位了,还是能找到不少客户的。比如大模型训练里的数据标注等等。
如何做好弹性伸缩,这个跟上面的时延 SLO 稳定度也是强相关的,这两个也需要很强的协同配合,后面再细聊吧。
最后
回到开头的比方,做一家赚钱的 MaaS,就是三件事:地皮、科技、规模。
一是地皮,也就是卡,什么时候买、买多少、买哪家的,需要看清形势,审时度势。
二是科技,从卡到 token 的生产过程,如何优化、能多赚钱,是 MaaS 平台持续需要深耕钻研的。
三是规模,MaaS 跟通算的云一样,本质上吃的是规模化的红利,随着开源模型的智能逐步追上闭源的前沿模型,token 消耗的规模越来越大,MaaS 的成长空间还是不错的。
另外,模型后面的开源 License 也是个变量,kimi k3 算是开了一个和 MaaS 分成的先河,估计后续足够前沿、能掌握定价权的模型,都会效仿这种分成模式。
不过,这些都只是利益分配问题,我还是认为做一家赚钱的 MaaS 是行得通的。