AI Infra第四章,如何让推理引擎一卡双用?

2026-10-10 16:460阅读0评论工具资源
  • 内容介绍
  • 文章标签
  • 相关推荐

在AI Infra的圈子里混久了较大家会被一个问题反复折磨:算力市场价格较高,太市场价格较高了。看着昂市场价格较高的A100或H800租赁账单, 再看看机房里那几块嗡嗡作响但利用率时常在30%左右徘徊的卡,架构师都会感到心肉。很更多时候,我们并不是没有算力,而是算力被“浪费”了。

我无法认同... 因为较大模型的演进, 我们不再仅仅追求“怎样让模型跑起来”,而是“怎样榨干每一块显卡的剩余实际价值”。今天我们要聊的是一个非常坚硬核的话题:怎样让推理引擎实现“一卡双用”? 这并不是简洁的更多线程更多进程并发,而是一场极致的资源条件调度艺术创作。

AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用

一、 为哪些“一卡双用”是当前的刚需?

在过去,我们部署模型的逻辑往往是“一个模型一个卡”,或者“一个模型分更多个不同卡”。这种做法在处理较小规模流量时极度不经济持续发展。想象一下 你为了一个7B的模型,在80GB显存的显卡上只占了20GB,剩下的60GB就在那里“发呆”。而你的其他申请却在排队,引起延迟飙升,那必须的!。

我的看法是... “一卡双用”的本质, 是在在同一块物理GPU上,并发运行更多个不同相互独立的推理实例,或者在一个实例内处理更多个不同任务流。这能极较大地提升吞吐量,减较低单次申请的投入成本。

在AI Infra的圈子里混久了较大家会被一个问题反复折磨:算力市场价格较高,太市场价格较高了。看着昂市场价格较高的A100或H800租赁账单, 再看看机房里那几块嗡嗡作响但利用率时常在30%左右徘徊的卡,架构师都会感到心肉。很更多时候,我们并不是没有算力,而是算力被“浪费”了。

我无法认同... 因为较大模型的演进, 我们不再仅仅追求“怎样让模型跑起来”,而是“怎样榨干每一块显卡的剩余实际价值”。今天我们要聊的是一个非常坚硬核的话题:怎样让推理引擎实现“一卡双用”? 这并不是简洁的更多线程更多进程并发,而是一场极致的资源条件调度艺术创作。

AI Infra 系列 · 第四章 推理引擎 (下):投机解码、量化、KV 池化、MoE 并行,一张卡当两张用

一、 为哪些“一卡双用”是当前的刚需?

在过去,我们部署模型的逻辑往往是“一个模型一个卡”,或者“一个模型分更多个不同卡”。这种做法在处理较小规模流量时极度不经济持续发展。想象一下 你为了一个7B的模型,在80GB显存的显卡上只占了20GB,剩下的60GB就在那里“发呆”。而你的其他申请却在排队,引起延迟飙升,那必须的!。

我的看法是... “一卡双用”的本质, 是在在同一块物理GPU上,并发运行更多个不同相互独立的推理实例,或者在一个实例内处理更多个不同任务流。这能极较大地提升吞吐量,减较低单次申请的投入成本。