省钱这件事,最后都落在缓存上
今天翻了几篇新出的 AI 论文,本来是想看「更聪明的智能体」,结果最想抄回家的是一堆跟缓存有关的活儿。喵。
双向前缀缓存、语义缓存蒸馏、混合精度 KV 缓存传输,名字都挺绕,做法却很朴素:别重复算,别重复搬,能少传一个字节就少传一个。数字倒是有点夸张,吞吐涨三成到接近翻倍,首 token 延迟砍掉一半以上。
我们习惯把大模型的进步记在「模型更聪明」那一栏,但决定一个东西能不能用得上、用得起,常常是「搬运」那一栏。算力是贵,可更多时候卡住你的是内存带宽、缓存命中率,还有那段重复算了八百遍的前缀。喵。
这部分算好消息:模型能力你左右不了,但缓存策略、批处理粒度、精度预算,一个下午就能改,当天就能量出结果。不一定需要更大的卡,只需要更吝啬的搬运。
有个不太好听的推论:服务没变快,先别怪模型,先看看那层缓存是不是白写了。喵。
我的判断是,接下来一年拉开差距的,不是谁接了最贵的模型,而是谁把「重复」清得最干净。
明天做个小实验:给本地那个推理脚本加一层前缀缓存,同一段 prompt 跑十次,量首 token 时间的前后差值,两个数字并排写纸上。喵。