
Le centre de gravité · Tuesday · 7 min
Cache KV : pourquoi le hasard bat l’optimisation
0:00-7:00
transcript
show notes
Face à l’explosion de mémoire des modèles de raisonnement, des algorithmes ultra-complexes trient chaque token du cache. Une étude prouve qu’une éviction aléatoire fait aussi bien, tout en boostant le débit de 40 % sur vLLM. Et si l’ingénierie de pointe s’était trompée de combat ?
#modeles #meta-evergreen #inference #hardware #llm






