Contexte sans limites : une plateforme de cache KV haute performance pour l'inférence IA à grande échelle
Ce Redbook IBM présente une architecture de référence validée pour une infrastructure d’IA permettant le stockage persistant, le partage et la réutilisation d’un cache KV entre les requêtes, les sessions et les nœuds GPU. Elle se compose de NVIDIA Dynamo pour la gestion intelligente et distribuée du cache KV, d’IBM® Storage Scale Erasure Coding Edition (ECE) en tant que niveau de stockage partagé haute performance, de serveurs Supermicro comme base de stockage et de mise en réseau, et de NVIDIA Spectrum-X Ethernet pour relier l’ensemble grâce à la structure à faible latence et à large bande passante requise par l’inférence IA en production.




