K
Paris, France
Kog développe à Paris un moteur d'inférence LLM haute performance pour GPU de datacenter, fondé sur une co-conception matériel-logiciel et des technologies propriétaires de communication et d'architecture de modèles.
Kog est une start-up parisienne spécialisée dans l'infrastructure d'IA. Elle développe un moteur d'inférence pour grands modèles de langage (LLM) conçu pour la génération séquentielle à haut débit sur des GPU de datacenter standards. L'approche repose sur une co-conception matériel-logiciel, avec une reconstruction complète de la pile d'inférence.
Le moteur revendique 3 000 tokens de sortie par seconde et par requête sur 8 GPU AMD MI300X, et 2 100 sur 8 GPU NVIDIA H200, soit environ 30 fois les performances de solutions conventionnelles. Il s'appuie sur des composants propriétaires : KCCL, une bibliothèque de communication inter-GPU à faible latence, et Laneformer, une architecture de modèle utilisant le « Delayed Tensor Parallelism » pour superposer calcul et communication.
Les briques techniques couvrent l'optimisation de l'inférence LLM, l'ingénierie GPU et les communications inter-GPU. L'équipe travaille au niveau le plus bas du système : développement de monokernels en CUDA avec assemblage inline PTX (NVIDIA) et en HIP avec l'ISA CDNA (AMD).
L'entreprise compte 11 personnes, dont 10 ingénieurs et 4 titulaires d'un doctorat, et se situe à Paris.