Décodage spéculatif : Tencent publie AngelSpec en open source pour accélérer l’inférence
Doubler la vitesse d'inférence des grands modèles de langage sans perdre une once de précision ? C'est l'objectif d'AngelSpec, le framework publié en open source et open weight par Tencent. Un atout majeur pour optimiser les serveurs d'IA ? On n'arrête plus Tencent. Traiter les requêtes des grands modèles de langage (LLM) à grande échelle...
Doubler la vitesse d’inférence des grands modèles de langage sans perdre une once de précision ? C’est l’objectif d’AngelSpec, le framework publié en open source et open weight par Tencent. Un atout majeur pour optimiser les serveurs d’IA ?
n n’arrête plus Tencent. Traiter les requêtes des grands modèles de langage (LLM) à grande échelle tout en maîtrisant les coûts de calcul : voilà ce que cherche à faire l’équipe HunYuan de la firme chinoise en dévoilant cet été AngelSpec. Présenté dans une étude scientifique sur arXiv (consultable également au format PDF de l’étude AngelSpec ou en version page web HTML AngelSpec), l’outil s’attaque aux goulets d’étranglement du décodage spéculatif. La publication ne se limite pas aux explications théoriques : l’entreprise livre l’intégralité du code d’entraînement sur le dépôt GitHub d’AngelSpec ainsi que les poids des modèles rédacteurs sur la plateforme Hugging Face.
Bon à savoir : c’est quoi l’inférence en IA ?
L’inférence désigne la phase où un modèle d’intelligence artificielle déjà entraîné est exécuté pour répondre aux requêtes des utilisateurs en production. Contrairement à l’entraînement (qui nécessite des semaines de calcul pour faire apprendre le modèle), l’inférence consiste à générer du texte ou analyser des données en temps réel. Sa rapidité et son coût financier conditionnent directement la viabilité d’un service d’IA.
Comment ça marche ?
Le décodage spéculatif s’appuie habituellement sur un petit modèle « rédacteur » (drafter) chargé de proposer plusieurs tokens futurs très rapidement, avant qu’un modèle cible plus volumineux ne vienne les valider en parallèle. Le problème réside dans l’hétérogénéité des tâches : une seule structure de rédaction ne convient pas à tous les types de contenus.
Pour résoudre cette limite, AngelSpec associe deux approches complémentaires dès l’étape d’entraînement. D’un côté, un rédacteur autorégressif à prédiction multi-token (MTP) : entraîné spécifiquement sur des données conversationnelles variées pour gérer le chat ouvert à forte entropie. De l’autre, un rédacteur par diffusion par blocs : renforcé par des jeux de données axés sur le code informatique et les mathématiques afin d’anticiper de longues séquences prévisibles.
Des gains de débit avec l’architecture DFly
Sur le plan architectural, Tencent introduit le framework DFly, qui combine un réseau conditionné par la cible avec une tête autorégressive tout en préservant la génération parallèle. Lors de l’exécution, le système réalloue dynamiquement les ressources de vérification vers les préfixes les plus fiables en fonction de la charge des serveurs et du matériel disponible.
Expérimentée sur la série de modèles Hy3-A21B de l’entreprise, l’architecture DFly augmente la longueur moyenne des tokens acceptés de 30 %. Cela se traduit par une accélération globale de 1,98x à 2,40x par rapport au décodage classique, et par un débit supérieur de 10,5 % à 11,8 % face aux solutions concurrentes comme DFlash.
Cette contribution vient enrichir l’écosystème open source de l’éditeur. En fournissant le code d’entraînement et les poids d’adaptation, la firme offre aux développeurs un levier efficace pour optimiser le déploiement de leurs propres modèles en production.
🦋 L’actualité de l’open source en français dans votre flux. Suivez Goodtech sur Bluesky (ou vos applications AT Protocol comme W Social et Mu) grâce à notre compte officiel. Suivez, partagez, abonnez-vous à @goodtech.info !
Did you enjoy this article?
Recommend it — Standard Reader surfaces well-loved writing to more readers across the network.