Un problème technique apparemment mineur dans le apprentissage par renforcement avec échantillonnage rapide appliqué à de grands modèles de langage, il s'est avéré plus coûteux qu'il n'y paraissait : lorsqu'un groupe d'invites produit toujours la même récompense lors des déploiements, le budget de génération est brûlé sans renvoyer aucun signal d'apprentissage utile. C'est de ces déchets que proviennent SOMMEune nouvelle méthode d'échantillonnage rapide conçue pour l'apprentissage par renforcement avec récompenses vérifiables (RLVR), la technique qui a amélioré les capacités de raisonnement des grands modèles de langage ces dernières années.
Points clés
- LEEPS est une méthode d'échantillonnage rapide qui équilibre l'exploration et l'exploitation dans l'apprentissage par renforcement avec des récompenses vérifiables.
- Il divise les invites en deux portefeuilles – exploitation et exploration – en ajustant le budget de déploiement en fonction des résultats récents.
- Sur six tests de raisonnement mathématique, il obtient le score moyen le plus élevé avec Qwen2.5-Math-1.5B et Qwen2.5-Math-7B, avec des gains relatifs de 2,6 % et 3,7 % par rapport au meilleur modèle de comparaison.
- Il s'appuie également sur trois tests de raisonnement généraux hors distribution (OOD), ajoutant seulement environ 2 secondes de surcharge d'échantillonnage en ligne par étape de formation.
Pourquoi l’échantillonnage rapide est devenu un goulot d’étranglement
Dans l’apprentissage par renforcement avec des récompenses vérifiables, toutes les invites ne sont pas identiques du point de vue de l’apprentissage. Lorsqu'un modèle génère plusieurs déploiements pour la même invite et qu'ils obtiennent tous la même récompense, cette invite ne produit aucun signal utile pour mettre à jour les paramètres : le calcul a été effectué, mais il n'a rien appris au modèle. La sélection des invites avant même de générer des déploiements – ce que les chercheurs appellent la sélection des invites avant le déploiement – est une stratégie bien connue pour réduire ce gaspillage.
Le problème, expliquent les auteurs du LEEPS, est que les méthodes existantes peinent à trouver le juste équilibre entre deux besoins opposés. L'exploitation répétée d'invites qui se sont révélées informatives dans le passé risque de restreindre la couverture de la formation, c'est-à-dire de faire en sorte que le modèle voit toujours les mêmes types de problèmes. Au contraire, une exploration trop large réduit le pourcentage d’invites réellement informatives parmi les échantillons échantillonnés, diluant ainsi l’efficacité de chaque cycle de formation.
Équilibrer exploration et exploitation
C’est précisément dans ce compromis qu’intervient l’efficacité de la formation. Un système de invite d'apprentissage renforcé trop conservateur a tendance à se limiter à un ensemble restreint de cas déjà connus ; celui qui est trop exploratoire gaspille des ressources de calcul sur des invites qui, avec une forte probabilité, ne produiront pas de variance de récompense utile. LEEPS a été créé explicitement pour surmonter cette tension sans augmenter de manière significative le coût de calcul global.
Comment fonctionne le LEEPS : portefeuilles et priorités latents basés sur l’espace
LEEPS résout le problème en divisant les candidats en deux groupes distincts, appelés portefeuille d'exploitation et portefeuille d'exploration, et en répartissant de manière adaptative le budget de déploiement entre les deux en fonction de leurs taux récents de succès non triviaux. En pratique, le système observe dans quelle mesure chaque groupe d'invites a produit des signaux d'apprentissage utiles au cours des étapes de formation les plus récentes et redistribue les ressources en conséquence.
Le deuxième élément distinctif de la méthode est l'utilisation de ce que les chercheurs définissent Échantillonnage rapide LEEPS piloté par l’espace latent. Le système identifie les voisins dans l'espace de représentation interne du modèle et combine ces informations avec les résultats de déploiement historiques pour identifier les invites incertaines les plus susceptibles de générer une variance de récompense non nulle. Cette approche rend l'exploration plus ciblée, sans avoir à multiplier le nombre de déploiements générés pour tester quelles invites sont vraiment utiles.
Division rapide et utilisation des voisins dans l'espace latent
La logique sous-jacente est intuitive : si une invite a déjà montré des résultats informatifs, elle est conservée dans la boucle d'exploitation. Cependant, si une invite est nouvelle ou incertaine, LEEPS l'évalue en observant comment les invites similaires se comportent dans l'espace latent et quel historique de déploiement elles ont accumulé, en donnant la priorité à celles qui ont la plus grande probabilité de générer de véritables signaux d'apprentissage. Le résultat est une sélection plus chirurgicale et rapide que des méthodes qui traitent uniformément l’ensemble du bassin de candidats.
Résultats de référence : des gains mesurables avec des coûts minimes
Les tests impliquaient deux échelles de modèle, Qwen2.5-Math-1.5B Et Qwen2.5-Math-7Bsur six benchmarks dédiés à Raisonnement mathématique de l'IA. Dans les deux cas, LEEPS a obtenu le score moyen le plus élevé parmi les méthodes comparées, avec une amélioration relative de 2,6% sur le modèle à 1,5 milliard de paramètres et de 3,7% sur le modèle à 7 milliards de paramètres par rapport à la méthode de référence la plus performante.
Il ne s'agit pas seulement d'un gain final : selon les données rapportées, le LEEPS a tendance à s'améliorer plus rapidement même pendant le processus de formation lui-même, et pas seulement à la fin de la formation. Cet aspect est pertinent pour ceux qui travaillent surOptimisation de la formation LLMcar une convergence plus rapide signifie moins de cycles de calcul nécessaires pour atteindre le même niveau de performances.
Également tenu hors de distribution
La méthode n’a pas seulement donné de bons résultats pour les tâches pour lesquelles elle avait été calibrée. Sur trois tests de raisonnement général hors distribution – c'est-à-dire des tâches autres que celles vues pendant la formation – LEEPS a quand même obtenu le score moyen le plus élevé aux deux échelles de modèles testées. C'est un fait particulièrement important pour ceux qui évaluent la solidité d'une méthode. formation de modèles linguistiques: Une amélioration qui reste confinée aux données de formation a une valeur beaucoup plus limitée qu'une amélioration qui se transfère à de nouveaux contextes.
Un surcoût presque imperceptible
Le point probablement le plus intéressant pour ceux qui doivent décider d’adopter ou non cette approche concerne les coûts. LEEPS n'ajoute qu'environ 2 secondes de surcharge d'échantillonnage en ligne par étape de formation. Compte tenu des gains de performances et de vitesse documentés, il s’agit d’un faible coût de calcul : la méthode ne nécessite pas de déploiements supplémentaires pour identifier les invites les plus prometteuses, mais s’appuie sur les informations déjà disponibles dans l’espace latent et dans l’historique des résultats.
Ce compromis entre coût et bénéfice est ce qui rend le LEEPS attrayant par rapport à d’autres approches de sélection rapide : de nombreuses méthodes qui tentent d’améliorer l’efficacité de l’échantillonnage finissent par introduire des calculs supplémentaires qui éliminent une partie des avantages obtenus. Ici cependant, la relation entre les frais généraux et l’amélioration reste favorable aux deux échelles du modèle testé.
FAQ
Quelle problématique la méthode LEEPS répond-elle en apprentissage par renforcement ?
LEEPS résout le gaspillage de budget de génération causé par des groupes d'invites avec des récompenses de déploiement identiques grâce à une sélection d'invites avant la génération du déploiement pour améliorer l'efficacité de l'apprentissage.
Comment le LEEPS équilibre-t-il l’exploration et l’exploitation dans un échantillonnage rapide ?
LEEPS divise les invites en un portefeuille d'exploitation et un portefeuille exploratoire, allouant de manière adaptative le budget de déploiement en fonction des résultats récents, pour équilibrer la réutilisation des invites déjà connues pour être informatives avec l'exploration continue de celles incertaines.
Quelles améliorations de référence le LEEPS a-t-il réalisées ?
Le LEEPS obtient les scores moyens les plus élevés sur six tests de raisonnement mathématique à deux échelles de modèle, avec des gains relatifs de 2,6 % et 3,7 % par rapport aux méthodes de référence les plus performantes, et est également en tête sur trois tests de raisonnement général hors distribution.
LEEPS introduit-il une surcharge de calcul importante pendant la formation ?
Non : LEEPS n'ajoute qu'environ 2 secondes d'échantillonnage en ligne par étape de formation, ce qui rend la méthode efficace pour l'apprentissage par renforcement avec des récompenses vérifiables.
Contenu créé avec l’aide de l’intelligence artificielle et de la révision éditoriale humaine.