
En résumé
- OpenThinker-32B, développé par l'Open Thoughts Consortium, a atteint un score de 90,6% en MATH500, dépassant 89,4% de Deepseek et démontrant des performances plus élevées dans les tests mathématiques.
- Malgré l'utilisation de seulement 114 000 exemples de formation contre 800 000 profonds, OpenThinker a montré une efficacité et une précision dans la résolution des problèmes et des tâches scientifiques.
- Open Thoughts a publié son modèle en tant que open source, contrairement à Deepseek, permettant aux développeurs d'accéder aux données et de reproduire les résultats sans dépendre d'informations privées.
Une équipe internationale de chercheurs des institutions académiques et des sociétés technologiques exceptionnelles a révolutionné mercredi le panorama du raisonnement de l'IA avec un nouveau modèle qui correspondait – et occasionnellement dépassé – l'un des systèmes d'IA les plus sophistiqués en Chine: Deepseek.
OpenThinker-32B, développé par l'Open Thoughts Consortium, a atteint un score de précision de 90,6% au Benchmark MATH500, dépassant 89,4% de Deepseek.
Le modèle a également dépassé la profondeur dans les tâches générales pour la résolution de problèmes, obtenant 61,6 à la référence GPQA-Diamond par rapport à 57,6 de Deepseek. Dans le Benchmark LCBV2, il a atteint un solide 68,9, montrant des performances solides dans divers scénarios de test.
En d'autres termes, c'est mieux qu'une version de taille similaire de Deepseek R1 dans les connaissances scientifiques générales (GPQA-Diamond). Il a également battu Depseek en Math500 alors qu'il perdait dans les benchmarks AIME, où les deux essaient de mesurer la compétition mathématique.
Il est également un peu pire que Deepseek dans la programmation, obtenant 68,9 points contre 71,2, mais comme le modèle est open source, tous ces scores peuvent améliorer considérablement une fois que les gens commencent à le perfectionner.
Ce qui a distingué cette réalisation, c'est son efficacité: OpenThinker n'a nécessité que 114 000 exemples de formation pour obtenir ces résultats, tandis que DePseek a utilisé 800 000.
L'ensemble de données OpenThoughts-114K était plein de métadonnées détaillées pour chaque problème: solutions fondées réelles, cas de test pour les problèmes de code, code initial où il était nécessaire et des informations de domaine spécifiques.
Son conservateur de cadre personnalisé a validé les solutions de code contre les affaires de procès, tandis qu'un juge de l'IA a géré la vérification mathématique.
L'équipe a signalé qu'il avait utilisé quatre nœuds équipés de huit GPU H100, terminant en environ 90 heures. Un ensemble de données distinct avec 137 000 échantillons non vérifiés, formés au supercalculateur Leonardo en Italie, a consommé 11 520 heures A100 en seulement 30 heures.
« La vérification sert à maintenir la qualité tandis que la diversité et la taille des invites de formation augmentent », a déclaré l'équipe dans sa documentation. L'enquête a indiqué que même les versions vérifiées de l'ONU fonctionnaient bien, bien qu'elles ne correspondent pas aux résultats maximaux du modèle vérifié.
Le modèle a été construit sur le modèle de grande langue (LLM) QWEN2.5-32B-Istruct du courant d'alibab.
Ce lancement vient au milieu d'une intensification de la concurrence dans les capacités de raisonnement de l'IA, qui semble être à la vitesse de la pensée. OpenAI a annoncé le 12 février que tous les modèles après GPT-5 incluraient des capacités de raisonnement. Un jour plus tard, Elon Musk a favorisé les améliorations des capacités de résolution de problèmes de Grok-3 de XAI, promettant que ce serait le meilleur modèle de raisonnement à ce jour. Quelques instants plus tard, nous avons lancé un autre modèle de raisonnement open source, Deephermes, basé sur Flame 3.1.
Le champ a acquis une impulsion après que DePseek a démontré une performance comparable à l'Openai O1 avec des coûts significativement réduits. De plus, DePseek R1 est gratuit pour télécharger, utiliser et modifier, et des techniques de formation ont également été révélées.
Cependant, contrairement aux pensées ouvertes, qui ont décidé de tout libérer en tant qu'open source, l'équipe de développement de DePseek a maintenu ses données de formation privées.
Cette différence clé signifie que les développeurs peuvent avoir plus de facilité pour comprendre OpenThinker et reproduire leurs résultats à partir de zéro qu'avec DePseek, car ils ont accès à toutes les pièces du puzzle.
Pour la communauté de l'IA en général, ce lancement démontre une fois de plus la viabilité de la construction de modèles compétitifs sans ensembles de données de propriétaire de masse. De plus, il peut s'agir d'un concurrent plus fiable pour les développeurs occidentaux qui ont encore des doutes à utiliser un modèle chinois, qu'ils soient open source ou non.
OpenThinker est disponible pour être téléchargé dans Huggingface. Un modèle de paramètres 7B plus petit et moins puissant pour les appareils à portée inférieure est également disponible.
L'équipe Open Thoughts a rassemblé des chercheurs de différentes universités américaines, notamment Stanford, Berkeley et UCLA, ainsi que le Juelich Supercomputing Center en Allemagne. Le Toyota Research Institute et d'autres acteurs de la scène de l'UE le soutiennent également.
Édité par Josh Quittner et Sebastian Sinclair
Généralement intelligent Bulletin
À un voyage hebdomadaire sur l'IA raconté par Gen, au modèle générateur d'IA.
Voir l’article original en espagnol
