Le dernier modèle de l'alibaba dépasse O1-Mini d'Openai et est à égalité avec DePseek R1

Le dernier modèle de l'alibaba dépasse O1-Mini d'Openai et est à égalité avec DePseek R1

En résumé

  • Alibaba Cloud a présenté QWQ-32B, un modèle d'IA avec 32 500 millions de paramètres qui correspondaient aux performances de modèles beaucoup plus grands dans les tâches de raisonnement et de codage.
  • Malgré ses limites dans le mélange linguistique et le raisonnement récursif, le modèle a obtenu des scores exceptionnels dans les évaluations mathématiques et est open source sous la licence Apache 2.0.
  • Olllama et Groq ont ajouté le support pour QWQ-32B, permettant leur intégration dans des applications tierces avec une inférence ultra-graphe, ce qui renforce la compétitivité d'Alibaba dans l'IA.

Alibaba Cloud a présenté un nouveau modèle du raisonnement qui parvient à correspondre aux performances de concurrents beaucoup plus grands, bien qu'il soit une fraction de sa taille.

La division du cloud computing du géant technologique chinois offre sa dernière proposition en contestant l'idée que le plus grand est toujours meilleur dans le monde de l'IA.

Surnommé QWQ-32B, le modèle est construit sur la base de QWEN2.5-32B d'Alibaba et utilise 32,5 milliards de paramètres, tout en offrant un rendement comparable à Deepseek R1, qui abrite 671 milliards de paramètres.

La réalisation de David contre Goliath a attiré l'attention des chercheurs et des développeurs au niveau mondial.

« Ce résultat remarquable souligne l'efficacité de la RL lorsqu'il est appliqué à des modèles de base robustes prétentés avec une connaissance approfondie du monde », a déclaré l'équipe Qwen d'Alibaba dans son Entrée de blog.

Selon la société, QWQ-32B se démarque, en particulier dans les tâches de raisonnement mathématique et de codage.

« Nous découvrons que la formation RL peut améliorer en permanence les performances, en particulier en mathématiques et en codage, et nous observons que l'évolutivité RL continue peut aider un modèle de taille moyenne pour atteindre des performances compétitives contre un gigantesque modèle MOE », a écrit Alibaba dans son tweet d'annonce.

Il a obtenu 65,2% en GPQA (un test de raisonnement scientifique au niveau du troisième cycle), 50% dans l'AIME (mathématiques avancées) et un impressionnant 90,6% en MATH-500, qui couvre un large éventail de problèmes mathématiques, selon les résultats de référence interne.

La communauté de l'IA a répondu avec enthousiasme. « Absolument charmant! » indiqué Vaibhav Srivastav, un scientifique des données et chercheur en AI, tandis que Julien Chaumond, CTO à Huggin Face dit que le « change tout ».

Et, bien sûr, il y avait aussi des mèmes amusants.

En outre, Olllama et Groq ont annoncé qu'ils avaient mis en œuvre la prise en charge du modèle, ce qui signifie que les utilisateurs peuvent désormais programmer des agents open source et utiliser ce modèle dans des applications de troisième partie, réalisant des vitesses d'inférence sans précédent avec l'infrastructure GROQ.

Cette amélioration de l'efficacité marque un changement possible dans l'industrie, où la tendance a été vers des modèles de plus en plus importants. D'un autre côté, QWQ-32B adopte une approche similaire à celle de Deepseek R1, démontrant que les techniques de formation intelligentes peuvent être aussi importantes que la quantité de paramètres bruts en matière de performance de l'IA.

QWQ-32B a des limites. Parfois, il a des difficultés avec le mélange linguistique et peut tomber dans des boucles de raisonnement récursives qui affectent son efficacité.

De plus, comme les autres modèles d'IA chinois, il répond aux exigences réglementaires locales qui peuvent restreindre les réponses sur les problèmes politiquement sensibles et possède une fenêtre de contexte de jetons limité 32K.

Ouvrir la sauce

Contrairement à de nombreux systèmes avancés d'IA, en particulier en provenance d'Amérique et des pays occidentaux, qui opèrent en retard de murs de paiement, QWQ-32B est disponible en tant que logiciel open source sous licence Apache 2.0.

Le lancement se poursuit jusqu'au lancement en janvier d'Alibaba de Qwen 2.5-maxque la société a déclaré qu'elle avait dépassé les concurrents « presque dans tous les aspects ».

Ce lancement précédent s'est produit lors des célébrations de la nouvelle année lunaire, mettant en évidence la pression concurrentielle face aux sociétés technologiques chinoises dans le paysage de l'IA en évolution rapide.

L'influence des modèles chinois dans l'état de l'industrie de l'IA est telle que dans une déclaration antérieure sur cette question, le président Donald Trump a décrit sa performance comme un « appel d'attention » pour la Silicon Valley, mais les considérait comme « une opportunité plutôt qu'une menace ».

Lorsque Deepseek R1 a été lancé, a provoqué une chute importante En bourse, mais QWQ-32B n'a pas affecté les investisseurs de la même manière.

En général, le nasdaq est en panne, principalement pour des raisons politiques Au lieu d'un FUD attribué à l'influence d'Alibaba.

Malgré cela, Alibaba considère ce lancement comme le seul début.

« Cela marque la première étape de Qwen dans l'évolutivité de l'apprentissage du renforcement pour améliorer les capacités de raisonnement », a déclaré la société dans son article de blog.

« Nous sommes sûrs que la combinaison de modèles de base plus solides avec une RL entraînée par des ressources de calcul à l'échelle nous rapprochera pour atteindre l'intelligence artificielle générale (AGI). »

Édité par Sebastiaan Sinclair

Généralement intelligent Bulletin

À un voyage hebdomadaire sur l'IA raconté par Gen, au modèle générateur d'IA.

Voir l’article original en espagnol

Audible
🎧 Découvrez le plaisir de l’écoute avec Audible d’Amazon ! Cliquez maintenant et obtenez votre premier livre audio GRATUIT. Ne manquez pas cette chance de transformer vos trajets en aventures épiques ! 📚