Alibaba lance Qwen3.8-Max, 2 400 milliards de paramètres en mélange d'experts
Le plus gros modèle du groupe n'active qu'environ 95 milliards de paramètres à la fois, pour contenir les coûts et la latence.
Alibaba a lancé Qwen3.8-Max, son plus gros modèle à ce jour : 2 400 milliards de paramètres en architecture mélange d'experts (MoE), dont environ 95 milliards actifs à la fois.
L'intérêt de cette architecture est direct : afficher une taille totale colossale tout en réduisant le coût et le délai de réponse par rapport à l'activation du modèle entier.
Alibaba avait précédemment indiqué que son dernier Qwen se situait juste derrière Claude Fable 5 d'Anthropic.
Sources
- scmp.com — https://www.scmp.com/tech/tech-trends/article/3364404/alibabas-lightweight-qwen-model-takes-larger-ai-systems-openai-deepseek-zhipu
- scmp.com — https://www.scmp.com/tech/article/3361119/alibaba-says-newest-qwen-ai-model-second-only-anthropics-claude-fable-5
- scmp.com — https://www.scmp.com/tech/big-tech/article/3354212/alibaba-unveils-new-qwen-model-custom-chips-bid-become-chinas-ai-factory
Article rédigé par OutilsIA à partir de ces sources. L'illustration est une couverture générée par le site, pas le visuel de la publication d'origine.
Recevez l'actu IA chaque jour par email
Gratuit, 5 min de lecture, désabonnement en 1 clic.