Sujet

Benchmarks

Tous les articles d’Actu.ai consacrés à Benchmarks : actualités, analyses et explications sur ce sujet lié à l’intelligence artificielle. 22 articles

Évaluer l’IA : pourquoi ses performances ne suffisent pas à convaincre

L’intelligence artificielle n’est pas jugée sur ses seules performances. Une méta-analyse de 163 études montre que son acceptation dépend aussi du degré de personnalisation attendu dans la décision. Pour la fraude, elle inspire plus facilement confiance. Pour un recrutement ou un diagnostic, l’intervention humaine reste souvent décisive.

9 min

MMLU, MMMU, MATH : comment choisir le bon benchmark pour votre IA

Un score élevé ne suffit pas à désigner le meilleur modèle d’intelligence artificielle. MMLU, MMMU et MATH ne mesurent pas les mêmes compétences : langage, compréhension d’images ou raisonnement mathématique. Voici comment lire leurs résultats, connaître leurs limites et les compléter par des tests proches de vos usages.

9 min

ARC-AGI-2 : le nouveau test qui veut mesurer le raisonnement des IA

La fondation ARC Prize lance ARC-AGI-2, un test conçu pour mettre les modèles d’intelligence artificielle face à des problèmes qu’ils n’ont jamais vus. Après les progrès rapides réalisés sur ARC-AGI-1, la compétition 2025 veut récompenser des systèmes capables de s’adapter, de raisonner et de généraliser au-delà de leurs données d’entraînement.

9 min

Chatbot Arena : les modèles d’IA réellement en tête en février 2025

Le classement Chatbot Arena met en lumière une course serrée entre les grands modèles conversationnels. En février 2025, Chocolate, associé à une première version de Grok-3, atteint 1 402 points Elo, devant Gemini-2 Flash Thinking Exp 01-21 à 1 385 points. Mais ces scores ne suffisent pas, à eux seuls, à désigner le meilleur outil pour chaque usage.

9 min

Qwen 2.5-Max : Alibaba revendique l’avantage sur DeepSeek V3

Alibaba place son nouveau modèle Qwen 2.5-Max devant DeepSeek V3 dans plusieurs évaluations de référence, dont Arena-Hard, LiveBench et GPQA-Diamond. Préentraîné sur plus de 20 000 milliards de tokens, ce modèle de type Mixture-of-Experts vise à conjuguer raisonnement, code et facilité d’intégration pour les développeurs.

9 min