Rubrique

Modèles et LLM · page 4

ChatGPT, Gemini, Claude, Llama, Mistral et les autres : nouveaux modèles, capacités, benchmarks et coulisses des grands modèles de langage. 182 articles

DeepSeek, le pari chinois qui bouscule la course mondiale aux modèles d’IA

Avec DeepSeek-V3 puis DeepSeek-R1, la jeune entreprise chinoise a imposé son nom dans la compétition mondiale des modèles de langage. Ses résultats revendiqués, la publication de ses modèles et un coût d’entraînement annoncé bien inférieur aux estimations habituelles interrogent les équilibres technologiques entre la Chine et les États-Unis.

9 min

Comment l’IA raisonne : données, probabilités et limites des modèles

Les IA dites « raisonnantes » semblent désormais décomposer des problèmes, écrire du code ou expliquer leurs réponses. Mais elles ne pensent pas comme un humain : elles apprennent des régularités dans d’immenses volumes de données et produisent des résultats probabilistes. Voici ce qui se joue réellement derrière leurs décisions, entre progrès spectaculaires et limites fondamentales.

9 min

MMLU, MMMU, MATH : comment choisir le bon benchmark pour votre IA

Un score élevé ne suffit pas à désigner le meilleur modèle d’intelligence artificielle. MMLU, MMMU et MATH ne mesurent pas les mêmes compétences : langage, compréhension d’images ou raisonnement mathématique. Voici comment lire leurs résultats, connaître leurs limites et les compléter par des tests proches de vos usages.

9 min

ARC-AGI-2 : le nouveau test qui veut mesurer le raisonnement des IA

La fondation ARC Prize lance ARC-AGI-2, un test conçu pour mettre les modèles d’intelligence artificielle face à des problèmes qu’ils n’ont jamais vus. Après les progrès rapides réalisés sur ARC-AGI-1, la compétition 2025 veut récompenser des systèmes capables de s’adapter, de raisonner et de généraliser au-delà de leurs données d’entraînement.

9 min

Gemini 2.5 Pro : Google mise sur le raisonnement pour franchir un cap

Google présente Gemini 2.5 Pro Experimental, son nouveau modèle d’intelligence artificielle centré sur le raisonnement. En tête du classement LMArena selon l’entreprise, il promet de mieux traiter les problèmes complexes, le code et de très longs documents. Voici ce que ses résultats signifient, et comment le tester à son lancement.

8 min

OpenAI accélère sur les agents d’IA avec trois nouveaux modèles audio

OpenAI a présenté, le 20 mars 2025, trois modèles destinés à mieux faire entendre et parler les applications d’IA. Cette annonce s’inscrit dans une stratégie plus large autour des agents, ces logiciels capables d’utiliser des outils, de chercher des informations ou d’agir sur un ordinateur sous contrôle de l’utilisateur.

8 min

LG EXAONE Deep, le modèle de raisonnement qui vise les maths et le code

LG AI Research dévoile EXAONE Deep, une famille de modèles conçus pour les problèmes de mathématiques, de sciences et de programmation. Son modèle phare de 32 milliards de paramètres est accompagné de deux versions plus légères annoncées en open source, afin d’élargir l’accès aux développeurs et aux chercheurs.

8 min

Pourquoi les LLM ne suffisent pas à prédire le chemin vers l’AGI

Les grands modèles de langage impressionnent par leur capacité à écrire, résumer ou dialoguer. Mais, pour Neila Murray de Meta, ils ne tracent pas à eux seuls le chemin vers l’intelligence artificielle générale. La mémoire, le raisonnement et l’expérience concrète du monde restent des défis majeurs.

9 min