Modèles et LLM

Claude 4 : Anthropic muscle ses agents IA et sa programmation assistée

Avec Claude Opus 4 et Claude Sonnet 4, Anthropic entend faire progresser les agents capables de programmer et de mener des tâches complexes. Les nouveaux modèles combinent réponses rapides, raisonnement approfondi et outils destinés aux développeurs, avec une ambition claire : rendre l’IA plus utile dans les environnements logiciels réels.

Développeur analysant du code avec un assistant IA relié à des fichiers et à un terminal informatique.
Illustration : Actu.ai

Les assistants d’intelligence artificielle ne se limitent plus à suggérer une ligne de code ou à résumer un document. Leur prochaine étape consiste à enchaîner des actions : explorer un projet logiciel, comprendre une erreur, modifier plusieurs fichiers, tester une correction et revenir sur leurs choix si le résultat n’est pas satisfaisant. C’est sur ce terrain, celui des agents IA capables de travailler avec davantage d’autonomie, qu’Anthropic positionne sa nouvelle famille Claude 4, annoncée en mai 2025.

Cette génération comprend deux modèles : Claude Opus 4, le plus ambitieux, et Claude Sonnet 4, conçu pour concilier performances et polyvalence. Tous deux mettent l’accent sur le développement logiciel, mais Anthropic les destine aussi à des tâches de recherche, de rédaction et de traitement d’instructions complexes. L’enjeu ne se résume donc pas à produire du texte ou du code plausible : il s’agit de rendre les assistants plus fiables lorsqu’un travail demande de nombreuses étapes et une certaine persistance.

Deux modèles pour faire évoluer les agents IA

Un agent IA est un système qui ne répond pas seulement à une question isolée. Il peut utiliser des outils, consulter un environnement logiciel, exécuter certaines actions et poursuivre un objectif défini par l’utilisateur. Dans le cas de la programmation, cela peut par exemple signifier analyser une base de code, identifier les fichiers concernés par un bug, proposer une modification, puis lancer des tests.

Claude 4 arrive dans un contexte où les éditeurs de logiciels cherchent à intégrer ces assistants directement dans les outils utilisés quotidiennement par les développeurs. La difficulté est considérable : un modèle doit conserver le fil d’un problème, respecter les consignes données, naviguer sans se perdre dans des milliers de lignes de code et éviter les modifications inutiles ou dangereuses.

Anthropic présente Claude Opus 4 comme son modèle le plus puissant à ce jour pour ces usages. Il est destiné aux tâches complexes qui peuvent se prolonger pendant plusieurs heures. Claude Sonnet 4, de son côté, se veut plus généraliste : l’objectif est de fournir un modèle suffisamment performant pour des applications fréquentes, tout en restant plus accessible en coût.

Claude Opus 4 revendique de solides résultats en programmation

Pour étayer ses ambitions, Anthropic met en avant deux résultats de benchmark pour Claude Opus 4 : 72,5 % sur SWE-bench Verified et 43,2 % sur Terminal-Bench. Ces évaluations portent sur des capacités particulièrement importantes pour les agents de programmation.

SWE-bench Verified mesure la capacité d’un système à résoudre des problèmes issus de projets logiciels réels. Il ne suffit pas d’écrire un extrait de code isolé : le modèle doit proposer un correctif compatible avec un dépôt existant et avec les tests associés. Terminal-Bench s’intéresse, lui, à l’aptitude d’un agent à réaliser des tâches à travers un terminal informatique, un environnement où les commandes doivent être exécutées dans le bon ordre et où une erreur peut compromettre la suite du travail.

ÉvaluationScore communiqué pour Claude Opus 4Ce que le test cherche à mesurer
SWE-bench Verified72,5 %La résolution de problèmes d’ingénierie logicielle provenant de dépôts réels
Terminal-Bench43,2 %L’exécution de tâches dans un environnement de terminal

Ces chiffres donnent une indication, pas une garantie de résultat pour tous les projets. Un benchmark repose sur un protocole précis, un jeu de tâches défini et des conditions d’exécution qui ne reproduisent pas nécessairement la complexité d’un système informatique en production. La sécurité du code, la connaissance des règles internes d’une entreprise ou les compromis d’architecture restent notamment des sujets où une revue humaine demeure indispensable.

La promesse d’Opus 4 réside moins dans l’écriture instantanée d’une fonction que dans sa capacité à maintenir un effort sur un problème long. Pour les équipes techniques, c’est un changement de nature : l’IA peut potentiellement devenir un collaborateur qui prépare une solution, documente ses choix et accélère des tâches répétitives, plutôt qu’un simple outil d’autocomplétion.

Sonnet 4, le modèle polyvalent appelé à toucher plus d’utilisateurs

Anthropic présente Claude Sonnet 4 comme le modèle adapté à une variété d’applications quotidiennes. La société souligne ses progrès dans le suivi d’instructions complexes, la clarté du raisonnement et le travail dans les bases de code. Cette capacité à mieux naviguer dans un projet est centrale : lorsqu’un assistant sélectionne les mauvais fichiers ou interprète mal les dépendances entre composants, une réponse techniquement convaincante peut rester inutilisable.

GitHub a annoncé son intention d’utiliser Claude Sonnet 4 comme modèle de base de son nouvel agent de codage dans GitHub Copilot. Cette intégration illustre le positionnement du modèle : être suffisamment robuste pour agir dans un environnement de développement, tout en servant de moteur à un produit susceptible d’être utilisé à grande échelle.

Les retours préliminaires cités par Anthropic, notamment ceux de Manus, mettent également en avant une amélioration dans les scénarios où l’IA doit respecter de nombreuses contraintes. C’est utile pour la programmation, mais aussi pour des tâches comme la préparation d’une analyse structurée, la recherche dans un ensemble de documents ou la production d’un livrable suivant un format précis.

Claude Opus 4 et Claude Sonnet 4 : quels usages privilégier ?

Claude Opus 4

  • Modèle le plus puissant de la famille Claude 4 selon Anthropic.
  • Pensé pour le codage et les tâches complexes nécessitant une forte persistance.
  • Affiche 72,5 % sur SWE-bench Verified et 43,2 % sur Terminal-Bench.
  • Coûte 15 dollars par million de jetons entrants et 75 dollars en sortie.
  • S’adresse en priorité aux cas où la qualité justifie un coût plus élevé.

Claude Sonnet 4

  • Modèle polyvalent destiné à des usages plus larges et quotidiens.
  • Met l’accent sur le suivi d’instructions et la navigation dans les bases de code.
  • GitHub prévoit de l’utiliser pour son nouvel agent de codage dans Copilot.
  • Coûte 3 dollars par million de jetons entrants et 15 dollars en sortie.
  • Doit aussi être proposé aux utilisateurs gratuits de Claude.

Réponses rapides ou raisonnement approfondi : comment fonctionne l’approche hybride ?

La famille Claude 4 introduit une approche dite hybride. Selon la tâche, le modèle peut fournir une réponse immédiate ou consacrer davantage d’étapes à l’examen du problème. La première option correspond aux demandes simples : reformuler un passage, répondre à une question factuelle ou proposer un court extrait de code. La seconde vise les tâches où il faut comparer plusieurs pistes, planifier une démarche ou vérifier des hypothèses.

Cette distinction répond à une limite concrète des assistants : tout problème ne mérite pas le même temps de calcul. Une réponse plus réfléchie peut améliorer le traitement d’une tâche complexe, mais elle peut aussi prendre plus de temps et mobiliser davantage de ressources. À l’inverse, demander une analyse longue pour une question élémentaire serait inefficace.

Le mode de réflexion approfondie est accessible dans les forfaits Pro, Max, Team et Enterprise d’Anthropic. Claude Sonnet 4, avec ses capacités avancées, doit aussi être proposé aux utilisateurs gratuits. Cette disponibilité est importante : Sonnet est le modèle qui semble appelé à devenir la porte d’entrée la plus courante vers les nouveautés de Claude 4.

De nouveaux outils pour construire des applications plus autonomes

Un modèle performant ne suffit pas à créer un agent utile. Pour agir dans un environnement réel, l’IA doit pouvoir échanger des informations avec des fichiers, des programmes et des services externes. Anthropic accompagne donc Claude 4 de plusieurs fonctions proposées aux développeurs via son API.

Le premier élément est un outil d’exécution de code. Il permet aux modèles d’exécuter réellement du code, ce qui ouvre la voie à des applications interactives et à des démarches de résolution de problèmes plus concrètes. Au lieu de se limiter à suggérer une opération, un assistant peut ainsi s’appuyer sur l’exécution pour avancer dans une tâche.

Anthropic introduit également un connecteur MCP. MCP, pour Model Context Protocol, sert à standardiser l’échange de contexte entre un assistant IA et des environnements logiciels. En pratique, une telle passerelle peut aider une application à transmettre au modèle les informations dont il a besoin, sans devoir concevoir un mécanisme spécifique pour chaque intégration.

Les autres ajouts annoncés sont les suivants :

  • une API de fichiers, pour faciliter le travail direct avec des documents et d’autres fichiers ;
  • la mise en cache des requêtes, qui permet de conserver des requêtes courantes pendant une heure afin d’accélérer les interactions répétées ;
  • des outils pensés pour composer des agents capables d’utiliser plusieurs sources de contexte au cours d’une même tâche.

Pour les entreprises, ces briques techniques peuvent compter autant que le modèle lui-même. Une IA qui produit de bonnes réponses mais ne peut pas accéder de façon contrôlée aux bons fichiers ou aux bons outils restera limitée. À l’inverse, relier un agent à trop de ressources sans garde-fous peut multiplier les risques d’erreurs et d’exposition de données.

Prix et accès : Opus pour les tâches les plus exigeantes, Sonnet pour les usages courants

Anthropic conserve une tarification distincte entre les deux modèles. Le prix est exprimé par million de jetons. Un jeton est une unité de texte traitée par le modèle, qui peut correspondre à une portion de mot, un mot court ou un signe de ponctuation. Les jetons entrants désignent les informations envoyées au modèle, tandis que les jetons sortants correspondent au texte ou au code généré.

ModèlePrix par million de jetons entrantsPrix par million de jetons sortantsPositionnement
Claude Opus 415 dollars75 dollarsTâches complexes, programmation et agents de longue durée
Claude Sonnet 43 dollars15 dollarsUsages polyvalents et déploiements plus larges

L’écart est significatif, en particulier sur les jetons générés par le modèle. Il reflète le positionnement d’Opus 4 comme une solution destinée aux tâches où la qualité et la persistance justifient un coût plus élevé. Sonnet 4 apparaît comme l’option plus adaptée à des services devant traiter un volume important de demandes.

Les deux modèles sont disponibles via l’API d’Anthropic. Ils sont également accessibles sur Amazon Bedrock et Google Cloud Vertex AI, deux plateformes utilisées par les organisations qui souhaitent intégrer des modèles d’IA dans leur infrastructure cloud existante.

Ce qu’il faut surveiller avec les agents de programmation

Claude 4 illustre l’évolution rapide des assistants vers des systèmes qui ne se contentent plus de conseiller, mais participent au déroulement d’un travail. Pour les développeurs, cela peut faire gagner du temps sur la recherche d’erreurs, les tests, la documentation ou les modifications répétitives. Pour les éditeurs de logiciels, cela ouvre la perspective de produits capables de prendre en charge une partie croissante du cycle de développement.

Mais l’autonomie reste à encadrer. Un agent qui accède à un dépôt de code, à des fichiers ou à un terminal doit être limité aux droits nécessaires. Les entreprises devront préciser ce que l’outil est autorisé à lire, modifier ou exécuter, conserver des traces de ses actions et prévoir une validation avant le déploiement de changements importants.

La question centrale, en mai 2025, n’est donc pas seulement de savoir quel modèle obtient le meilleur score. Elle est de déterminer dans quelles conditions ces modèles peuvent devenir des outils de travail fiables. Avec Opus 4, Sonnet 4 et les nouvelles briques de son API, Anthropic cherche précisément à faire passer les agents IA du stade de démonstration à celui d’assistants intégrés aux processus concrets de création logicielle.

Questions fréquentes

Qu’est-ce que Claude 4 d’Anthropic ?

Claude 4 est une famille de modèles d’intelligence artificielle annoncée par Anthropic en mai 2025. Elle comprend Claude Opus 4, destiné aux tâches de programmation et de raisonnement les plus exigeantes, et Claude Sonnet 4, plus polyvalent. Ces modèles sont conçus pour aider à réaliser des tâches complexes, notamment avec des outils et des environnements logiciels.

Quelle différence entre Claude Opus 4 et Claude Sonnet 4 ?

Claude Opus 4 est le modèle haut de gamme d’Anthropic, positionné sur le codage complexe et les tâches qui demandent de la persistance. Claude Sonnet 4 vise davantage les usages courants et les déploiements à plus grande échelle. Leur prix diffère fortement : Opus 4 est facturé 15 dollars par million de jetons entrants, contre 3 dollars pour Sonnet 4.

Quel est le score de Claude Opus 4 sur SWE-bench ?

Anthropic indique que Claude Opus 4 atteint 72,5 % sur SWE-bench Verified. Ce benchmark mesure la capacité d’un système à résoudre des problèmes logiciels inspirés de projets réels. Le modèle obtient aussi 43,2 % sur Terminal-Bench, une évaluation centrée sur des tâches exécutées dans un terminal informatique.

Claude 4 peut-il programmer de façon autonome ?

Claude 4 est conçu pour renforcer les agents IA capables d’enchaîner des étapes de travail, notamment dans la programmation. Avec les outils proposés par Anthropic, un agent peut exploiter du code, des fichiers et des environnements logiciels. Cela ne dispense toutefois pas de contrôle humain : les modifications de code et les actions exécutées doivent être vérifiées avant une mise en production.

Où peut-on utiliser Claude Opus 4 et Claude Sonnet 4 ?

Les modèles Claude 4 sont disponibles via l’API d’Anthropic. Ils sont aussi proposés sur Amazon Bedrock et Google Cloud Vertex AI, ce qui facilite leur intégration dans des environnements cloud professionnels. Sur les interfaces d’Anthropic, le mode de réflexion approfondie est accessible avec les forfaits Pro, Max, Team et Enterprise.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Anthropic, annonce de Claude 4www.anthropic.com/news/claude-4
  2. Anthropic, tarification de Claudewww.anthropic.com/pricing
  3. GitHub Blog, présentation du nouvel agent de codage GitHub Copilotgithub.blog/news-insights/product-news/github-copilot-meet-the-new-coding-agent