Régulation et éthique

Reddit poursuit Anthropic : qui contrôle les données utilisées pour entraîner l’IA ?

Reddit a engagé une action contre Anthropic, qu’il accuse d’avoir collecté et exploité sans autorisation les conversations de sa plateforme pour entraîner Claude. Au-delà d’un conflit commercial, l’affaire pose une question décisive : un contenu visible en ligne peut-il être librement utilisé pour fabriquer une IA ?

Des discussions en ligne sont collectées par des robots devant une barrière juridique liée à l’IA.
Illustration : Actu.ai

Au 6 juin 2025, Reddit vient d’ouvrir un nouveau front judiciaire dans la bataille qui oppose les plateformes du web aux entreprises d’intelligence artificielle. Le réseau de communautés en ligne accuse Anthropic, créatrice de l’assistant Claude, d’avoir collecté ses contenus à grande échelle sans autorisation afin d’alimenter ses modèles d’IA.

L’enjeu dépasse la seule relation entre deux entreprises technologiques. Les conversations publiées sur Reddit sont accessibles au public, mais Reddit soutient que cette accessibilité ne donne pas un droit illimité de les aspirer et de les exploiter commercialement. La plainte pose ainsi une question centrale pour tout l’écosystème de l’IA générative : qui peut autoriser, monétiser et contrôler l’utilisation des milliards de messages déposés chaque jour sur le web ?

Ce que Reddit reproche à Anthropic

Selon Reddit, Anthropic aurait eu recours à des bots, c’est-à-dire des programmes automatisés, pour extraire un volume important de discussions et de publications présentes sur la plateforme. L’objectif présumé était de fournir des données textuelles aux modèles d’IA d’Anthropic, notamment Claude.

Reddit affirme que cette collecte s’est faite sans contrat, sans rémunération et sans consentement écrit. Or, la plateforme met en avant ses conditions d’utilisation : les utilisateurs, y compris les robots d’exploration, ne peuvent pas utiliser les contenus du site à des fins commerciales sans accord formel.

Il est important de distinguer ici les faits établis des allégations. Reddit présente ces éléments dans le cadre de sa procédure et demande à la justice de les examiner. Anthropic n’a donc pas été reconnue responsable à ce stade. Mais la plainte est particulièrement sensible parce qu’elle cible une entreprise qui a largement mis en avant une approche prudente et responsable de l’intelligence artificielle.

RepèreCe que Reddit affirmePourquoi cela compte
Conditions d’utilisationL’usage commercial des contenus nécessiterait un accord écrit.Le litige porte notamment sur la valeur juridique de ces règles face à la collecte automatisée.
Juillet 2024Anthropic aurait indiqué avoir cessé de collecter les contenus de Reddit.Reddit conteste que cet arrêt ait réellement été suivi d’effet.
Après juillet 2024Les journaux de la plateforme auraient relevé plus de 100 000 tentatives d’accès de bots d’Anthropic.Ce chiffre constitue l’un des éléments invoqués par Reddit pour soutenir ses accusations.
Début juin 2025Reddit engage une action en justice contre Anthropic.La plateforme réclame réparation et l’arrêt de l’exploitation contestée de ses données.

La plateforme reproche donc moins une consultation occasionnelle de pages publiques qu’une extraction industrielle de données. Cette différence est essentielle : un internaute peut lire une discussion pour participer à un échange, tandis qu’un robot peut parcourir et copier rapidement une très grande quantité de messages afin de constituer un corpus exploitable.

Comment les contenus du web servent-ils à entraîner une IA ?

Les grands modèles de langage, souvent désignés par le sigle LLM, apprennent à produire du texte en analysant d’immenses ensembles de contenus. Ils repèrent des régularités dans la langue, les raisonnements, les styles d’écriture et les enchaînements de questions-réponses. Les forums sont particulièrement précieux dans cette logique, car ils réunissent des échanges spontanés sur une multitude de sujets, avec des formulations proches du langage courant.

Reddit représente à ce titre une source singulière. On y trouve des discussions techniques, des conseils pratiques, des témoignages personnels, de l’humour, des débats et des explications données par des membres de communautés très spécialisées. Pour entraîner un assistant conversationnel, ce matériau peut sembler attractif : il ressemble précisément au type de dialogue que l’utilisateur attend d’une IA.

Mais la disponibilité technique d’un contenu n’efface pas automatiquement les règles qui encadrent son usage. Une page peut être consultable sans connexion, tout en restant soumise à des conditions d’utilisation. Elle peut aussi contenir des contributions qui relèvent, selon les cas, de droits d’auteur, de données personnelles ou de choix de suppression effectués par leurs auteurs.

Cette question ne concerne pas seulement Reddit. Les développeurs de modèles d’IA ont besoin de volumes considérables de textes, d’images, de sons ou de vidéos. À mesure que les contenus facilement accessibles sont revendiqués par leurs créateurs, éditeurs ou plateformes, la collecte de données devient à la fois un enjeu juridique et un poste de coût stratégique.

Un contenu public appartient-il à tout le monde ?

C’est le nœud du dossier. Reddit défend l’idée que ses contenus ne peuvent pas être assimilés à une réserve de données librement exploitable par toute entreprise capable de les collecter. La plateforme estime qu’Anthropic aurait dû négocier une licence avant d’utiliser les conversations de ses utilisateurs pour ses produits commerciaux.

Dans les faits, le débat recouvre plusieurs questions qui ne se confondent pas :

  • les droits que les auteurs conservent éventuellement sur leurs publications ;
  • les droits accordés à Reddit au moment de publier sur la plateforme ;
  • la portée des conditions d’utilisation imposées aux visiteurs et aux robots ;
  • le statut de données parfois personnelles ou sensibles présentes dans les échanges ;
  • la possibilité de transformer un ensemble de messages en ressource d’entraînement pour une IA commercialisée.

L’accès à une conversation n’implique donc pas automatiquement le droit de la reproduire, de l’archiver, de la traiter ou de l’utiliser pour développer un service payant. Inversement, le simple fait qu’un contenu ait été utilisé dans un jeu de données ne permet pas, à lui seul, de déterminer si une infraction a eu lieu. C’est à la justice d’apprécier les règles applicables et les faits précis de l’affaire.

Le procès pourrait néanmoins contribuer à fixer une ligne plus lisible. Si les plateformes parviennent à faire reconnaître que leurs règles contractuelles encadrent strictement l’entraînement des modèles, les entreprises d’IA pourraient devoir privilégier davantage les accords de licence. Si cette thèse échoue, le web ouvert pourrait rester une source de données plus largement accessible, sous réserve d’autres règles applicables.

Accords de licence et collecte contestée : deux situations opposées

Partenaires sous licence selon Reddit

  • Reddit indique avoir conclu des accords formels avec certaines entreprises d’IA, dont Google et OpenAI.
  • L’exploitation commerciale des contenus s’inscrit dans un cadre contractuel négocié.
  • La plateforme évoque des mesures techniques visant à tenir compte des contenus supprimés par les utilisateurs.
  • Ces licences peuvent constituer une source de revenus pour Reddit.

Anthropic selon la plainte

  • Reddit affirme qu’aucun accord formel ne liait les deux entreprises.
  • Anthropic est accusée d’avoir utilisé des bots pour collecter des conversations et publications.
  • Les journaux de Reddit auraient comptabilisé plus de 100 000 tentatives d’accès après juillet 2024.
  • La plateforme demande l’arrêt de l’utilisation contestée de ses données et des réparations financières.

Pourquoi les contenus supprimés sont au cœur du conflit

La plainte insiste aussi sur un sujet particulièrement concret pour les utilisateurs : la suppression d’un message. Lorsqu’une personne efface une publication, elle peut raisonnablement s’attendre à ce qu’elle ne soit plus disponible sur la plateforme. Or, une copie effectuée auparavant par un système externe peut rester présente dans les archives ou les jeux de données de ce système.

Selon Reddit, ses accords avec d’autres entreprises d’IA, parmi lesquelles Google et OpenAI, prévoient des mesures techniques liées au respect des contenus supprimés. La plateforme souligne qu’aucun accord formel de ce type n’existerait avec Anthropic.

Reddit soutient ainsi que des données retirées par leurs auteurs pourraient encore se trouver dans l’architecture de Claude si elles avaient été collectées auparavant. Cette affirmation ne signifie pas qu’un assistant peut nécessairement restituer un message supprimé à la demande. Les modèles de langage ne fonctionnent pas comme de simples moteurs de recherche affichant une base de données ligne par ligne. Ils intègrent des régularités statistiques pendant l’entraînement, ce qui rend le retrait ciblé d’un élément potentiellement complexe.

Pour les internautes, l’enjeu est surtout celui du contrôle. Supprimer un message sur le site où il a été publié ne garantit pas toujours qu’il disparaîtra de toutes les copies déjà réalisées par des tiers. La généralisation de l’IA donne une nouvelle portée à ce problème ancien du web, car les copies peuvent ensuite contribuer au fonctionnement de services utilisés par des millions de personnes.

Ce que Reddit demande à la justice

Reddit ne se contente pas de dénoncer une pratique qu’il juge illicite. La plateforme demande des réparations financières, notamment au titre de l’augmentation des frais de serveurs et de pertes de revenus liées aux licences de données qu’elle estime avoir subies.

Elle demande également une injonction, autrement dit une décision judiciaire susceptible d’obliger Anthropic à cesser d’utiliser les contenus de Reddit. D’après les éléments avancés par la plateforme, cette demande pourrait aller jusqu’à empêcher la commercialisation de produits, dont Claude, issus de l’exploitation contestée de ses données.

Une telle mesure aurait une portée considérable. Interdire ou limiter l’usage commercial d’un modèle ne revient pas seulement à empêcher une nouvelle collecte : cela pose la question du traitement de données déjà incorporées à la chaîne de développement d’une IA. Faudrait-il retravailler les jeux de données, réentraîner certains systèmes ou démontrer que les contenus concernés ne contribuent plus au produit ? Ce sont des opérations coûteuses et techniquement difficiles.

L’image d’Anthropic mise à l’épreuve

Anthropic s’est construite une réputation d’entreprise attentive aux questions de sûreté et d’éthique dans l’intelligence artificielle. Les accusations de Reddit prennent donc une dimension particulière. La plateforme oppose cette image publique à ce qu’elle décrit comme une collecte non autorisée de contenus et conteste les déclarations selon lesquelles Anthropic aurait cessé de parcourir Reddit en juillet 2024.

Le cas illustre une tension devenue fréquente dans le secteur. Les entreprises d’IA promettent des systèmes plus responsables, mais elles doivent aussi réunir les données et les capacités de calcul nécessaires à la construction de modèles performants. Or, les données de qualité ont une valeur économique croissante. Les plateformes peuvent choisir de les licencier, de les réserver à certains partenaires ou de tenter d’en empêcher l’extraction automatisée.

Pour Anthropic, le procès représente donc à la fois un risque juridique et un défi de crédibilité. Pour Reddit, il s’agit de défendre un actif stratégique : les contributions de ses communautés. Depuis que les modèles génératifs ont rendu les données conversationnelles particulièrement recherchées, ces échanges constituent non seulement le cœur de l’expérience utilisateur, mais aussi une ressource que les plateformes cherchent à mieux contrôler.

Ce qu’il faut surveiller

La première question sera celle des preuves. Les journaux d’accès évoqués par Reddit, les modalités exactes de fonctionnement des bots et la nature des contenus effectivement collectés seront déterminants. La justice devra également apprécier la portée des conditions d’utilisation de Reddit et la manière dont elles peuvent s’appliquer à une entreprise ayant recours à des outils automatisés.

La deuxième concerne les contenus supprimés. Le dossier pourrait pousser les plateformes et les entreprises d’IA à formaliser davantage les mécanismes de retrait, de mise à jour des jeux de données et de gestion des copies. C’est un point sensible pour les internautes, qui attendent une cohérence entre la suppression d’un message et sa disparition des usages ultérieurs.

Enfin, le procès pourrait accélérer une évolution déjà visible : le passage d’un web considéré comme une vaste source de données disponible à un marché de licences négociées. Dans ce modèle, les créateurs de contenus, les médias, les forums et les plateformes cherchent à obtenir une contrepartie lorsque leurs archives servent à développer des IA commerciales.

L’affaire Reddit contre Anthropic ne décidera pas seule du futur de l’entraînement des modèles. Mais elle rend très concrète une interrogation appelée à se multiplier : à quelles conditions les entreprises d’IA peuvent-elles apprendre à partir des paroles, des questions et des expériences publiées en ligne par des millions d’utilisateurs ?

Questions fréquentes

Pourquoi Reddit poursuit-il Anthropic ?

Reddit accuse Anthropic d’avoir collecté ses conversations et publications au moyen de bots afin d’entraîner ses modèles d’IA, notamment Claude, sans accord écrit. La plateforme estime que cette pratique contrevient à ses conditions d’utilisation, qui encadrent l’exploitation commerciale de ses contenus. Ces accusations devront être examinées par la justice.

Anthropic a-t-elle utilisé les données de Reddit pour entraîner Claude ?

C’est ce que Reddit affirme dans sa plainte. La plateforme accuse Anthropic d’avoir extrait de grands volumes de contenus publiés par ses utilisateurs pour alimenter ses systèmes d’IA. Au 6 juin 2025, il s’agit d’allégations formulées dans une procédure judiciaire, et non d’une responsabilité déjà établie par une décision de justice.

Un contenu public sur Reddit peut-il être utilisé librement par une IA ?

Pas nécessairement. Le fait qu’un message soit visible en ligne ne règle pas à lui seul la question de sa réutilisation commerciale. Les conditions d’utilisation de la plateforme, les droits éventuels des auteurs, la collecte automatisée et la nature des données concernées peuvent tous entrer en jeu. Le procès vise précisément à clarifier cette frontière.

Que deviennent les messages Reddit supprimés par leurs auteurs ?

Un message supprimé disparaît normalement de la plateforme, mais il peut avoir été copié auparavant par des services tiers. Reddit affirme que ses accords avec certains partenaires d’IA prévoient des mécanismes liés au respect des suppressions. La plateforme reproche à Anthropic l’absence d’un accord comparable et s’inquiète de l’usage potentiel de contenus retirés.

Quelles conséquences ce procès peut-il avoir pour les entreprises d’IA ?

Si les demandes de Reddit prospèrent, les entreprises d’IA pourraient être incitées à négocier davantage de licences avant d’utiliser des contenus issus de plateformes en ligne. L’affaire pourrait aussi renforcer les exigences concernant les robots de collecte, les contenus supprimés et la traçabilité des données utilisées pour entraîner des modèles commerciaux.

Sources

Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.

  1. Reddit, conditions d’utilisation de la plateformewww.redditinc.com/policies/user-agreement
  2. Reuters, rubrique juridique consacrée aux contentieux technologiqueswww.reuters.com/legal