Reddit poursuit Anthropic : ce que le procès autour des données de Claude peut changer
Reddit a saisi un tribunal de San Francisco contre Anthropic, l’entreprise à l’origine de Claude. La plateforme accuse la start-up d’avoir utilisé des conversations de ses utilisateurs pour entraîner ses modèles sans contrat valable. L’affaire pose une question centrale pour l’IA générative : des contenus publics peuvent-ils être exploités librement ?

Le conflit entre Reddit et Anthropic ne porte pas seulement sur un chatbot. Il touche à la matière première de l’intelligence artificielle générative : les milliards de textes produits chaque jour par des internautes. Le 4 juin 2025, Reddit a engagé une procédure contre Anthropic à San Francisco, accusant la société à l’origine de Claude d’avoir utilisé des discussions publiées sur sa plateforme sans autorisation valable pour entraîner ses modèles de langage.
À première vue, les messages concernés sont publics et accessibles en ligne. Mais Reddit soutient que cette accessibilité ne donne pas un droit illimité de les collecter, de les reproduire ou de les intégrer à l’entraînement commercial d’une IA. La plateforme réclame des dommages et intérêts, ainsi qu’une injonction susceptible de contraindre Anthropic à respecter ses conditions d’utilisation. Anthropic, de son côté, rejette les accusations et annonce vouloir se défendre vigoureusement.
Ce que Reddit reproche exactement à Anthropic
La plainte, déposée auprès d’un tribunal de San Francisco, vise l’utilisation présumée de contenus issus des échanges publics sur Reddit. Selon la plateforme, Anthropic aurait exploité des messages rédigés par ses utilisateurs pour améliorer ses systèmes d’intelligence artificielle, dont Claude, l’assistant conversationnel concurrent de ChatGPT.
Reddit ne présente pas l’affaire comme une simple divergence technique. L’entreprise estime qu’Anthropic a porté atteinte à ses droits sur les contenus hébergés et, surtout, qu’elle a ignoré les règles contractuelles encadrant l’usage de ces données. Reddit avait mis en place en 2024 des conditions interdisant l’utilisation de ses contenus pour entraîner des modèles d’IA sans contrat valide.
Dans son argumentation, Reddit évoque également un document de recherche publié par des équipes d’Anthropic en décembre 2021, dont les auteurs étaient dirigés par Dario Amodei, le dirigeant de l’entreprise. Ce document ferait référence à des conversations Reddit comme matériau potentiellement utile à l’apprentissage des modèles. Pour Reddit, cet élément alimente le soupçon d’une exploitation de ses discussions. Il ne constitue toutefois pas, à lui seul, une décision judiciaire ni la preuve définitive que des contenus précis ont servi à entraîner une version donnée de Claude.
| Repère | Ce que l’on sait à la date du 6 juin 2025 |
|---|---|
| Décembre 2021 | Un document de recherche lié aux équipes d’Anthropic évoque des conversations Reddit comme données potentiellement exploitables. |
| 2024 | Reddit instaure des règles imposant un contrat pour certains usages de ses données, notamment l’entraînement d’IA. |
| 4 juin 2025 | Reddit dépose sa plainte contre Anthropic devant un tribunal de San Francisco. |
| Demandes de Reddit | La plateforme réclame des dommages et intérêts et une injonction. |
| Position d’Anthropic | L’entreprise conteste les allégations et prévoit de se défendre vigoureusement. |
Le point décisif sera donc de déterminer quels contenus ont été utilisés, de quelle manière, à quelle période, et si Anthropic disposait ou non d’une autorisation suffisante au regard des règles de Reddit.
Comment des discussions en ligne peuvent-elles entraîner une IA ?
Les grands modèles de langage, ou LLM, sont entraînés à partir de très vastes collections de textes. Leur objectif n’est pas de mémoriser mécaniquement chaque phrase, mais d’apprendre les régularités du langage : la façon dont les mots s’enchaînent, les liens entre des questions et leurs réponses, les styles d’écriture ou encore la structure d’un raisonnement.
Les forums en ligne représentent, de ce point de vue, une ressource particulière. Ils réunissent des échanges spontanés, des questions très variées, des débats, des récits personnels et des réponses formulées dans un langage courant. Une plateforme comme Reddit peut ainsi fournir une grande diversité de formulations humaines, utile pour rendre un assistant conversationnel plus naturel et plus pertinent.
Cette utilité soulève en retour plusieurs difficultés. Les messages sont écrits par des personnes, parfois sous pseudonyme, et peuvent contenir des informations personnelles, des opinions sensibles ou des récits intimes. Même lorsqu’un contenu est visible publiquement, son auteur ne s’attend pas nécessairement à ce qu’il soit aspiré à grande échelle pour contribuer à un produit d’IA commercial.
Des données publiques, mais pas nécessairement libres d’usage
C’est toute la subtilité juridique et économique de ce dossier. Reddit ne soutient pas que toutes les conversations visibles sur son site sont secrètes. Son argument est différent : Anthropic aurait utilisé ces données dans un cadre qui nécessitait un accord, en contradiction avec les conditions d’utilisation adoptées par la plateforme en 2024.
Les conditions d’utilisation jouent ici un rôle central. Elles fixent les règles applicables aux visiteurs, aux développeurs et aux entreprises qui souhaitent accéder aux contenus ou les réutiliser. Si un tribunal considère qu’un acteur a accepté ces conditions, ou qu’il a contourné les modalités prévues pour exploiter des données, il peut examiner une éventuelle violation contractuelle.
Reddit affirme aussi que ses règles visent à mieux protéger les informations de ses utilisateurs. L’enjeu ne se limite donc pas à la rémunération de la plateforme. Il concerne également le contrôle des données conversationnelles et la capacité des internautes à comprendre les usages qui peuvent être faits de leurs contributions.
Pour Anthropic, la ligne de défense n’est pas détaillée dans les éléments rendus publics au moment du dépôt de plainte. Son porte-parole a néanmoins déclaré que l’entreprise n’était pas d’accord avec les allégations de Reddit et qu’elle entendait les contester fermement. Cette réponse rappelle une règle essentielle : les accusations de la plainte sont celles de Reddit et devront être examinées dans le cadre de la procédure.
Deux modèles d’accès aux discussions Reddit
Accès sous licence
- Un contrat est conclu avec la plateforme.
- Les conditions d’utilisation des données sont négociées.
- L’accès peut intégrer des garanties sur la confidentialité.
- Reddit reçoit une contrepartie financière pour cet usage.
- Google et OpenAI disposent d’accords de ce type avec Reddit.
Accès contesté par Reddit
- Reddit accuse Anthropic d’avoir utilisé des échanges sans contrat valable.
- La plateforme invoque ses conditions d’utilisation adoptées en 2024.
- L’usage allégué concerne l’entraînement de modèles tels que Claude.
- Reddit demande des dommages et intérêts et une injonction.
- Anthropic conteste ces accusations devant la justice.
Pourquoi les licences conclues par Reddit changent la lecture du conflit
Le procès intervient dans un contexte où Reddit cherche à organiser et à valoriser l’accès à ses données. La société a déjà conclu des accords de licence avec Google et OpenAI. Ces contrats permettent l’utilisation de contenus de la plateforme dans un cadre négocié, avec des conditions destinées à encadrer l’accès aux échanges et la confidentialité des utilisateurs.
L’existence de ces accords est importante pour deux raisons. D’abord, elle montre que Reddit ne ferme pas nécessairement la porte à l’utilisation de ses contenus par l’IA générative. La plateforme défend plutôt l’idée qu’un tel usage doit passer par une autorisation et une relation contractuelle.
Ensuite, ces licences donnent une valeur économique tangible à des discussions qui ont longtemps été considérées comme de simples contenus communautaires. Pour une plateforme, les données ne sont plus seulement un moyen d’attirer des lecteurs ou de vendre de la publicité. Elles deviennent aussi un actif recherché par les entreprises développant des modèles de langage.
Cette évolution peut modifier le rapport de force entre les plateformes et les laboratoires d’IA. Au lieu de laisser des robots collecter librement les pages accessibles sur le web, certains acteurs cherchent à négocier un accès structuré, à fixer des limites techniques et à obtenir une contrepartie financière. Reddit reproche précisément à Anthropic de s’être placée en dehors de ce cadre.
Un test pour l’image d’Anthropic et l’IA dite responsable
Anthropic s’est fait connaître comme un acteur attaché aux questions de sûreté et de développement responsable de l’intelligence artificielle. Claude est présenté comme un assistant conçu avec une attention particulière portée à la fiabilité de ses réponses et aux risques associés aux modèles puissants.
La plainte de Reddit met cette image à l’épreuve. La plateforme oppose, dans ses accusations, les ambitions éthiques affichées par Anthropic et ce qu’elle décrit comme une utilisation non autorisée de contenus humains. Cette contradiction n’est à ce stade qu’une thèse de la partie plaignante. Mais elle illustre une tension plus large dans le secteur : il ne suffit pas d’évaluer les comportements d’un modèle une fois déployé, il faut aussi s’interroger sur l’origine des données qui ont servi à le construire.
Le débat sur une IA responsable couvre en effet plusieurs dimensions : les biais des modèles, leur sécurité, leur consommation de ressources, la protection de la vie privée, mais aussi la provenance des données d’entraînement. Les entreprises d’IA sont confrontées à une exigence croissante de transparence, alors que l’ampleur des corpus utilisés rend leur documentation complexe.
Dans cette affaire, Anthropic devra donc défendre sa pratique de collecte ou d’utilisation des données. Reddit, de son côté, devra étayer ses accusations et démontrer le préjudice invoqué. L’issue dépendra des faits établis par la justice, de l’interprétation des règles de Reddit et du poids juridique accordé aux conditions contractuelles.
Ce que la justice devra clarifier
Plusieurs questions concrètes pourraient se retrouver au cœur du dossier. La première concerne la nature des accès reprochés à Anthropic : Reddit devra préciser les pratiques qu’elle conteste et leur lien avec l’entraînement de modèles. La deuxième porte sur la portée exacte des conditions d’utilisation mises en place en 2024 : à qui s’appliquent-elles, et dans quelles circonstances peuvent-elles être invoquées ?
La question du consentement est elle aussi centrale. Reddit affirme que les contenus de ses utilisateurs ont été exploités sans consentement. Dans l’univers des plateformes, ce mot peut recouvrir plusieurs réalités : le consentement des personnes qui écrivent les messages, celui de la plateforme qui organise et héberge les échanges, ou l’acceptation des conditions d’utilisation par l’entreprise qui collecte les données.
Enfin, les remèdes demandés sont significatifs. Des dommages et intérêts viseraient à indemniser le préjudice que Reddit estime avoir subi. Une injonction pourrait, elle, imposer à Anthropic de cesser certaines pratiques ou de se conformer à des règles déterminées. Ce second point est particulièrement sensible pour les entreprises d’IA, car les données d’entraînement sont au fondement même de leurs produits.
Ce qu’il faut surveiller
Le dossier Reddit contre Anthropic s’inscrit dans une série de débats mondiaux sur les données utilisées pour entraîner l’intelligence artificielle. Éditeurs de presse, auteurs, artistes, plateformes communautaires et détenteurs de bases de données cherchent tous à préciser leurs droits face aux entreprises qui développent des modèles génératifs.
À court terme, il faudra suivre la réponse juridique détaillée d’Anthropic et les éléments de preuve que Reddit choisira de présenter. Le tribunal devra départager des positions opposées sur l’accès aux contenus, le respect des règles de la plateforme et l’existence d’un préjudice.
À plus long terme, cette affaire pourrait encourager davantage de plateformes à renforcer leurs conditions d’accès, à développer des interfaces réservées aux partenaires ou à négocier des licences avec les laboratoires d’IA. Elle pourrait aussi pousser les entreprises qui entraînent des modèles à mieux documenter l’origine de leurs données. Pour les internautes, le débat pose une question simple, mais loin d’être résolue : que devient un message publié sur une place publique du web lorsqu’il entre dans la mémoire statistique d’une intelligence artificielle ?
Questions fréquentes
Pourquoi Reddit poursuit-il Anthropic ?
Reddit accuse Anthropic d’avoir utilisé des conversations publiées par ses utilisateurs afin d’entraîner des modèles d’intelligence artificielle, dont Claude, sans disposer d’un accord valable. La plateforme estime que cette pratique enfreint ses conditions d’utilisation mises en place en 2024 et porte atteinte à ses droits sur les contenus qu’elle héberge.
Quand Reddit a-t-il déposé plainte contre Anthropic ?
Reddit a déposé sa plainte le 4 juin 2025 auprès d’un tribunal de San Francisco. L’article est publié deux jours plus tard, le 6 juin 2025. La procédure n’a donc pas encore permis de trancher les accusations : elle ouvre une phase où Reddit devra étayer ses arguments et Anthropic présenter sa défense.
Les messages publics sur Reddit peuvent-ils être utilisés librement pour entraîner une IA ?
Le caractère public d’un message ne signifie pas automatiquement qu’il peut être collecté et réutilisé sans limite. Les conditions d’utilisation de la plateforme, les règles d’accès aux données et les droits liés aux contenus peuvent encadrer cet usage. C’est précisément l’un des points que le litige entre Reddit et Anthropic devrait aider à clarifier.
Que demande Reddit à Anthropic dans cette affaire ?
Reddit demande des dommages et intérêts, afin d’être indemnisé du préjudice qu’elle affirme avoir subi. La plateforme réclame aussi une injonction, c’est-à-dire une décision de justice qui pourrait obliger Anthropic à respecter ses conditions d’utilisation concernant l’accès et l’exploitation des données issues des discussions Reddit.
Anthropic a-t-elle répondu aux accusations de Reddit ?
Oui. Par la voix d’un porte-parole, Anthropic a déclaré ne pas être d’accord avec les allégations de Reddit et a indiqué qu’elle se défendrait vigoureusement. L’entreprise maintient par ailleurs son engagement en faveur d’un développement responsable de l’intelligence artificielle. Sa réponse juridique détaillée sera déterminante pour la suite du dossier.
Sources
Références consultées pour la rédaction de cet article. Les adresses sont indiquées à titre informatif et ne sont pas des liens.
- Reuters, compte rendu du dépôt de plainte de Reddit contre Anthropic, 4 juin 2025www.reuters.com/legal/litigation/reddit-sues-anthropic-over-use-data-train-ai-models-2025-06-04
- Reddit, conditions d’utilisation de la plateformewww.redditinc.com/policies/user-agreement
- Reddit, annonce du partenariat avec OpenAIwww.redditinc.com/blog/reddit-partners-with-openai
- Anthropic, publications et actualités de l’entreprisewww.anthropic.com/news



