Sujet

Modèles de langage · page 4

Tous les articles d’Actu.ai consacrés à Modèles de langage : actualités, analyses et explications sur ce sujet lié à l’intelligence artificielle. 125 articles

Claude : les classificateurs constitutionnels font chuter les jailbreaks

Anthropic présente les classificateurs constitutionnels, une couche de sécurité conçue pour empêcher les utilisateurs de contourner les garde-fous des chatbots. Lors de tests sur Claude 3.5 Sonnet, le taux de réussite des jailbreaks est passé de 86 % à 4,4 %. Une avancée prometteuse, qui ne signifie pas pour autant la fin des attaques.

8 min

Mamba, l’architecture qui veut alléger les limites des transformers

Mamba propose une autre voie que l’attention dense des transformers : un mécanisme à états conçu pour traiter efficacement de longues séquences. Cette architecture ne condamne pas ChatGPT ou Claude, mais elle éclaire une question centrale pour l’IA : comment retenir davantage d’informations sans faire exploser les calculs ?

8 min

DeepSeek : cinq repères pour comprendre l’IA chinoise face à ChatGPT

Avec ses modèles R1 et V3, DeepSeek s’est imposé en janvier 2025 comme une alternative chinoise très visible à ChatGPT. Ses performances revendiquées, son coût d’entraînement affiché et son accès gratuit ont frappé les esprits. Mais les chiffres méritent d’être nuancés, tandis que les restrictions sur les sujets politiques posent une limite claire.

9 min

DeepSeek : ce que son essor révèle vraiment sur la course mondiale à l’IA

Avec DeepSeek-V3 puis DeepSeek-R1, la startup chinoise a imposé son nom dans le débat mondial sur l’intelligence artificielle. Ses résultats techniques et ses annonces de coûts ont secoué les marchés, sans pour autant justifier tous les raccourcis. Performances, innovation, rivalité avec OpenAI et protection des données : ce que l’on sait réellement début février 2025.

9 min

Qwen 2.5-Max : Alibaba revendique l’avantage sur DeepSeek V3

Alibaba place son nouveau modèle Qwen 2.5-Max devant DeepSeek V3 dans plusieurs évaluations de référence, dont Arena-Hard, LiveBench et GPQA-Diamond. Préentraîné sur plus de 20 000 milliards de tokens, ce modèle de type Mixture-of-Experts vise à conjuguer raisonnement, code et facilité d’intégration pour les développeurs.

9 min

Lucie suspendue : ce que son lancement raté révèle des IA françaises

Mise en ligne le 23 janvier 2025, Lucie devait incarner une approche française, ouverte et éducative de l’intelligence artificielle. Quelques jours plus tard, le projet porté par Linagora et le CNRS a suspendu son activité, après la diffusion virale de réponses absurdes. Au-delà des moqueries, l’épisode éclaire les limites concrètes des modèles de langage.

8 min