Retour au blog
AnalyseAnalyseArticle technique

Twitch ouvre les streams à l'entraînement des IA d'Amazon par défaut

Publié 13 août 2026Mis à jour 13 août 202611 min de lectureStéphane

Résumé décisionnel

Twitch ajoute un réglage permettant aux créateurs de refuser l'utilisation de leur contenu pour les futurs entraînements génératifs d'Amazon. Le choix d'un opt-out activé par défaut et les zones grises sur les données historiques alimentent la controverse.

TwitchAmazonIA générativeVie privéeDonnéesMultimodal
Twitch ouvre les streams à l'entraînement des IA d'Amazon par défaut

Streams, VOD, clips, chats, images et textes : Twitch permet désormais aux créateurs de refuser que le contenu de leur chaîne soit utilisé pour entraîner les modèles d'IA générative d'Amazon. Le problème ? Le réglage est activé par défaut. Et la justification donnée par Twitch a déclenché une vive réaction de la communauté.

Le 12 août 2026, Twitch a ajouté dans ses paramètres de confidentialité une nouvelle option baptisée « Training for Generative AI ».

Présentée comme un nouveau contrôle offert aux utilisateurs, elle révèle surtout quelque chose de plus important : le contenu publié sur Twitch peut servir à l'entraînement de modèles d'intelligence artificielle générative développés par Amazon.

Et par défaut, l'autorisation est activée.

Autrement dit, un streamer qui ne modifie pas ce réglage peut voir le contenu associé à sa chaîne utilisé pour de futurs entraînements de modèles capables de générer ou synthétiser du texte, de l'audio, des images ou de la vidéo.

Twitch ne demande pas de participer : il faut demander à ne pas participer

C'est probablement le point qui concentre le plus de critiques.

Twitch aurait pu choisir un fonctionnement opt-in : aucun contenu n'est utilisé tant que le créateur n'a pas explicitement donné son accord.

La plateforme a choisi l'inverse.

Le système fonctionne en opt-out : l'utilisation pour l'entraînement est autorisée par défaut et c'est au créateur de trouver le réglage et de le désactiver s'il souhaite s'y opposer.

Interrogé sur ce choix pendant l'émission officielle Patch Notes, Mike Minton, Chief Product Officer de Twitch, a donné une réponse particulièrement directe :

« If this was opt-in, nobody would opt in. »

Puis il a ajouté que c'était, tout simplement, la véritable raison du choix effectué par Twitch.

Cette déclaration est probablement plus importante que le réglage lui-même.

Elle signifie que Twitch sait qu'une grande partie de sa communauté ne choisirait probablement pas volontairement de fournir son contenu pour entraîner des modèles génératifs. La plateforme préfère donc considérer l'autorisation comme acquise jusqu'à ce que l'utilisateur manifeste son refus.

Mary Kish, responsable de la communauté chez Twitch, ne semblait d'ailleurs pas s'attendre à un accueil enthousiaste. Durant la même présentation, elle a reconnu que Twitch ne s'attendait pas à ce que les utilisateurs soient heureux ou particulièrement favorables à cette annonce.

Quels contenus peuvent être utilisés ?

Le périmètre est particulièrement large.

Lorsque l'option reste activée, Twitch indique que plusieurs types de contenus associés à une chaîne peuvent être utilisés pour améliorer de futurs modèles génératifs d'Amazon :

  • les livestreams ;
  • les VOD ;
  • les clips ;
  • les Highlights ;
  • les messages du chat du stream ;
  • les images présentes sur la chaîne ;
  • les textes publiés sur la chaîne.

Les modèles concernés ne sont pas uniquement des LLM produisant du texte. Twitch parle explicitement de modèles capables de générer ou synthétiser du texte, de l'audio, des images ou de la vidéo.

La plateforme donne même un exemple concret : l'audio provenant d'un stream pourrait contribuer à améliorer des systèmes de reconnaissance vocale et de conversion de la parole en texte. Ces améliorations pourraient ensuite bénéficier aux sous-titres de Twitch, mais également à d'autres produits d'Amazon.

On comprend alors pourquoi les données de Twitch peuvent être particulièrement intéressantes pour un groupe développant des modèles multimodaux.

Un livestream rassemble naturellement plusieurs types d'informations synchronisées : voix, images, vidéo, texte affiché à l'écran, actions, réactions du streamer et réponses du public dans le chat.

Ce n'est donc pas simplement une immense collection de vidéos. C'est un flux continu de données audio, visuelles et textuelles liées entre elles.

Le cas particulier du chat est encore plus étonnant

Le fonctionnement du chat introduit une subtilité importante.

Supposons que vous possédiez une chaîne Twitch et que vous désactiviez l'utilisation de votre contenu pour l'entraînement.

Les messages écrits dans votre propre chat seront concernés par votre choix.

En revanche, si vous allez discuter sur la chaîne d'un autre streamer, c'est le réglage de ce streamer qui déterminera si les messages publiés dans son chat peuvent être utilisés.

Votre propre préférence ne vous suit donc pas nécessairement lorsque vous participez à une autre communauté.

Cette particularité montre à quel point la question de la propriété et du contrôle des données devient complexe sur une plateforme sociale.

Un message est écrit par un utilisateur, dans le chat d'un autre utilisateur, sur une infrastructure appartenant à Twitch, elle-même propriété d'Amazon.

Lorsqu'il s'agit d'entraîner une IA, la question apparemment simple — « qui peut décider de l'utilisation de ce message ? » — devient beaucoup moins évidente.

Désactiver l'option ne désactive pas toute l'IA de Twitch

Autre distinction importante : le nouveau réglage concerne spécifiquement l'entraînement de modèles génératifs.

Le désactiver ne signifie pas que Twitch arrête tout traitement automatisé ou tout usage du machine learning sur votre contenu.

Des systèmes comme AutoMod, les recommandations, certaines fonctions liées à la découverte des contenus, les outils de sécurité ou encore certaines fonctions de sous-titrage peuvent continuer à fonctionner. Twitch distingue ces traitements nécessaires ou utiles au fonctionnement de la plateforme de l'utilisation des données pour entraîner des modèles capables de générer de nouveaux contenus.

Cette distinction est importante.

Utiliser un modèle pour détecter un message potentiellement toxique dans un chat n'est pas la même chose qu'intégrer des millions de messages à un corpus destiné à améliorer un futur modèle génératif.

Le nouveau bouton ne désactive que la seconde catégorie.

Amazon utilisait déjà du contenu Twitch pour l'IA en 2024

L'annonce du 12 août pourrait donner l'impression qu'Amazon commence seulement maintenant à utiliser Twitch pour l'intelligence artificielle.

Ce n'est pas exactement le cas.

Lors d'un événement organisé par The Information en 2024, Mike Minton avait déjà confirmé qu'Amazon utilisait du contenu Twitch dans le cadre de travaux liés à l'entraînement de modèles.

Il avait toutefois précisé qu'il s'agissait alors de prototypage, et non d'une utilisation à l'échelle de la production.

Ce qui change en août 2026 n'est donc pas nécessairement le début de l'utilisation des données Twitch.

Ce qui change surtout, c'est que Twitch fournit désormais un mécanisme explicite permettant de refuser leur utilisation pour les futurs entraînements génératifs.

Et c'est là qu'apparaît une zone grise importante.

Que devient le contenu éventuellement utilisé auparavant ?

Twitch emploie une formulation très précise : désactiver le réglage empêche l'utilisation du contenu pour les futurs entraînements.

Mais la plateforme n'a pas expliqué publiquement :

  • quels modèles Amazon ont déjà été entraînés avec des données Twitch ;
  • quelles catégories ou quantités de contenu ont été utilisées ;
  • depuis quand cette utilisation existe exactement ;
  • si des datasets historiques contenant ces données seront supprimés ;
  • si le refus aura un quelconque effet sur des modèles déjà entraînés.

Mike Minton lui-même a expliqué qu'il ne savait pas exactement ce qu'Amazon avait utilisé ou non dans ses entraînements précédents, puisqu'il n'était pas responsable des efforts d'entraînement de modèles au niveau d'Amazon.

C'est probablement le point qui mérite aujourd'hui le plus de transparence.

Cliquer sur « off » peut empêcher une utilisation future. Cela ne signifie pas automatiquement qu'une donnée éventuellement utilisée auparavant disparaît d'un dataset ou que son influence est retirée d'un modèle déjà entraîné.

Twitch n'a annoncé aucun mécanisme de ce type.

Pourquoi les données Twitch ont autant de valeur pour l'IA

L'intérêt d'un catalogue comme Twitch devient évident lorsque l'on regarde l'évolution des modèles génératifs.

Les premiers grands modèles accessibles au public étaient essentiellement spécialisés dans le texte. Les nouvelles générations cherchent de plus en plus à comprendre simultanément texte, image, audio et vidéo, voire à interagir avec des environnements informatiques.

Pour entraîner ce type de systèmes, disposer de données dans lesquelles plusieurs modalités sont naturellement synchronisées est particulièrement intéressant.

Un stream de jeu vidéo peut, par exemple, associer :

une action à l'écran → une réaction vocale du streamer → une expression du visage → une réponse instantanée de milliers de personnes dans le chat.

Un stream créatif peut montrer une tâche accomplie progressivement tout en étant commentée oralement.

Une discussion ou une interview fournit de longues séquences de langage parlé avec intonation, contexte et réactions sociales.

Cela ne signifie évidemment pas qu'Amazon utilise toutes ces données de cette manière : l'entreprise n'a pas publié la composition de ses datasets.

Mais cela permet de comprendre pourquoi une plateforme comme Twitch représente potentiellement une ressource extrêmement attractive dans la course aux modèles multimodaux.

Pour les streamers professionnels, la question dépasse également la simple propriété d'une vidéo.

Un créateur produit progressivement une véritable identité numérique :

sa voix, son visage, sa façon de parler, ses expressions récurrentes, son humour, ses réactions et sa manière d'interagir avec sa communauté.

Or ce sont précisément des caractéristiques que les technologies génératives modernes cherchent de plus en plus à reproduire ou synthétiser.

Le débat ne porte donc plus seulement sur la possibilité qu'un système apprenne à partir d'une vidéo.

Il pose une question plus large :

jusqu'où une plateforme peut-elle transformer l'activité et l'identité numérique de ses utilisateurs en matière première pour ses futurs systèmes d'intelligence artificielle ?

Et surtout : qui doit prendre l'initiative du consentement ?

Le créateur qui souhaite participer ?

Ou le créateur qui souhaite refuser ?

C'est précisément pour cette raison que la déclaration de Mike Minton a provoqué autant de réactions. Dire que presque personne ne participerait si le système était volontaire revient indirectement à reconnaître que le choix du réglage par défaut change radicalement le résultat.

Comment désactiver l'entraînement génératif sur Twitch

Pour les utilisateurs souhaitant refuser cette utilisation, Twitch permet désormais de désactiver le réglage.

Il faut se rendre dans :

Settings → Security and Privacy → Training for Generative AI

puis désactiver l'option.

Le réglage se trouve dans les paramètres du compte Twitch, et non dans le Creator Dashboard. Le lien direct est disponible dans la section des ressources ci-dessous.

Une fois désactivée, Twitch indique que le contenu de la chaîne ne sera plus utilisé pour les futurs entraînements de modèles génératifs Amazon destinés à produire ou synthétiser du texte, de l'audio, des images ou de la vidéo.

Le véritable débat dépasse largement Twitch

Twitch n'est probablement qu'un épisode supplémentaire d'un changement beaucoup plus profond de l'économie d'Internet.

Pendant des années, les grandes plateformes ont accumulé des quantités considérables de contenus principalement pour permettre leur diffusion, leur recommandation, leur modération et leur monétisation publicitaire.

Avec l'arrivée de l'IA générative, ces mêmes archives acquièrent une nouvelle valeur.

Une vidéo n'est plus seulement une vidéo à recommander à un spectateur.

Elle peut devenir une donnée d'entraînement.

Une conversation n'est plus seulement un échange entre utilisateurs.

Elle peut devenir un exemple linguistique.

Une voix, une image, un clic ou une réaction peuvent potentiellement contribuer à l'amélioration d'un modèle.

Le conflit qui se dessine n'oppose donc pas simplement les utilisateurs à l'intelligence artificielle.

Il concerne surtout la manière dont la valeur créée par des millions d'utilisateurs peut être réutilisée lorsque les objectifs d'une plateforme évoluent.

Twitch offre désormais un moyen de refuser l'utilisation future de son contenu pour entraîner les modèles génératifs d'Amazon. C'est incontestablement davantage de contrôle qu'en l'absence totale de réglage.

Mais le fait que ce contrôle prenne la forme d'un opt-out activé par défaut, combiné au manque d'informations sur les utilisations historiques, laisse une question essentielle ouverte :

quand une entreprise trouve une nouvelle utilisation extrêmement précieuse aux données accumulées pendant des années, le silence de l'utilisateur peut-il vraiment être considéré comme un accord ?

Dans le cas de Twitch, la réponse du directeur produit a au moins le mérite d'être exceptionnellement claire :

si Amazon avait attendu que les utilisateurs choisissent volontairement de participer, presque personne ne l'aurait fait.

Et c'est peut-être précisément pour cette raison que cette affaire mérite d'être suivie.

Sources

  • Réglage officiel Twitch — Security and Privacy
  • Twitch — Privacy Notice
  • Twitch — émission officielle Patch Notes, déclaration de Mike Minton et intervention de Mary Kish, 12 août 2026.
  • The Information — événement 2024 consacré à l'utilisation de données Twitch pour le prototypage de modèles.
  • Ars Technica, TechCrunch, The Verge, Business Insider et The Register — recoupements de l'annonce, du périmètre des contenus concernés et de la portée du réglage.

Les paramètres et leur libellé peuvent évoluer. La portée documentée ici concerne l'entraînement génératif futur ; elle ne constitue pas une confirmation que les données historiques ont été supprimées des jeux de données ou des modèles déjà entraînés.

Endpoint RouterLab

Tester l’API RouterLab

Passez d’un article à une requête réelle : créez un essai, récupérez une clé et appelez les modèles depuis une API compatible OpenAI.

https://api.routerlab.ch/v1

Mesure d’audience

Acceptez-vous Google Analytics pour mesurer les visites des pages publiques ? Votre choix est facultatif et modifiable à tout moment.