Voter n’est peut-être pas choisir
Fal.live diffuse des chaînes vidéo générées en continu, chacune basée sur le modèle MiniMax H3 Max. Anime, sitcom, soap opera, storybook, chaos : plusieurs univers tournent en parallèle, chacun avec son style d’image, de voix ou de musique, produites en même temps et en direct par la machine. Régulièrement, un vote s’ouvre : quatre instructions proposées, les spectateurs choisissent, le flux repart dans la direction gagnante. Pendant le test, une des chaînes était protégée par un mot de passe comme un rappel discret, et peut-être non voulu, que ces chaînes appartiennent à quelqu’un.
Alors qu’on a l’impression de décider, on choisit en réalité entre quatre propositions qu’un modèle a lui-même générées, à l’intérieur d’un cadre esthétique et éthique que ses éditeurs ont déjà fixé avant même qu’on ouvre la page. Le vote donne le sentiment du contrôle. Il porte sur la suite d’une diffusion, jamais sur les règles qui la rendent possible.
Ces règles-là, on ne les voit presque jamais, et elles viennent de plein d’endroits à la fois. Les développeurs d’une application choisissent d’intégrer tel modèle plutôt qu’un autre, et ce choix embarque déjà des données et des méthodes d’entraînement décidées loin de nous, par des équipes dont on ignore jusqu’au nom, avec des filtres et des refus qu’on découvre parfois par accident en testant un outil plusieurs jours de suite. On l’a déjà croisé avec Ecosia et son choix d’adosser ses fonctionnalités IA à Mistral Small : le choix d’un modèle n’est pas neutre, il porte une cohérence… ou son absence si ce choix est lié uniquement au coût ou à la performance.
Il y a aussi les choix de l’entreprise qui décide de garder une fonctionnalité gratuite ou de la réserver à un abonnement. De faire d’une fonctionnalité un outil marketing comme fal.live pour montrer que MiniMax H3 Max est disponible parmi les modèles proposés dans l’abonnement de fal.ai. De retirer un produit qui ne trouve pas son modèle économique, ou au contraire de continuer d’investir sur un segment que d’autres abandonnent (on l’avait abordé dans la lettre 35 avec la fermeture de Sora).
Il y a l’hébergement aussi, question qui est loin d’être purement technique : un modèle tournant sur une infrastructure alimentée en énergie décarbonée comme dans Euria n’a pas le même impact environnemental qu’un modèle hébergé dans un datacenter construit en plein désert.
Il y a les tensions géopolitiques, comme celles entre la Chine et les États-Unis relancées il y a peu, qui dessinent deux écosystèmes de modèles, chacune avec ses logiques commerciales et d’ouverture très différentes.
Il y a la régulation, quand l’Europe impose des garde-fous que d’autres continents ne posent pas ou du moins qu’ils n’ont pas encore.
Il y a aussi des choix plus proches de nous, ceux qu’un collectif professionnel fait pour l’ensemble de ses membres en déployant telle ou telle application.
Et au niveau de l’utilisateur, il y a à nouveau le vote proposé : un geste qui donne l’impression de décider, mais qui nourrit probablement en silence, le modèle qui l’a proposé.
Cette liste n’est certainement pas complète, et je ne suis pas expert sur tous ces sujets pour la dresser finement. Elle montre juste que les décisions qui façonnent un outil et son usage sont nombreuses, dispersées, souvent invisibles les unes aux autres, et qu’aucune d’entre elles n’est finalement prise par la personne qui, au bout de la chaîne, chacune et chacun d’entre nous, clique sur une des quatre options proposées dans fal.live.
Mais rien de cette liste n’est entièrement à charge, chaque point est à nuancer. Un filtre peut protéger, une régulation peut poser des garde-fous utiles, un choix industriel peut profiter à l’utilisateur. Le problème n’est pas que ces choix existent, c’est que l’utilisateur ne les connaît pas tout le temps ou n’y a pas accès.
Toutes ces décisions sont prises avant que l’outil n’arrive entre nos mains. On choisit une instruction, une couleur, un ton, une direction dans un flux vidéo. On ne choisit presque jamais le cadre dans lequel ce choix a lieu, ni les personnes qui l’ont façonné pour nous.
Une partie de ces choix reste même invisible jusque dans la réponse elle-même. Un modèle décide, à chaque génération, de ce qu’il dit explicitement et de ce qu’il laisse sous-entendu, de ce qu’il développe et de ce qu’il éclipse. C’est le sujet de “Voyage au pays du non-écrit”, l’application construite à partir d’un article d’Arthur Sarazin pour repérer ce que les réponses des IA génératives ne disent pas : l’implicite, le sous-entendu, l’angle mort, le détail supposé acquis sans jamais l’énoncer. Ce sont aussi des choix, ils sont peut-être plus difficiles à voir parce que personne ne nous demande de voter dessus.
Et si connaître ces règles, justement, était déjà une façon d’agir ? Individuellement, ça change ce qu’on accepte de choisir sans y penser. Collectivement, ça change ce qu’on est capables d’exiger : plus de transparence sur un modèle, une réglementation, un mode d’hébergement. Ça ne rendra certainement jamais visible chaque niveau de décision, mais peut-être que prendre l’habitude de se poser la question, plutôt que de croire que voter parmi quatre options c’est décider entièrement, finira par peser sur ce qu’on exige en retour de transparence ?
Faut-il encore se demander si on garde la main sur ce qu’on produit avec un outil, ou si on sait encore repérer, dans les quatre options qu’on nous propose, la trace des choix qu’on ne nous a pas laissé faire ?
En écho :
- Lettre 39, “La recherche après la recherche ?”,
- Lettre 35, “Génération de vidéo, une géographie qui se dessine ?”.