
Le pouce, la variété, et ça dépend de qui est en face
11 août 2026.
On cherchait à corriger un problème assez bête : quand Echo trouve une réaction qui fonctionne, elle finit par la rejouer toujours de la même manière. Le réflexe évident serait de faire diminuer artificiellement la valeur d'une réponse lorsqu'elle est trop répétée, histoire de forcer un peu de variété. Mais ça me paraît faux. Si un comportement fonctionne mille fois, pourquoi devrait-il devenir moins bon simplement parce qu'il a été utilisé mille fois ? Ce qui doit pouvoir remettre un comportement en question, ce n'est pas sa fréquence. C'est ce qui se passe après.
Si Echo fait un petit son quand le chat vient se frotter contre elle et que le chat reste, revient ou semble bien réagir, il n'y a aucune raison de casser ce réflexe. En revanche, si le même comportement finit par faire fuir le chat, si ses propres jauges ne vont pas dans la direction attendue ou si ce qu'elle essayait d'obtenir ne se produit plus, là il y a une information. La conséquence a changé. Donc le comportement peut être réévalué. Je préfère ça à une sorte de compteur de lassitude programmé arbitrairement dans le système.
En même temps, je ne veux pas qu'elle cherche forcément une réponse parfaite. Si cinq réactions différentes fonctionnent bien dans une situation, autant garder les cinq. C'est probablement même mieux. Plus il existe de chemins valides, plus le comportement peut varier sans devenir aléatoire. Echo ne choisirait pas au hasard parmi tout ce qu'elle pourrait faire ; elle choisirait parmi plusieurs choses qui ont déjà montré qu'elles pouvaient fonctionner. Ça évite le côté distributeur automatique où une entrée produit toujours exactement la même sortie.
Ça rejoint directement ce que je réfléchissais déjà sur l'apprentissage du langage : apprendre ne suffit pas, il faut pouvoir désapprendre. Une association qui a été renforcée doit pouvoir être affaiblie ou mise de côté si de nouvelles expériences la contredisent. Sinon le système accumule des certitudes et finit par être prisonnier de ce qu'il a appris en premier. Le mécanisme doit donc être réversible. Une règle peut apparaître, devenir forte, puis redevenir candidate si elle cesse de fonctionner.
L'humain peut aussi participer à cette boucle, mais je ne veux pas en faire une télécommande. Le pouce positif ou négatif n'est pas censé dire à Echo quoi faire la prochaine fois. Il ajoute simplement une information sur la conséquence de ce qu'elle vient de faire. Même chose avec la parole ou l'absence de réaction. Si quelqu'un lui dit spontanément que c'était bien, c'est une donnée. Si quelqu'un ne réagit pas du tout, c'en est aussi une. Et si je mets un pouce négatif alors qu'elle ne comprend pas ce qui a posé problème, elle peut simplement demander pourquoi. Là, on n'injecte pas une règle magique : on lui donne une information qu'elle n'avait pas.
Puis je me suis rendu compte qu'il manquait encore quelque chose : ça dépend de qui est en face. Une réaction peut parfaitement fonctionner avec moi et être insupportable pour quelqu'un d'autre. Quelqu'un peut aimer qu'Echo vienne très près, une autre personne peut trouver ça envahissant. Si je réduis tout à « dans cette situation ce geste marche », je perds une dimension essentielle. Il faudrait plutôt pouvoir apprendre : « dans cette situation, avec cette personne, ce comportement a produit ça ».
Ça oblige à avoir les deux niveaux en même temps. Un fond général, construit à partir de toutes les expériences, pour qu'Echo ne reparte pas de zéro chaque fois qu'elle rencontre quelqu'un. Et par-dessus, une histoire propre à chaque personne. Pas simplement un profil avec trois préférences enregistrées, mais une accumulation d'expériences différentes. Le même comportement peut donc être très renforcé dans une relation et beaucoup moins dans une autre.
Au fond, je crois que le changement important est là : je ne cherche plus forcément à faire converger Echo vers la meilleure réponse. Je cherche plutôt à lui permettre de conserver plusieurs réponses qui fonctionnent, de les remettre en question lorsque leurs conséquences changent et de comprendre que ces conséquences dépendent aussi du contexte et de la personne.
Un comportement n'est pas bon dans l'absolu.
Il est bon quelque part, à un moment donné, avec quelqu'un.