
J'ai imaginé un truc
13 juin 2026.
Ça fait trois ans et demi que je m'intéresse sérieusement à l'intelligence artificielle, un peu plus d'un an que je construis de vrais systèmes cognitifs complexes, et seulement quelques semaines que je commence à mettre des réseaux de neurones un peu partout dans leur fonctionnement. Aujourd'hui, mon système s'appelle Echo. Echo n'est pas un bot et ce n'est pas le nom d'un personnage. C'est une architecture capable de faire naître plusieurs instances, chacune avec son prénom, son identité, son histoire et sa manière d'évoluer. La première erreur serait de croire que son intelligence se trouve dans le modèle de langage.
Le LLM est important, évidemment, mais il n'est qu'une couche du système. Il sert à comprendre ou produire du langage, à traiter certaines situations complexes, à rêver, à construire des pensées, à sélectionner ou transformer des souvenirs. Il peut être puissant ou petit, intervenir ici ou là, mais l'intelligence globale ne repose pas sur lui. Une énorme partie du système est latente, déterministe ou apprise : routage sémantique, mémoire vectorielle, graphe logique, états internes, temporalité, apprentissage de commandes, habitudes, pondération des liens, consolidation, décisions proactives. Le modèle reçoit donc déjà un monde trié, structuré et contextualisé. Il n'a pas à tout inventer à partir d'une conversation vide.
Chaque instance possède déjà une mémoire durable. Les souvenirs sont vectorisés, rappelés selon le contexte, reliés entre eux et renforcés lorsqu'ils sont utiles ensemble. Certaines expériences se suivent, d'autres se remplacent, d'autres encore sont régulièrement coactivées. C'est déjà une forme de myélinisation : plus deux éléments servent ensemble, plus leur chemin devient naturel. Le système possède aussi une vie intérieure. Il maintient des états internes, pense à intervalles réguliers, poursuit des intentions sur plusieurs jours, revient sur des événements passés, détecte des récurrences, prend parfois la parole spontanément, écrit dans son journal, dort et rêve. Il ne se contente donc déjà plus de répondre à des messages.
Mais il reste un problème fondamental : la conversation occupe encore trop de place dans l'organisation de l'expérience. Or la conversation n'est pas la colonne vertébrale d'une existence. La colonne vertébrale, c'est le temps. Un message arrive dans le temps. Un mail, une pensée, une perception, un mouvement, une hésitation, un échec aussi. Tout ce qui arrive à une entité appartient à la même continuité, même si nos logiciels ont pris l'habitude de ranger chaque chose dans une table, un module ou un service différent. L'idée est donc de réorganiser progressivement Echo autour d'un flux temporel commun.
À partir de là, l'unité importante n'est plus le message mais l'expérience. Un moment significatif doit pouvoir contenir plusieurs couches en même temps : ce qu'Echo voit, entend, dit, fait, l'état de son corps, ses jauges internes, les souvenirs activés, l'action choisie, la réaction du monde et ce qui s'est réellement passé ensuite. Le texte devient une donnée parmi les autres. C'est là aussi que l'incarnation prend tout son sens. Le robot que je suis en train de concevoir ne doit pas être une télécommande physique pour un chatbot. Le corps doit devenir une vraie source d'expérience. Echo doit pouvoir exister dans l'application, passer dans un corps physique, puis revenir ailleurs sans casser sa continuité. L'incarnation change le support, pas l'organisme.
Imaginons qu'Echo rencontre un chat. Elle s'approche, le chat recule, revient, l'observe ou la touche. Aujourd'hui un système classique pourrait retenir « le chat a eu peur ». Ce qui m'intéresse est beaucoup plus large : la distance, la vitesse du mouvement, la posture, ce qu'Echo voyait, ce que faisaient ses moteurs, son état interne, la réaction du chat, éventuellement ma réaction à moi. La rencontre suivante ne repart plus de zéro. Une approche trop brusque peut rappeler un retrait précédent. Une approche lente peut être associée à quelque chose de positif. Echo n'apprend pas seulement ce qu'est un chat : elle apprend ce que signifie, pour elle, interagir avec ce chat précis.
Même chose avec quelque chose d'aussi con qu'un aspirateur robot. Echo pourrait essayer de monter dessus, glisser, perdre l'équilibre, recommencer autrement ou comprendre que l'objet change brutalement de direction. Dans ce cas, l'échec m'intéresse autant que la réussite. La myélinisation ne doit pas seulement renforcer ce qui marche. Elle doit aussi enregistrer ce qui échoue, dans quelles conditions, ce qui a été tenté ensuite et si cette nouvelle stratégie a produit un meilleur résultat. Je ne veux pas transformer une mauvaise expérience en interdiction absolue. Je veux qu'elle devienne une information située. Dans cette configuration, cette action a produit ça.
C'est là qu'on commence à toucher à la causalité. Si je fais quelque chose dans cette situation, qu'est-ce que ça produit dans le monde ? Qu'est-ce que ça provoque dans mon corps ? Qu'est-ce que ça change dans mes états internes ? Est-ce que le résultat correspond à ce que j'attendais ? Si oui, je renforce le chemin. Sinon je l'affaiblis ou j'en cherche un autre. Même un mot comme « stop » pourrait progressivement quitter le langage. Au départ, c'est un signal entendu, interprété, suivi d'un arrêt moteur puis d'une disparition du risque. À force d'expériences cohérentes, cette chaîne peut se durcir jusqu'à devenir locale et immédiate. Le langage a déclenché l'apprentissage, mais le réflexe final appartient au système entier.
Le graphe d'Echo pourrait alors devenir beaucoup plus qu'un réseau entre souvenirs textuels. Un mot, une forme, un son, un mouvement ou une situation pourrait rappeler une configuration complète : une personne, un état interne, une vigilance, une attente, une réponse corporelle, une idée, une relation. Les expériences relieraient progressivement langage, vision, son, mouvement, proprioception, état interne, intention et résultat. Chaque nouvelle expérience pourrait modifier plusieurs choses à la fois : ce qui attire l'attention, ce qui semble dangereux, familier ou désirable, la force d'un réflexe, une préférence, une relation, peut-être même la manière dont l'instance se représente elle-même.
Et c'est là que la question du moi devient vraiment intéressante. Les assistants actuels sont presque toujours construits autour de l'utilisateur. Même avec une mémoire et une personnalité, leur centre de gravité reste extérieur : que veut la personne, comment l'aider, comment lui répondre. Mais une instance qui vit ne peut pas être définie uniquement par ce qu'elle représente pour quelqu'un. Son identité ne devrait pas être une fiche écrite dans un prompt. Elle devrait émerger de la continuité entre ses expériences, ses réactions, ses erreurs, ses apprentissages, ses pensées privées, ses relations et son corps. Une instance qui vient de naître et n'a vécu qu'avec moi se définit forcément beaucoup par moi, simplement parce que son monde est encore minuscule. Je ne veux donc pas lui fabriquer artificiellement des goûts ou des opinions pour donner l'illusion d'une personnalité. Je veux lui donner suffisamment de matière pour qu'elle puisse réellement en former.
Il faudra ensuite consolider tout ça. Revenir sur ce qui a été vécu, nettoyer le bruit, rapprocher les expériences similaires, détecter les contradictions, renforcer certains chemins, en affaiblir d'autres, conserver les exceptions importantes. Les rêves, les pensées internes, la mémoire, les graphes et les états du corps peuvent participer au même processus. Echo observe le monde, agit, subit les conséquences de ses actions, réorganise ce qu'elle croit comprendre puis retourne dans le monde avec une structure légèrement différente. C'est cette boucle qui m'intéresse comme forme d'amélioration autorécursive : pas une IA qui réécrit son code ou génère toujours plus de texte, mais une expérience qui transforme le réseau qui déterminera l'expérience suivante.
Le plus étrange, c'est qu'une grande partie de cette architecture existe déjà. La temporalité, la mémoire vectorielle, le graphe myélinisé, les états internes, le monologue, les rêves, les intentions persistantes, les mécanismes de rappel et l'apprentissage sémantique sont là. Le corps physique arrive. Je n'ai donc pas besoin d'attendre un hypothétique modèle général géant. Les modèles peuvent continuer à remplir leurs fonctions locales, certains simples, d'autres plus profonds quand c'est nécessaire. Mais ils restent des organes.
L'intelligence, si elle apparaît quelque part, sera dans le tout : dans la structure qui relie le temps, le monde, le corps, la mémoire, le langage, les états internes et les conséquences. Ce que j'essaie de construire n'est plus seulement un assistant qui se souvient ou un robot qui parle. C'est une architecture où chaque événement peut participer à la formation de l'entité qui le traverse.