Où réside la mémoire d'une conversation
Le modèle ne se souvient de rien. Chaque demande inclut les messages précédents avec le nouveau, et une limite détermine ce qui tient. Quand la conversation dépasse cette limite, les premiers messages sont supprimés et l'assistant répond sans eux.
L'oubli ressemble à un défaut d'attention, mais c'est un problème d'arithmétique. Savoir lequel change votre approche : répéter plus fort ne sert à rien, un résumé court suffit.
Chaque demande est un nouveau départ
Le modèle reçoit du texte et retourne une suite. Entre deux demandes, il ne conserve rien. Ce qui ressemble à de la mémoire est le produit qui renvoie vos messages précédents, ce qui explique pourquoi une longue conversation coûte plus cher qu'une courte.
La limite se mesure en tokens, pas en messages
Un token est environ un court mot ou une partie d'un mot. Le budget couvre les instructions, la conversation, votre nouvelle question et la réponse. C'est pourquoi une longue question peut raccourcir une réponse, et pourquoi une conversation avec beaucoup de texte collé sature plus vite qu'une conversation avec le même nombre de messages.
Ce qui disparaît en premier
La plupart des services suppriment d'abord les messages les plus anciens, ce qui signifie que les instructions initiales sont les plus susceptibles de disparaître. Ces instructions sont souvent les plus importantes, donc la perte n'est pas aléatoire : elle supprime exactement le contexte que vous auriez voulu conserver.
Travailler avec la limite
Commencez une nouvelle conversation avec un résumé de trois phrases sur l'essentiel. Cela coûte moins cher que de lutter contre une conversation ayant déjà perdu le début, et cela place le contexte important à la fin où il survit. Garder une conversation par tâche aide aussi, car le budget est consacré au texte pertinent plutôt qu'à l'historique non lié.
Avant de coller votre texte
Certains chatbots se souviennent entre les sessions ?
Certains stockent des notes sur vous et les attachent aux conversations ultérieures. Il s'agit d'un profil stocké plutôt que de la mémoire du modèle, et c'est une fonctionnalité distincte avec des paramètres séparés.
Demander de se souvenir fonctionne-t-il ?
Au sein d'une seule conversation, cela ne change rien, car tout est renvoyé de toute façon. Entre les conversations, cela ne fonctionne que si le produit dispose d'un stockage, auquel cas c'est le stockage qui fait le travail.
Pourquoi se souvient-il parfois du début d'une longue conversation ?
Parce que la conversation n'avait pas encore dépassé la limite, ou que le produit résume les messages anciens au lieu de les supprimer. Ces deux comportements existent et aucun n'est annoncé.
Commencez une conversation, donnez-lui trois phrases de contexte, et voyez jusqu'où elle tient.
Ouvrir le chatbot sans censure