Onde reside a memória de uma conversa
O modelo não lembra de nada. Cada solicitação carrega as mensagens anteriores junto com a nova, e um limite decide quantas cabem. Quando a conversa ultrapassa o limite, as mensagens mais antigas são descartadas e o assistente responde sem elas.
Esquecer parece ser um defeito de atenção, mas é um defeito de aritmética. Saber qual dos dois é muda o que você faz a respeito: repetir-se em voz alta não ajuda, e um resumo curto sim.
Cada solicitação é um recomeço
O modelo recebe texto e retorna uma continuação. Entre 2 solicitações, ele não guarda nada. Tudo o que parece memória é o produto reenviando suas mensagens anteriores, por isso uma conversa longa custa mais para executar do que uma conversa curta.
O limite é medido em tokens, não mensagens
Um token é aproximadamente uma palavra curta ou uma parte de uma. O orçamento cobre as instruções, a conversa, sua nova pergunta e a resposta juntos. É por isso que uma pergunta longa pode encurtar uma resposta, e por que uma conversa cheia de texto colado longo esgota mais rápido do que uma conversa com a mesma quantidade de mensagens.
O que desaparece primeiro
As mensagens mais antigas são descartadas primeiro na maioria dos serviços, o que significa que a configuração que você deu no início é a parte mais provável de desaparecer. Essa configuração geralmente é a parte que importava, então a falha não é aleatória: ela remove exatamente o contexto que você gostaria que fosse mantido.
Trabalhando com o limite
Inicie uma nova conversa e abra-a com um resumo de 3 frases do que importa. Isso custa menos do que discutir com uma conversa que já perdeu o início, e coloca o contexto importante na extremidade mais recente, onde ele sobrevive. Manter 1 conversa por tarefa também ajuda, porque o orçamento é gasto em texto relevante em vez de em histórico não relacionado.
Antes de colar
Alguns chatbots lembram entre sessões?
Alguns armazenam notas sobre você e as anexam a conversas posteriores. Isso é um perfil armazenado, não memória no modelo, e é um recurso separado com configurações separadas.
Pedir para ele lembrar funciona?
Dentro de 1 conversa, não faz diferença, porque tudo é reenviado de qualquer maneira. Entre conversas, funciona apenas quando o produto tem um armazenamento, e então o armazenamento faz o trabalho.
Por que às vezes ele lembra o início de uma conversa longa?
Porque a conversa ainda não havia ultrapassado o limite, ou o produto resume mensagens mais antigas em vez de descartá-las. Ambos os comportamentos existem e nenhum é anunciado.
Inicie uma conversa, dê a ela 3 frases de contexto e veja até onde ela chega.
Abrir chatbot sem censura