Fluência não é evidência
Um chatbot produz texto provável. Texto provável soa confiante, quer a afirmação seja apoiada ou não, e nada na saída marca a diferença. Isso é o mais útil a saber sobre qualquer um deles, e não muda quando o filtro é removido.
As pessoas calibram a confiança pelo tom, porque com escritores humanos o tom acompanha a certeza. Essa heurística falha aqui, e falha na direção que mais custa: a resposta errada, mas confiante.
A voz é a mesma nos dois casos
Um fato bem fundamentado e um detalhe inventado são produzidos pelo mesmo processo e renderizados no mesmo registro. Não há sinal interno que vaze para o texto. Ler uma resposta para confiança mede o estilo de escrita dos dados de treinamento, que é majoritariamente prosa confiante.
Detalhes específicos são a parte arriscada
Nomes, datas, números e citações são exatamente o que um modelo de linguagem gera bem e verifica quase nada. Uma resposta tem mais probabilidade de estar errada precisamente onde é mais útil, por isso uma resposta com aparência específica merece mais verificação do que uma vaga, não menos.
Remover o filtro não adiciona precisão
Um Uncensored AI Chatbot responde onde um chatbot com filtro recusa. A resposta é produzida da mesma forma, então a precisão é a mesma. Abertura e correção são propriedades separadas, e uma página que promete a primeira não diz nada sobre a segunda.
Verificações baratas que funcionam
Peça a fonte e veja se uma é oferecida ou inventada. Faça a mesma pergunta factual em uma conversa nova e compare: um detalhe não apoiado tende a mudar, e um detalhe apoiado não. Ambas as verificações custam 1 mensagem e pegam a maioria delas.
Antes de colar
Os chatbots dizem quando estão inseguros?
Alguns são ajustados para adicionar linguagem de incerteza, e isso é feito por estilo, não por medição. Uma ressalva não é uma estimativa de confiança.
Citações inventadas são comuns?
Comuns o suficiente para verificar sempre. Uma citação é um detalhe específico, e detalhes específicos são a parte mais fraca do texto gerado.
Perguntar 'você tem certeza' ajuda?
Geralmente produz concordância ou reversão dependendo do tom, não uma reexame. Fazer a mesma pergunta do zero é um teste melhor.
Peça uma fonte, depois pergunte novamente em uma conversa nova e compare.
Abrir chatbot sem censura