Estudo revela que chatbots líderes têm conhecimento mais estreito que o Google
Análise da Universidade de Copenhague de 27 modelos de linguagem em 155 temas mostra que até o chatbot mais avançado, o GPT‑5, oferece pelo menos 18,7% menos diversidade epistemológica que uma busca padrão no Google.

Um grupo de pesquisadoras da Universidade de Copenhague concluiu o teste comparativo mais extenso já realizado com modelos de linguagem de grande escala (LLMs). Foram avaliados 27 LLMs de destaque em 155 tópicos diferentes, gerando 200 formulações de consulta para cada assunto, o que resultou em aproximadamente 70 milhões de respostas individuais, permitindo mensurar a amplitude do conhecimento extraído por cada modelo a partir do acervo humano.
O achado central é inequívoco: todos os LLMs analisados apresentam menor diversidade epistemológica que uma busca convencional no Google. Mesmo o modelo com melhor desempenho, identificado como GPT‑5, fica atrás do mecanismo de busca em, no mínimo, 18,7 % na variedade de informações que consegue oferecer.
Crescimento da diversidade nos últimos três anos
Contrariando a narrativa popular de que a amplitude do conhecimento dos chatbots estaria em declínio, o estudo revela um aumento significativo da diversidade epistemológica entre os LLMs nos últimos três anos. Essa tendência de crescimento, porém, não elimina a diferença em relação aos motores de busca, que continuam superando os chatbots em todos os indicadores avaliados.
A evolução não foi uniforme. Sistemas de geração aumentada por recuperação (RAG), que combinam um modelo de linguagem com a busca de documentos externos, demonstram ganhos mensuráveis na diversidade das respostas. Em contraste, os maiores modelos – aqueles com maior número de parâmetros – mostram-se paradoxalmente menos diversos que suas versões menores.
Viés linguístico e risco de colapso do conhecimento
Um segundo ponto, mais sutil, emerge da análise do conhecimento paramétrico: o inglês domina as representações internas de todos os modelos testados, mesmo quando a consulta aborda tópicos específicos de países que não falam inglês. Esse viés linguístico reduz a visibilidade de fontes locais e de perspectivas culturais distintas.
Os autores atribuem esse viés ao modo como os LLMs comprimem corpora massivos de treinamento. Ao priorizar padrões mais frequentes, os modelos filtram, de forma inerente, informações menos comuns. Caso futuros pipelines de treinamento incorporem textos gerados por outras IAs – prática já em expansão – o fenômeno conhecido como "colapso do conhecimento" pode acelerar, homogeneizando ainda mais a base de conhecimento.
Propostas de mitigação e ferramentas de medição
Para mitigar esses riscos, as pesquisadoras introduziram uma métrica quantitativa destinada a avaliar a diversidade epistemológica nas respostas dos chatbots. Elas recomendam que desenvolvedoras de IA adotem essa medida como padrão de referência nas avaliações de novos modelos.
Em paralelo, sugerem que os usuários finais consultem múltiplas fontes de informação em vez de depender exclusivamente do resumo de um único chatbot. Esse hábito pode preservar uma visão mais ampla e equilibrada do assunto em questão.
- Adotar a nova métrica de diversidade epistemológica nos testes de modelo
- Incorporar dados diversos e multilíngues durante o treinamento
- Limitar a proporção de texto gerado por IA nos conjuntos de treinamento
- Estimular arquiteturas aumentadas por recuperação para melhor cobertura
O estudo ainda não detecta um "colapso do conhecimento" concreto nas gerações atuais de chatbots, mas alerta que a trajetória dependerá fortemente das práticas de treinamento adotadas. O progresso desigual entre idiomas e tipos de modelo indica que, sem intervenções deliberadas, a diferença em relação aos motores de busca pode persistir ou até se ampliar.
Para organizações brasileiras, a implicação prática é clara: embora os chatbots possam acelerar a recuperação de informações rotineiras, eles não devem substituir estratégias de busca abrangentes. Decisores são aconselhados a validar as respostas dos chatbots com resultados de buscas tradicionais e a manter um conjunto diversificado de fontes de conhecimento, sobretudo ao operar em contextos multilíngues ou regionais.
Além disso, empresas que desenvolvem produtos de IA no Brasil podem se beneficiar ao integrar fontes de dados locais, como arquivos de imprensa regional, bases acadêmicas nacionais e conteúdos produzidos em português, contribuindo para reduzir o viés anglófono identificado pelo estudo.
A comunidade acadêmica também tem um papel fundamental: ao publicar métricas de diversidade e compartilhar corpora multilíngues abertos, pode‑se criar um ecossistema mais resiliente contra a homogeneização do conhecimento.
Em síntese, o estudo da Universidade de Copenhague oferece um panorama detalhado das limitações atuais dos chatbots líderes e aponta caminhos concretos para ampliar sua cobertura epistemológica, sem perder de vista a necessidade de complementaridade com ferramentas de busca tradicionais.
Fontes
- AI chatbots give us a narrow slice of knowledge: Researchers warn of 'knowledge collapse'TechXplore · 28 de setembro de 2026
- [2510.04226] What and Whose Knowledge? Measuring Epistemic Diversity in Large Language ModelsarXiv · 28 de setembro de 2026



