Letras+ | Letródromo | Letropédia | LiRA | PALCO | UnDF



Compartilhar Reportar
#Notícias#Linguística Computacional

Análise linguística identifica com 98% de precisão fake news produzidas por IA

Por Ronaldo Martins

30/09/2026

Uma pesquisa da USP conseguiu distinguir com 98% de precisão notícias falsas escritas por humanos daquelas produzidas por inteligência artificial. A análise de 10.782 textos em português brasileiro revelou diferenças de vocabulário, gramática e estilo: autores humanos apresentaram maior variação, enquanto a IA produziu textos mais uniformes, com palavras mais complexas e maior uso de orações coordenadas.

A pesquisa analisou 10.782 notícias falsas, divididas igualmente entre textos produzidos por pessoas e por inteligência artificial. O sistema de classificação alcançou 98% de precisão já na primeira rodada de experimentos, resultado que, segundo os pesquisadores, superou as expectativas iniciais.

Uma das principais diferenças encontradas está na variabilidade linguística. Os textos escritos por humanos apresentam maior diversidade de construções e desvios, além de marcas estilísticas individuais. As notícias falsas geradas por IA, por outro lado, são mais padronizadas. De maneira geral, empregam vocabulário mais rebuscado e maior quantidade de orações coordenadas, enquanto os autores humanos tendem a usar palavras mais acessíveis e construções mais simples.

Para chegar a esses resultados, o modelo examinou os textos em quatro níveis. A análise lexical considerou características como vocabulário, complexidade, frequência e extensão das palavras. A morfossintática contabilizou o emprego de substantivos, adjetivos, advérbios e outras classes gramaticais. A análise sintática verificou a construção das orações e as relações entre as palavras, enquanto a semântica avaliou aspectos relacionados a significado, coesão e coerência.

O estudo utilizou notícias falsas escritas por humanos disponíveis nos conjuntos de dados Fake.br e FakeTrueBR, criados para pesquisas sobre desinformação em português brasileiro. Para cada uma delas, foram analisadas versões equivalentes produzidas pelo Sabiá-3, modelo brasileiro de inteligência artificial generativa. Assim, os pesquisadores puderam comparar textos humanos e artificiais sobre conteúdos correspondentes.

O trabalho foi desenvolvido pelo pesquisador Pedro Lucas Castro de Andrade, em seu mestrado no Instituto de Ciências Matemáticas e de Computação (ICMC) da USP, em São Carlos, sob orientação do professor Thiago Pardo. Segundo Andrade, a maior variação encontrada nos textos humanos reflete diferenças individuais de escrita, enquanto a máquina tende a seguir padrões linguísticos mais uniformes.

Para Pardo, a técnica se aproxima de uma espécie de linguística forense, pois permite investigar a origem de um conteúdo a partir de suas características linguísticas. A identificação de autoria humana ou artificial pode contribuir, por exemplo, para investigações sobre a produção e a responsabilização pela circulação de desinformação. Segundo o pesquisador, não havia até então trabalho desse tipo voltado ao português.

Os resultados, entretanto, referem-se especificamente ao conjunto experimental utilizado: fake news em português brasileiro, comparando textos humanos com versões produzidas pelo Sabiá-3. Os pesquisadores pretendem posteriormente verificar se a abordagem pode ser estendida a outros gêneros textuais e integrada a métodos que também examinem imagens e outros tipos de conteúdo.

Intitulado Separating Human from Machine: Deep Linguistic Analysis and Automatic Classification of Fake News in Brazilian Portuguese, o estudo foi apresentado na 25ª Conferência EPIA em Inteligência Artificial, realizada de 2 a 4 de setembro, em Portugal. A pesquisa integra o projeto Synestech.ai, que reúne diferentes frentes de investigação em inteligência artificial na USP.

Fonte
← Voltar← AnteriorPróximo →