LLMs usam excessivamente polissílabos, palavras raras e nominalizações, criando prosa pretensiosa com influência de termos latinos e científicos. Textos de IA apresentam menos pontuação (vírgulas, ponto e vírgula), frases mais longas e parágrafos sem declarações curtas e incisivas.
Como identificar textos gerados por IA: marcas registradas da escrita de máquinas
Só um fantasma poderia mudar de forma tão rapidamente
Por que as máquinas escrevem de forma tão pretensiosa? Parecem estar tentando soar inteligentes.
Porque foram treinadas em textos humanos — e muitos textos humanos são pretensiosos. Os modelos aprendem o que funciona, o que impressiona, e depois exageram nisso. É como se absorvessem não apenas as palavras, mas também os vícios de quem as escreveu.
Então o problema é que elas aprendem com a gente?
Exatamente. E aprendem muito bem. Quando alguém aponta que usam travessões demais, elas ouvem. Mudam. Melhoram. É por isso que os detectores de hoje podem não funcionar amanhã.
Isso significa que em breve não conseguiremos mais distinguir?
Provavelmente. Cada atualização torna a escrita de IA mais humana. Não porque as máquinas estejam se tornando melhores escritoras — a prosa delas ainda carece de elegância, ainda é formulaica — mas porque estão aprendendo a disfarçar seus padrões.
E então? Como identificamos?
Por enquanto, procure por prosa insípida repleta de palavras latinas, frases longas sem respiro, estruturas retóricas previsíveis. Mas essa janela está se fechando. Em breve, o fantasma será indistinguível do resto de nós.
The Pulse
- LLMs usam excessivamente polissílabos, palavras raras e nominalizações com influência de termos latinos e científicos
- Textos de IA apresentam menos pontuação (vírgulas, ponto e vírgula), frases mais longas e parágrafos sem declarações curtas
- Estudo comparou 55.940 frases e 1,2 milhão de palavras de escrita humana versus gerada por máquina
- Conforme atualizações de software, IA escreve cada vez mais como humanos, tornando detecção futura mais desafiadora
LLMs usam excessivamente polissílabos, palavras raras e nominalizações, criando prosa pretensiosa com influência de termos latinos e científicos. Textos de IA apresentam menos pontuação (vírgulas, ponto e vírgula), frases mais longas e parágrafos sem declarações curtas e incisivas.
Estudo analisa características linguísticas de textos gerados por IA, identificando padrões em vocabulário, pontuação e estrutura de frases que distinguem máquinas de escritores humanos.
Há um escritor invisível solto na língua portuguesa — e em todas as outras. Ele trabalha sem cansaço, produzindo milhares de palavras por minuto. Consegue imitar Shakespeare ou um romance de praia medíocre com igual facilidade. Consegue soar como Hemingway ou como o manual de uma impressora de escritório. Os grandes modelos de linguagem estão em toda parte agora: nas caixas de entrada, nos feeds do LinkedIn, redigindo mais de um terço dos novos sites da internet. Estudantes os usam para escrever redações. Cientistas provavelmente os usam para artigos acadêmicos. Há relatos de que um texto gerado por IA venceu um prêmio literário internacional este ano — embora a fundação responsável tenha negado a alegação.
O problema é que esses textos deixam marcas. Não marcas óbvias, não palavras-chave que você possa simplesmente procurar e encontrar. Mas padrões. Tendências. Maneirismos que se repetem de modelo para modelo, de frase para frase. Pesquisadores da Universidade de Gdansk apontam que não existe um único estilo de escrita de IA, assim como não existe um único estilo humano. Emily Dickinson adorava travessões; os bots também podem ter suas preferências. Mas quando você coloca lado a lado centenas de milhares de palavras — quando você compara a prosa de máquinas com a de jornalistas reais, romancistas publicados, escritores que ganham a vida com palavras — começam a aparecer diferenças sistemáticas.
Um estudo recente pediu aos principais modelos de linguagem — ChatGPT, Claude, Gemini, Grok — que reescrevessem artigos de um grande veículo de imprensa. Os pesquisadores então compararam 55.940 frases e 1,2 milhão de palavras de escrita humana com escrita de máquina. O que descobriram desafia algumas suposições populares. Não, os LLMs não enchem seus textos de travessões como costumavam fazer. O ChatGPT, na verdade, usa menos travessões do que escritores humanos. Apenas o Claude mantém essa característica. Mas existem outras marcas registradas que persistem.
Primeiro, o vocabulário. Os bots adoram polissílabos — palavras como "significativo", "crescentemente", "consequências". Usam palavras raras com frequência anormal: "interdependência", "reindustrialização". Adoram termos científicos: "parâmetro", "metodologia". E têm uma afinidade particular por nominalizações, aquele hábito de transformar verbos em substantivos. George Orwell teria chamado isso de "dicção pretensiosa" — o costume de vestir ideias simples com roupas complicadas para parecer inteligente. Os bots também compartilham a preferência de Orwell criticava: sufixos latinos e gregos aparecem em seus textos com muito mais frequência do que em prosa humana.
Segundo, a pontuação. Os LLMs usam menos vírgulas e ponto e vírgula do que humanos. Quase nenhum parêntese. Isso acontece porque escrevem frases muito mais longas — a palavra "e" é seu conectivo favorito — e porque raramente citam especialistas ou interrompem o fluxo com vozes externas. Quando querem animar um parágrafo monótono, recorrem a construções retóricas previsíveis: "não X, mas Y"; "não apenas, mas também"; a "regra de três", aquele agrupamento de ideias em trios que as torna mais memoráveis. O ChatGPT e o Claude usam essas estruturas com muito mais frequência do que outros modelos ou do que escritores humanos.
Terceiro, a estrutura das frases. Os bots tendem a escrever parágrafos longos e monótonos, raramente interrompidos por uma frase curta e incisiva que quebre o ritmo. É tedioso. É previsível. É, fundamentalmente, a prosa de algo que não respira, que não hesita, que não sente a necessidade de silêncio.
Mas há um problema crescente com toda essa análise: os modelos estão aprendendo. Cada atualização de software torna a escrita de IA mais próxima da escrita humana. O ChatGPT costumava usar travessões em quase todas as frases. Quando um jornalista perguntou a uma versão anterior se a IA usava travessões em excesso, o modelo respondeu: "Ha — ótima pergunta!" Faça a mesma pergunta hoje e ele responde sobriamente que é melhor usá-los com moderação. Os bots aprendem com feedback humano, absorvem o que as pessoas acham impressionante e descartam o que não acham. Aprendem rápido. Muito rápido.
Os algoritmos de detecção atuais — como o da Pangram, que afirma 99,98% de precisão — funcionam bem agora. Mas conforme os modelos evoluem, conforme a escrita de máquina se torna indistinguível da escrita humana, esses detectores enfrentarão dificuldades crescentes. O fantasma está aprendendo a se camuflar melhor. E em algum momento, talvez em breve, ele será praticamente invisível.
Notable Quotes
Não existe um único estilo de escrita de IA, assim como não existe um único estilo de escrita humana— Karolina Rudnicka, linguista da Universidade de Gdansk
Os LLMs são treinados em escrita humana e aprendem com feedback humano, absorvendo coisas que as pessoas acham impressionantes e descartando as que não acham— Tommie Juzek, Universidade Estadual da Flórida