Como Verificar Similaridade entre Textos (e Detectar Conteúdo Duplicado)
Similaridade cosseno entre dois textos é uma nota de 0% a 100% que mede quanto vocabulário duas passagens têm em comum, sem entender o significado de nenhuma delas. Um score de 74% aparece quando duas versões de um mesmo texto reaproveitam quase todas as palavras relevantes uma da outra. Um score de 6% aparece quando o texto foi reescrito com um vocabulário praticamente diferente, mesmo que esteja dizendo a mesma coisa. É essa diferença, entre repetir palavras e repetir ideias, que este artigo detalha com números reais.
Como o score é calculado
O processo por trás do número é mais simples do que parece. Primeiro, os dois textos são colocados em minúsculas e a pontuação é removida. Depois, cada texto é separado em palavras individuais, e palavras muito curtas (de uma letra só) e palavras extremamente comuns, como “the”, “a”, “de”, “and”, são descartadas. Essa lista de palavras comuns cobre inglês, português, espanhol, francês e italiano.
Com o que sobra, cada texto vira um vetor de frequência: uma contagem de quantas vezes cada palavra única aparece. A partir daí entra a matemática da similaridade cosseno, que compara os dois vetores calculando o produto escalar entre eles e dividindo pelo produto das duas magnitudes. Na prática, o resultado mede o ângulo entre os dois vetores num espaço onde cada palavra é uma dimensão: vetores praticamente alinhados (mesmas palavras, proporções parecidas) dão scores altos, vetores apontando para direções muito diferentes (vocabulários distintos) dão scores baixos. O resultado final é convertido em porcentagem, de 0% a 100%.
O ponto importante é que essa conta olha só para as palavras que aparecem literalmente nos dois textos. Ela não sabe que “cheap” e “affordable” significam a mesma coisa, nem que “block outside sound” e “noise cancellation” descrevem o mesmo recurso. É contagem de vocabulário compartilhado, não compreensão de linguagem.
Exemplo 1: dois anúncios de produto reescritos às pressas
Este é o cenário mais comum de risco de conteúdo duplicado: alguém pega a descrição de um produto e reescreve rapidamente para publicar em outro lugar, trocando algumas palavras mas mantendo a estrutura e a maior parte do vocabulário. Os textos abaixo estão em inglês de propósito, porque a ferramenta funciona com texto em qualquer idioma e este é só o exemplo usado para demonstração.
Texto A:
“Buy affordable wireless bluetooth headphones with active noise cancellation and thirty hour battery life. Free shipping on every order today.”
Texto B:
“Shop cheap wireless bluetooth headphones featuring active noise cancellation and a thirty hour battery. Enjoy free shipping on every order this week.”
Cole os dois na ferramenta e o resultado é 74% de similaridade, na faixa “alta similaridade”. Faz sentido: as duas frases descrevem o mesmo produto com quase a mesma estrutura, só trocando alguns adjetivos e verbos.
| Categoria | Palavras |
|---|---|
| Compartilhadas (13) | active, battery, bluetooth, cancellation, every, free, headphones, hour, noise, order, shipping, thirty, wireless |
| Só no Texto A (4) | affordable, buy, life, today |
| Só no Texto B (5) | cheap, enjoy, featuring, shop, week |
Treze palavras compartilhadas contra nove exclusivas no total é uma proporção que qualquer editor humano reconheceria como “isso é basicamente o mesmo texto com uma passada de reescrita por cima”. O score de 74% confirma essa impressão de forma objetiva, e fica acima da faixa “moderada” e perto do próprio corte de “alta similaridade” da ferramenta.
Exemplo 2: o mesmo conteúdo, uma paráfrase de verdade
Agora o contraste que expõe o ponto cego da ferramenta. O Texto C é idêntico ao Texto A do exemplo anterior. O Texto D descreve exatamente o mesmo produto (fones sem fio, cancelamento de ruído, bateria de um dia inteiro, frete grátis), mas foi reescrito do zero, sem reaproveitar quase nenhuma palavra:
Texto D:
“Our over ear audio devices block outside sound automatically and last more than a full day per charge, and delivery costs nothing no matter what you order.”
O resultado agora é 6% de similaridade, na faixa “baixa similaridade”. A única palavra compartilhada entre os dois textos é “order”.
Um leitor humano reconheceria imediatamente que o Texto D fala da mesma coisa que o Texto A: é a mesma promessa de produto, só com um vocabulário completamente diferente (“over ear audio devices” em vez de “wireless bluetooth headphones”, “block outside sound” em vez de “noise cancellation”, “last more than a full day per charge” em vez de “thirty hour battery life”). A ferramenta não enxerga essa equivalência porque ela só conta palavras repetidas, não ideias repetidas.
Esse é o ponto central para entender os limites da ferramenta: um score alto é um sinal forte de sobreposição de vocabulário, mas um score baixo não significa que o conteúdo é original. Significa apenas que a redação é diferente. Por isso a ferramenta é ótima para pegar duplicação preguiçosa, como no Exemplo 1, e não serve como detector de plágio contra um texto bem parafraseado, como no Exemplo 2.
Tabela de referência das faixas de score
| Score | Faixa | O que costuma indicar |
|---|---|---|
| 70% ou mais | Alta similaridade | Vocabulário quase todo compartilhado; forte candidato a conteúdo duplicado ou reescrita superficial |
| 40% a 69% | Similaridade moderada | Sobreposição parcial; vale ler os termos exclusivos de cada lado antes de tirar conclusões |
| 1% a 39% | Baixa similaridade | Pouco vocabulário em comum; pode ser conteúdo genuinamente diferente ou uma paráfrase bem feita do mesmo assunto |
| 0% | Nenhuma similaridade | Nenhuma palavra relevante em comum entre os dois textos |
Verifique o seu próprio texto
Cole dois textos abaixo e veja o score de similaridade cosseno em tempo real, junto com as palavras compartilhadas e exclusivas de cada um. Tudo roda no seu navegador: nenhum texto é enviado para servidor nenhum.
Insira os dois textos acima para calcular a similaridade
Similaridade cosseno TF · stop words removidas · roda no navegador
Erros comuns e casos especiais
Achar que isso é um modelo de embedding com compreensão semântica. Não é. A ferramenta conta palavras compartilhadas, ponto final. O Exemplo 2 mostra bem esse limite: dois textos que dizem a mesma coisa com palavras diferentes tiram 6%, não porque o conteúdo seja distinto, mas porque o vocabulário é.
Confiar que um score baixo significa “não é cópia”. Uma paráfrase bem feita pode zerar quase todo o score e ainda assim ser, na essência, o mesmo conteúdo reescrito. Se você está checando plágio de verdade (não só duplicação preguiçosa), um score baixo não é garantia de nada.
Comparar um trecho curto com uma página muito mais longa e estranhar o score não ser mais alto. Se o trecho está totalmente contido dentro da página maior, mas a página tem um vocabulário próprio muito mais extenso, esse vocabulário extra dilui o score final mesmo que a sobreposição, em termos absolutos, seja completa.
Não perceber que stop words são removidas antes do cálculo. Palavras como “the”, “a”, “de”, “para” são descartadas antes de montar os vetores. Isso significa que textos muito curtos, compostos majoritariamente por palavras comuns, podem legitimamente dar 0% mesmo tratando do mesmo assunto, simplesmente porque sobrou pouco vocabulário significativo para comparar.
Perguntas frequentes
Qual a diferença entre isso e um modelo de embedding de verdade, como o text-embedding-3 da OpenAI? Um modelo de embedding de verdade projeta o texto num espaço vetorial aprendido, capaz de reconhecer que “cheap” e “affordable” são sinônimos ou que duas frases têm o mesmo sentido mesmo sem compartilhar palavras. Esta ferramenta usa frequência de termos: ela só enxerga palavras idênticas. É rápida, roda sem servidor e é ótima para achar duplicação literal, mas não entende sinônimos nem paráfrase.
Que score deveria me preocupar do ponto de vista de SEO com conteúdo duplicado? A faixa de 70% para cima (“alta similaridade”) é o ponto que vale levar a sério, mas não pare no número: sempre olhe a lista de palavras compartilhadas e exclusivas antes de decidir se é caso de reescrever. No Exemplo 1, os 74% vieram de uma sobreposição real de treze palavras relevantes contra apenas nove exclusivas, o que confirma visualmente o que o score já indicava.
Essa ferramenta pega plágio parafraseado? Não. O Exemplo 2 mostra exatamente esse caso: um texto que transmite a mesma informação do Texto A, mas reescrito com vocabulário quase todo diferente, tira apenas 6%. Para detectar paráfrase de verdade você precisaria de um modelo semântico, não de contagem de palavras.
Stop words entram no cálculo do score? Não. Palavras muito comuns (como “the”, “a”, “de”, “and”) e palavras de uma letra só são removidas antes de montar os vetores de frequência, tanto em português quanto em inglês, espanhol, francês e italiano. Só o vocabulário mais significativo de cada texto entra na conta.
Meu texto é enviado para algum servidor? Não. Todo o cálculo, da limpeza do texto até a similaridade cosseno final, acontece direto no seu navegador. Nada do que você cola na ferramenta sai do seu dispositivo.
Dá para compartilhar um link com os dois textos já preenchidos? Nesta versão incorporada ao artigo não. Para gerar um link com os seus textos pré-preenchidos, abra a página completa da ferramenta e use a opção de compartilhar por lá.