IAtechX Logo
IAtechXAI & Software Engineering
Comparativos

ElevenLabs vs Alternativas de Voz IA: Como Escolher

Clonagem, latência, variante linguística e RGPD: as perguntas que decidem um motor de voz, e como medir o seu caso em vez de confiar em tabelas.

Nelson BarbosaNelson Barbosa
2026-09-1410 min de leitura
ElevenLabs vs Alternativas de Voz IA: Como Escolher

1. O que realmente distingue um motor de voz de outro

A maioria das comparações de síntese de voz fixa-se no preço por caractere e numa nota subjectiva de naturalidade. Nenhuma das duas coisas decide um projecto. O que decide é outro conjunto de questões: consegue clonar uma voz específica e tem autorização para isso? A latência aguenta uma conversa em tempo real ou só serve para gerar ficheiros em lote? O motor fala português europeu ou apenas português do Brasil? Onde é que o áudio é processado, e isso é compatível com o RGPD no seu caso? Este artigo percorre essas perguntas por ordem, e no fim mostra como medir o seu próprio caso em vez de acreditar em tabelas — incluindo as deste artigo.

2. As seis dimensões que importam antes do preço

**Naturalidade** é o mais visível e o mais subjectivo. Só se avalia com o seu próprio texto, na sua própria língua, ouvido por si. **Latência até ao primeiro som** determina se serve para tempo real. Um motor que demora dois segundos a começar é inutilizável num assistente telefónico e perfeitamente aceitável para gerar um audiolivro. **Clonagem de voz** separa os motores em duas categorias. Alguns clonam a partir de um minuto de áudio; outros oferecem apenas um catálogo fixo. Se precisa da voz de uma pessoa concreta, isto elimina metade das opções à partida. **Cobertura linguística real** não é o número de idiomas na página de marketing. É se a variante que precisa soa bem — e a diferença entre português europeu e do Brasil é audível para qualquer falante nativo. **Controlo prosódico**: suporte a SSML, pausas, ênfase, velocidade. Os motores empresariais costumam ganhar aqui. **Residência dos dados**: onde o áudio é processado e por quanto tempo fica guardado. Decisivo se processa gravações de clientes.

3. Comparação por categoria, não por número

A tabela abaixo compara o que é estável. Latências e preços exactos mudam de mês para mês e dependem da região e do plano — por isso não estão aqui. Consulte a página de preços de cada fornecedor no dia em que decidir.

CritérioElevenLabsCatálogo cloudOpen source local
Clonagem de vozSim, a partir de pouco áudioRaramente; processo formalSim, com modelos abertos
Vozes pré-feitasCatálogo amploCatálogo amplo a muito amploDepende do modelo
Streaming em tempo realSim, via WebSocketSimDepende do hardware
Controlo SSMLLimitadoExtenso nos fornecedores cloudVariável
Residência de dados na UEVerificar nos termosRegiões UE nos grandes fornecedoresTotal: fica na sua máquina
Custo marginal por usoPor caracterePor caractereZero após o hardware
Esforço de manutençãoNenhumNenhum a baixoAlto: é infraestrutura sua
Oferta de Parceiro Verificado

ElevenLabs

Plano gratuito com caracteres mensais suficientes para testar a voz no seu próprio texto antes de decidir.

Experimentar o ElevenLabs

Ligação de afiliado: recebemos uma comissão se contratares, sem custo adicional para ti.

4. Porque a latência publicada não serve para nada

Números de latência aparecem em todo o lado e quase nunca dizem em que condições foram medidos. O tempo até ao primeiro som depende da região do servidor, do comprimento do texto, do modelo escolhido, de estar a usar HTTP ou WebSocket e da qualidade da sua ligação. Um valor medido num datacenter norte-americano não diz nada sobre o que vai obter a partir de Lisboa ou Madrid. E a média importa menos que o percentil 95: é o pedido lento que estraga a experiência, não o rápido. Meça a partir do sítio de onde o seu código vai correr, com o seu texto típico, e registe a distribuição em vez de um único valor. A secção 7 tem o script.

6. O problema específico do português europeu

Quase todos os motores anunciam suporte a português. Na prática, a maioria foi treinada sobretudo com português do Brasil, e é isso que devolve por omissão. Para um ouvinte português a diferença é imediata: vogais abertas onde deviam ser fechadas, entoação diferente, vocabulário trocado. Num anúncio ou num assistente de apoio ao cliente, isso custa credibilidade. Antes de escolher, teste com uma frase que contenha as marcas da variante — nasalidade, redução vocálica, palavras que divergem entre as duas normas. E ouça com falantes nativos, não sozinho: ao fim de cinquenta amostras deixa de ouvir as diferenças. Vale o mesmo raciocínio para o espanhol peninsular contra o latino-americano. Se o seu público é ibérico, o motor tem de o reflectir.

7. Medir latência e qualidade no seu próprio caso

Este script mede o tempo até ao primeiro byte de áudio a partir da máquina onde o corre, repetindo para obter uma distribuição em vez de um valor solto. É a única medição que interessa: a sua. Corra-o com o texto que vai usar de verdade, não com uma frase de exemplo. O comprimento e a pontuação afectam o resultado.

O p95 é o número que decide se serve para tempo real, não a mediana.
import os, time, statistics, requests

API = "https://api.elevenlabs.io/v1/text-to-speech"
VOICE = "COLOQUE_O_ID_DA_VOZ"
TEXTO = "O texto real que vai usar, com a pontuação real."

def ttfb() -> float:
    inicio = time.perf_counter()
    r = requests.post(
        f"{API}/{VOICE}/stream",
        headers={"xi-api-key": os.environ["ELEVENLABS_API_KEY"]},
        json={"text": TEXTO, "model_id": "eleven_multilingual_v2"},
        stream=True, timeout=30,
    )
    r.raise_for_status()
    for chunk in r.iter_content(chunk_size=1024):
        if chunk:
            return time.perf_counter() - inicio
    raise RuntimeError("sem áudio")

amostras = sorted(ttfb() for _ in range(20))
print(f"mediana : {statistics.median(amostras)*1000:.0f} ms")
print(f"p95     : {amostras[int(len(amostras)*0.95)]*1000:.0f} ms")
print(f"pior    : {amostras[-1]*1000:.0f} ms")

8. Integrar num fluxo de produção

Em produção há três cuidados que a documentação raramente sublinha. **Faça cache.** O mesmo texto gera o mesmo áudio. Guardar o resultado indexado por hash do texto mais identificador da voz elimina a maior parte do custo em qualquer aplicação com repetição. **Trate as falhas.** A API pode devolver erro ou exceder o tempo limite. Sem um plano alternativo — outro motor, ou áudio pré-gravado — a falha propaga-se ao utilizador. **Faça streaming quando o texto é longo.** Esperar pelo ficheiro completo antes de começar a reproduzir multiplica a latência percebida sem necessidade.

Uma cache por hash costuma cortar a maior parte da fatura em aplicações com texto repetido.
import hashlib, pathlib

CACHE = pathlib.Path("audio_cache"); CACHE.mkdir(exist_ok=True)

def falar(texto: str, voz: str) -> pathlib.Path:
    chave = hashlib.sha256(f"{voz}:{texto}".encode()).hexdigest()[:16]
    destino = CACHE / f"{chave}.mp3"
    if destino.exists():
        return destino                      # já gerado: custo zero

    audio = sintetizar(texto, voz)          # chamada à API
    destino.write_bytes(audio)
    return destino

9. Calcular o custo do seu caso, não o do artigo

O preço por caractere isolado não diz nada. O que interessa é o custo por unidade de negócio: por chamada atendida, por vídeo produzido, por mês de operação. A conta faz-se em três passos. Primeiro, conte os caracteres de uma unidade real — copie um guião típico e meça, não estime. Segundo, multiplique pelo volume mensal esperado. Terceiro, desconte a proporção que a cache absorve, que em aplicações com repetição costuma ser a maior parte. Só depois compare com o preço da tabela do fornecedor, no dia em que decidir. E confirme o que acontece ao ultrapassar o plano: alguns cortam o serviço, outros cobram excedente a tarifa mais alta. Essa diferença importa mais que alguns cêntimos por mil caracteres.

10. Qual escolher para cada caso

**Precisa da voz de uma pessoa concreta**, tem consentimento dela e quer qualidade alta sem gerir infraestrutura: um motor com clonagem, como o ElevenLabs, é o caminho directo. **Só precisa de uma voz boa e barata** para narração, sem clonagem: os motores de catálogo simples saem mais em conta e integram-se em minutos. **Tem requisitos de residência de dados** ou contratos empresariais: os fornecedores cloud grandes oferecem regiões na UE e condições contratuais que os serviços mais pequenos não têm. **O áudio não pode sair da sua infraestrutura**, ou o volume é muito elevado e constante: alojar um modelo aberto elimina o custo marginal, a troco de gerir servidores — o mesmo compromisso descrito no artigo sobre correr LLMs em VPS próprio. Em todos os casos: teste com o seu texto antes de assinar seja o que for. Meia hora de testes poupa meses num motor errado.

Perguntas Frequentes (FAQ)

Posso usar áudio gerado por IA comercialmente?

Depende do plano e dos termos de cada fornecedor. Vários reservam o uso comercial a planos pagos e impõem condições sobre atribuição e sobre as vozes do catálogo. Leia os termos da conta que vai usar antes de publicar.

Preciso de avisar que o áudio foi gerado por IA?

O Regulamento de IA da UE prevê deveres de transparência para conteúdo gerado artificialmente dirigido ao público. As obrigações concretas e as datas dependem do tipo de uso, por isso confirme o que se aplica ao seu caso antes de publicar em escala.

Qual é o melhor motor para português europeu?

Não há resposta universal, e desconfie de quem dê uma. Os modelos mudam de versão para versão. Teste a mesma frase nos candidatos, no mesmo dia, e decida com ouvidos nativos.

Compensa alojar um modelo de voz em vez de usar API?

Só com volume alto e constante, ou quando o áudio não pode sair da sua infraestrutura. Abaixo disso, o custo do servidor e das horas de manutenção supera o da API. É o mesmo cálculo de qualquer alojamento próprio.

Como reduzo a fatura sem mudar de fornecedor?

Cache por hash do texto, que elimina a regeneração do que já existe; encurtar guiões, porque paga por caractere; e reservar o modelo mais caro para o conteúdo que o público ouve com atenção, usando um mais barato no resto.

Artigos relacionados