Uma voz artificial em português de Portugal já se consegue por poucos euros por mês, para menus telefónicos, mensagens de espera, agentes de voz e vídeos de formação. O problema prático não é o preço: é o sotaque. Muitos serviços dizem “português” e entregam uma voz do Brasil. Os que têm vozes próprias de Portugal (código pt-PT) e verificámos nas páginas oficiais são o Microsoft Azure AI Speech (quatro vozes, incluindo a nova Rui), o Amazon Polly (Inês e Cristiano) e o Google Cloud Text-to-Speech (quatro vozes de gama básica). A ElevenLabs, a OpenAI e os modelos Gemini também falam português, mas o sotaque depende da voz e tem de ser testado. Se clonar a voz de uma pessoa real, precisa do consentimento dela, e se o áudio imitar alguém real tem de dizer que foi gerado por IA.
Para o contexto geral do atendimento, veja a página de IA no apoio ao cliente.
Porque é que o sotaque é o problema principal
O português do Brasil tem muito mais falantes, por isso a maior parte das vozes sintéticas e dos dados de treino vem de lá. Um serviço pode aceitar o código pt-PT e mesmo assim ler o texto com uma voz que diz “djia” em vez de “dia” ou “dezessete” em vez de “dezassete”.
A documentação do Retell, que usamos no guia da central de chamadas com IA, diz-o claramente: é a voz que mais determina o sotaque. Por isso, escolha uma voz depois de a ouvir, não um serviço pela lista de línguas.
Que serviços têm voz artificial em português de Portugal
| Serviço | Vozes de Portugal (pt-PT) | Preço por milhão de carateres (ou por minuto) | Gratuito por mês |
|---|---|---|---|
| Microsoft Azure AI Speech | Raquel, Duarte e Fernanda (neurais); Rui (MAI-Voice-2 e versão Flash) | Neurais: cerca de 13,21 €. Rui MAI-Voice-2: cerca de 19,37 €. Rui Flash: cerca de 13,21 € | 500 000 carateres (vozes neurais) |
| Amazon Polly | Inês (neural e padrão) e Cristiano (só padrão) | Neural: cerca de 14,09 €. Padrão: cerca de 3,52 € | Padrão: 5 milhões; neural: 1 milhão nos primeiros 12 meses |
| Google Cloud Text-to-Speech | pt-PT-Standard-E e F, pt-PT-Wavenet-E e F | Cerca de 3,52 € | 4 milhões de carateres |
| Google Gemini TTS | Na Google Cloud, pt-PT está em pré-visualização; na API Gemini aparece só “Portuguese” | Gemini 3.8 Flash TTS: cerca de 0,012 € por minuto de áudio até 31 de dezembro de 2026 | Nível gratuito na API Gemini |
| ElevenLabs | Modelo Multilingual v2 lista “Portuguese (Brazil, Portugal)”; o Eleven v4 lista só português do Brasil | Planos: Starter cerca de 5,28 €, Creator cerca de 19,37 €, Pro cerca de 87,19 € por mês | 10 000 créditos, sem uso comercial |
| OpenAI (texto para voz) | Nenhuma voz própria; “vozes otimizadas para inglês” | tts-1: cerca de 13,21 €; tts-1-hd: cerca de 26,42 € | Não |
Na Azure, a voz Raquel tem estilos (“triste”, “sussurrar”), e a Rui, do novo modelo MAI-Voice-2 da Microsoft, tem treze estilos de emoção. No Polly, o Cristiano só existe no motor padrão, que soa mais artificial; para algo natural, a opção é a Inês. Na Google Cloud, as vozes mais recentes (Chirp 3 HD) não incluem pt-PT, só pt-BR.
A ElevenLabs cobra por créditos: no texto para voz, um carater equivale a um crédito nos modelos principais, e a própria página estima cerca de 30 minutos por mês no Starter e 121 no Creator. A documentação recomenda escolher na biblioteca uma voz “com sotaque que corresponda à língua e à região”. A OpenAI deixa pedir o sotaque por instrução no modelo gpt-4o-mini-tts, mas avisa que as vozes estão otimizadas para inglês; não conte com um português de Portugal consistente sem testar.
Os modelos Gemini 3.8 TTS escolhem a língua sozinhos e a documentação diz para não pedir mudanças de sotaque no estilo: o caminho é escolher uma voz regional na biblioteca de vozes ou criar uma por descrição. Não confirmámos se existe uma voz de Portugal nessa biblioteca.
As páginas não dizem se os preços incluem IVA (a ElevenLabs diz que excluem impostos); confirme na fatura.
Onde a voz artificial é útil numa PME
- Menus telefónicos e mensagens de espera. Em vez de gravar com uma pessoa e repetir sempre que muda o horário, escreve o texto e gera o ficheiro de áudio em minutos. Confirme com o fornecedor da central telefónica o formato que ela aceita.
- Agentes de voz. Um assistente que atende e marca consultas precisa de uma voz em tempo real. Plataformas como o Retell deixam escolher o fornecedor de voz; o passo a passo, os custos por minuto e a calculadora da central de chamadas com IA estão no guia do Retell.
- Vídeos de formação e de produto. Narração para formação interna, tutoriais para clientes ou vídeos de redes sociais, com a mesma voz em todos e fácil de corrigir: muda-se uma frase do texto e volta a gerar-se.
- Acessibilidade. Ler em voz alta os artigos do site, instruções ou documentos para quem vê mal ou prefere ouvir.
Para o resto do atendimento (respostas por email, chat e base de conhecimento), veja o guia de IA no apoio ao cliente. Se o que precisa é o contrário, passar voz a texto, está no artigo sobre transcrever reuniões e chamadas com IA.
Como testar o sotaque em cinco minutos
Todos estes serviços têm uma página de demonstração ou um painel onde se escreve texto e se ouve o resultado. Use sempre a mesma frase de teste, com palavras que denunciam o sotaque do Brasil:
Bom dia, fala a assistente automática da Padaria Exemplo. O seu pedido de dezassete pastéis de nata fica pronto na terça-feira, às catorze horas. Pode levantá-lo ao balcão ou ligar-nos do telemóvel para o número dois, um, três, quatro, cinco, seis, sete, oito, nove.
O que ouvir:
- “Dia”, “terça-feira”, “pode”: em Portugal o “d” e o “t” não soam a “dj” e “tch”.
- “Dezassete”, “catorze”, “telemóvel”: palavras que só existem assim em Portugal; uma voz do Brasil tropeça ou lê-as com ritmo estranho.
- “Pastéis”, “horas”: o “s” final em Portugal soa a “ch”.
- “Pedido”, “levantá-lo”: em Portugal as vogais átonas quase desaparecem (“p’dido”).
- Os números: ouça se lê o número de telefone algarismo a algarismo e se diz bem “14h30” ou “1.º andar” quando os escreve assim.
Se alguém de fora da empresa disser “parece brasileiro”, troque de voz.
Corrigir a pronúncia: SSML e pequenos truques
O SSML é uma linguagem de marcação (etiquetas à volta do texto) que diz ao serviço como ler certas partes. A Azure, o Polly e a Google Cloud aceitam-no. As etiquetas mais úteis:
<say-as>para dizer como ler números, datas ou horas (por exemplo, um número de telefone algarismo a algarismo).<sub alias="...">para trocar uma sigla pela forma de dizer:<sub alias="ene i efe">NIF</sub>.<phoneme>para ditar a pronúncia exata de um nome em alfabeto fonético; a Azure e o Polly permitem também uma lista própria de pronúncias (léxico) para palavras que se repetem, como o nome da empresa.<break>para pausas, útil nos menus (“Para marcações, prima 1.” pausa “Para faturação, prima 2.”).
Sem SSML também se resolve muito: escreva por extenso os números que saem mal, evite siglas e use frases curtas.
Quanto custa: exemplo com 20 vídeos de formação
Exemplo (ilustrativo, não é um caso real): uma empresa quer narrar 20 vídeos de formação de 3 minutos, ou seja, 60 minutos de áudio. Assumimos cerca de 900 carateres de texto por minuto falado, perto de 54 000 carateres no total.
| Opção | Conta | Custo |
|---|---|---|
| Azure, voz neural (Raquel ou Duarte) | 54 000 carateres, dentro dos 500 000 gratuitos por mês | 0 € (cerca de 0,71 € fora do gratuito) |
| Azure, Rui MAI-Voice-2 | 54 000 × cerca de 19,37 € por milhão | cerca de 1,05 € |
| Amazon Polly, Inês neural | 54 000 × cerca de 14,09 € por milhão | cerca de 0,76 € (0 € no primeiro ano) |
| Google Cloud, WaveNet pt-PT | Dentro dos 4 milhões gratuitos | 0 € |
| Gemini 3.8 Flash TTS | 60 minutos × cerca de 0,012 € | cerca de 0,71 € |
| ElevenLabs | 54 000 créditos cabem no Creator | cerca de 19,37 € (um mês) |
Mesmo que gere cada vídeo três vezes até ficar bem, a voz custa poucos euros. O custo real é o tempo de escrever os guiões, ouvir e corrigir. Note também que o preço do Gemini 3.8 Flash TTS duplica a 1 de janeiro de 2027, segundo a página de preços da Google.
Azure, AWS e Google pedem uma conta de nuvem e algum à-vontade técnico. A ElevenLabs é a mais fácil sem técnicos: escreve-se no painel e transfere-se o ficheiro; o plano gratuito não permite uso comercial, o Starter já permite.
Clonar uma voz: só com consentimento
Vários serviços conseguem copiar uma voz real a partir de poucos segundos de gravação: a voz personalizada da Azure, a clonagem da ElevenLabs a partir do Starter e a replicação de voz dos modelos Gemini 3.8 TTS. É tentador usar a voz do gerente nos vídeos ou da rececionista no menu. As regras:
- Consentimento da pessoa, por escrito. A voz é um dado pessoal. O RGPD obriga a conseguir demonstrar o consentimento (artigo 7.º), por isso faça um documento assinado que diga para que usos, durante quanto tempo e o que acontece se a pessoa sair da empresa ou retirar o consentimento. Com trabalhadores, o consentimento é delicado, porque pode não ser livre: dê alternativa real e não penalize quem recusar.
- Os fornecedores também o exigem. A Azure pede uma declaração gravada pela própria pessoa e só dá acesso à API a clientes aprovados. A Google pede uma gravação de consentimento com uma frase fixa, na voz de um adulto. As regras de utilização da ElevenLabs proíbem replicar a voz de outra pessoa sem consentimento ou direito legal.
- Nunca a voz de terceiros (clientes, figuras públicas, concorrentes), mesmo “por brincadeira”.
O que a lei exige: AI Act, artigo 50.º
O artigo 50.º do Regulamento (UE) 2024/1689, o AI Act, aplica-se desde 2 de agosto de 2026. Para voz artificial, contam duas regras:
- Chamadas com IA. Quem fala com um sistema de IA tem de saber que é uma IA, o mais tardar na primeira interação. A obrigação recai sobretudo sobre o fornecedor, mas ao telefone uma voz sintética pode passar por uma pessoa: diga-o na primeira frase (“fala o assistente automático da…”). As políticas da OpenAI exigem o mesmo aviso a quem usa as suas vozes.
- Áudio que imita uma pessoa real. Se publicar áudio gerado que se faz passar por alguém real (um deepfake, por exemplo a voz clonada do gerente num vídeo), tem de dizer que foi gerado ou manipulado por IA. Uma voz sintética genérica a narrar um tutorial não imita ninguém, mas uma linha “narração gerada por IA” no vídeo não custa nada.
Para saber o que se aplica ao seu caso, use o verificador de regras de IA para a sua empresa e veja o artigo IA e RGPD: o que uma PME pode e não pode fazer. Isto não é aconselhamento jurídico.
O texto enviado para gerar a voz vai para o fornecedor; num agente de voz inclui dados pessoais. Veja como manter o tratamento na Europa em IA com dados na Europa.
O que fazer esta semana
- Escreva a mensagem do seu menu telefónico ou de espera atual num documento.
- Cole a frase de teste e essa mensagem nas demonstrações da Azure (Raquel, Duarte, Fernanda e Rui), do Polly (Inês) e da ElevenLabs (filtre vozes com sotaque de Portugal).
- Peça a três pessoas que ouçam sem saber qual é qual e escolha a que ninguém achar “brasileira”.
- Antes de pôr a gravação no telefone, acrescente o aviso de que é uma voz automática, se o menu passar a falar com o cliente.
Preços e funcionalidades verificados em outubro de 2026. Valores convertidos para euros ao câmbio do BCE de 30 de setembro de 2026 e arredondados.
Fontes
- Microsoft Learn: línguas e vozes do Azure AI Speech
- Microsoft Azure: preços do serviço Speech
- Microsoft Azure: API de preços de retalho
- Microsoft AI: MAI-Voice-2
- Microsoft Learn: voz personalizada (personal voice)
- Microsoft Learn: pronúncia com SSML
- Microsoft Learn: regiões do serviço Speech
- AWS: vozes disponíveis no Amazon Polly
- AWS: preços do Amazon Polly
- AWS: etiquetas SSML suportadas no Polly
- Google Cloud: vozes e tipos do Text-to-Speech
- Google Cloud: preços do Text-to-Speech
- Google Cloud: Gemini TTS, línguas suportadas
- Google Cloud: vozes Chirp 3 HD
- Google Cloud: SSML no Text-to-Speech
- Google AI for Developers: geração de voz com a API Gemini
- Google AI for Developers: replicação de voz
- Google AI for Developers: preços da API Gemini
- ElevenLabs: preços
- ElevenLabs: modelos e línguas
- ElevenLabs: texto para voz
- ElevenLabs: política de utilização
- OpenAI: guia de texto para voz
- OpenAI: preços da API
- OpenAI: modelo gpt-4o-mini-tts
- Comissão Europeia, AI Act Service Desk: artigo 50.º
- Regulamento (UE) 2024/1689 (AI Act), EUR-Lex
- Regulamento (UE) 2016/679 (RGPD), EUR-Lex
- Banco Central Europeu: câmbios de referência do euro
Escrevemos para quem gere empresas em Portugal. Cada preço tem fonte e data; quando algo muda, atualizamos o artigo.
Precisa de ajuda a implementar?
Trabalhamos com parceiros com experiência a pôr estas ferramentas a funcionar em PME portuguesas. Diga-nos o que quer montar e ligamos-lhe para perceber o que faz sentido, quanto custa e quanto tempo demora.
- Resposta em até 24 horas
- Primeira conversa sem custo nem compromisso
- Pode juntar um apoio do Estado ao projeto, se houver aviso aberto



