Melhores AI voice agents em 2026: 14 plataformas para atendimento por telefone, vendas e agendamento

Turn this article into takeaways for your work.
Each assistant summarizes the article only for you and suggests best practices for your work.
Vapi e Retell AI lideram para times de engenharia que querem construir um agente de telefone sob medida do zero, PolyAI e Parloa lideram para contact centers enterprise que querem uma implantação totalmente gerenciada, Sierra lidera para times que já operam um agente de chat e querem o mesmo cérebro atendendo o telefone, e Regal e Thoughtly lideram para times de vendas e receita que fazem qualificação e agendamento outbound. Este guia ranqueia 14 plataformas de AI voice agents pela latência de resposta de ponta a ponta, o número que decide se quem liga sente que está falando com algo útil ou simplesmente desliga, com cada preço conferido na própria página de preços do fornecedor em agosto de 2026.
Um voice agent não é o mesmo produto que um gerador de voz, e confundir os dois é o caminho mais rápido para comprar a ferramenta errada. Plataformas de text-to-speech transformam um roteiro em áudio. Um voice agent escuta uma ligação ao vivo, decide o que dizer em seguida e pode acionar uma ferramenta no meio da conversa para consultar um pedido, checar uma agenda ou transferir para um humano. Se o que você precisa de fato é narração ou clonagem de voz, veja o nosso guia dos melhores geradores de voz com IA, uma classe de produto totalmente diferente. Este artigo faz parte de um guia de compra de plataformas de AI agents mais amplo e, se o seu time prefere construir um voice agent em vez de comprar um, o que é um AI agent e o blueprint de AI voice call agent cobrem o lado da construção.
Atualizado em agosto de 2026: o que mudou
- A Air.ai, empresa que popularizou em 2023 a proposta de "representante de vendas com IA no telefone", acabou. A FTC a processou em agosto de 2025 e fechou um acordo de $18 milhões em março de 2026, proibindo seus operadores de comercializar oportunidades de negócio. O serviço de voz saiu do ar e o domínio air.ai agora pertence a uma empresa sem relação. Ela saiu desta lista.
- A Aircall adquiriu a Vogent em maio de 2026 para reforçar o seu próprio voice agent nativo, mas a plataforma para desenvolvedores da Vogent continua aberta a novos cadastros como produto independente até o momento em que escrevo.
- A ElevenLabs cortou o preço do Conversational AI aproximadamente pela metade este ano, para 8 a 10 centavos por minuto conforme o plano, e adicionou cobrança pay-as-you-go além do sistema de créditos.
- A página de preços ao vivo da Synthflow não mostra mais os planos mensais self-serve que alguns rastreadores de terceiros ainda listam. Em agosto de 2026 ela é apenas Enterprise, com contratos a partir de cerca de $30.000 por ano.
- A Cartesia, conhecida principalmente como fornecedora de modelos de voz de baixa latência, lançou a Line, uma plataforma completa de desenvolvimento de voice agents, colocando-se em concorrência mais direta com Vapi e Retell em vez de apenas alimentar o text-to-speech deles.
Fatos Principais
- A conversational AI deve reduzir em $80 bilhões os custos de mão de obra de agentes de contact center em 2026, embora a própria pesquisa da Gartner observe que apenas cerca de 1 em cada 10 interações de agentes será totalmente automatizada este ano, segundo a Gartner.
- O mercado global de AI voice agents é estimado em $3,51 bilhões em 2026, com projeção de chegar a $35,24 bilhões até 2033, uma taxa de crescimento anual composta de 39%, segundo a Grand View Research.
- 91% dos líderes de atendimento ao cliente dizem estar sob pressão da diretoria para implementar IA em 2026, segundo uma pesquisa da Gartner com 321 líderes.
- Os humanos trocam o turno de uma conversa em cerca de 200 milissegundos. Respostas acima de 800ms começam a parecer atrasadas e, acima de 1.500ms, a ligação parece quebrada, uma meta que a maioria das plataformas de voice agents ainda persegue em produção, e não só em demos, segundo o benchmark de latência de 2026 da Telnyx.
- Um agente de call center onshore nos EUA, com todos os custos incluídos, custa cerca de $26 por hora em 2026 (aproximadamente $0,43 por minuto), contra $6 a $14 por hora offshore e $12 a $18 por hora nearshore, a base com a qual o preço por minuto de todo voice agent realmente compete, segundo a Call Force Global.
- A FCC confirmou em fevereiro de 2024 que vozes geradas por IA contam como "voz artificial" sob a TCPA, então ligações outbound de AI voice exigem o mesmo consentimento prévio expresso de uma robochamada pré-gravada, segundo a FCC.
Tabela comparativa rápida
| Plataforma | Ideal para | Preço inicial | Principal ponto forte | Principal limitação |
|---|---|---|---|---|
| Vapi | Desenvolvedores criando agentes sob medida | Taxa de plataforma de $0,05/min + custos dos provedores | Maior flexibilidade de telefonia e de modelos | O custo total real fica opaco até você configurar |
| Retell AI | Agentes sob medida de nível de produção | $0,07-0,31/min pay-as-you-go | Preço detalhado por item, boa reputação de suporte | A taxa efetiva sobe rápido com LLMs premium |
| Bland AI | Agentes de taxa fixa, sem surpresas na fatura | $0/mês + $0,14/min (plano Start) | Uma única taxa cobre LLM, STT e TTS | A taxa por minuto é maior que a dos concorrentes por uso |
| ElevenLabs Agents | Qualidade de voz e cobertura de idiomas | A partir de $0,08/min | Mais de 70 idiomas, realismo de voz muito bem avaliado | Custos de LLM absorvidos hoje, tendem a ser cobrados |
| PolyAI | Contact centers enterprise, gerenciado | Sob consulta (reportado $150K+/ano) | Ampla experiência em implantações enterprise | Sem plano self-serve, apenas venda consultiva |
| Parloa | Contact centers de alto volume | Sob consulta (reportado $300K+/ano) | Preço baseado em resultado, atrelado à resolução | Feito para mais de 2M de ligações/ano, não para times menores |
| Sierra (Voice) | Um agente em chat e telefone | Sob consulta, venda consultiva | Unifica a voz com um agente de chat existente | A voz é nova, histórico mais curto que o do produto de chat |
| Regal | Ligações outbound de vendas e retenção | Sob consulta, mínimo de 25 seats/100K minutos | Feito para campanhas outbound estruturadas | Não foi pensado para times pequenos nem para baixo volume de ligações |
| Synthflow | Construção gerenciada, agora só enterprise | Sob consulta, a partir de $30.000/ano | Stack de STT, LLM e TTS totalmente gerenciado | Planos self-serve não são mais publicados |
| Thoughtly | Imobiliário, seguros, educação | $500/mês com minutos ilimitados (10 simultâneas) | Minutos ilimitados por uma taxa fixa | Limitado em concorrência, não foi feito para volumes enormes de ligações |
| Phonely | Porta de entrada self-serve mais barata de verdade | Grátis (100 min/mês); Starter $50/mês | Menor custo de entrada, com plano gratuito | As taxas de excedente ($0,25-0,35/min) pesam rápido |
| Cartesia Line | Desenvolvimento de agentes com a menor latência | Grátis; Pro $5/mês + $0,06/min | Modelo de voz mais rápido da categoria | Plataforma de agentes mais nova, histórico mais curto |
| Deepgram Voice Agent API | Desenvolvedores que trazem o próprio LLM | $0,056-0,075/min pay-as-you-go | Menor taxa por minuto, descontos para BYO | Apenas API para desenvolvedores, sem interface de construção de agentes |
| Vogent | Agentes que se aprimoram sozinhos via API | $0,09/min, a partir de $0,05/min em volume | Agentes que se retestam contra ligações passadas | Agora pertence à Aircall, futuro como produto independente menos certo |
Latência e barge-in: o número que realmente decide se uma ligação parece humana
Duas coisas importam mais do que qualquer lista de recursos em uma página de preços: quanto tempo quem liga espera até o agente começar a falar e o que acontece quando a pessoa fala por cima dele.

| Plataforma | Latência divulgada pelo fornecedor | Resultado de teste independente | Observações |
|---|---|---|---|
| Bland AI | ~400ms (metodologia não divulgada) | 850ms de mediana / 1.180ms no p95 (Tested Media) | Maior distância entre o prometido e o medido |
| Retell AI | "A partir de ~600ms" | 680ms de mediana / 920ms no p95 (Tested Media) | A promessa do fornecedor e o teste independente mais ou menos concordam |
| Vapi | p50 abaixo de 500ms, p95 abaixo de 800ms (meta) | 720ms de mediana / 1.050ms no p95 (Tested Media) | Uma meta, não uma garantia; varia conforme o modelo escolhido |
| ElevenLabs Agents | ~75ms (apenas geração de TTS) | 1,73s no p50 para um turno completo do agente (Cekura) | Os 75ms são só do modelo de voz, não de um turno completo |
| Cartesia Line | Modelos de TTS/STT abaixo de 90ms (Sonic 3.5 / Ink 2) | Sem benchmark independente até o fechamento deste texto | Modelos de base mais rápidos da categoria, pela especificação |
Mas a velocidade bruta não é a história toda. Os humanos trocam o turno em uma conversa em cerca de 200 milissegundos, sem pensar nisso; quando a resposta de um voice agent passa de 800ms, quem liga começa a notar e, acima de 1.500ms, a ligação parece quebrada, e não futurista, segundo o benchmark da Telnyx de 2026, que compara as promessas dos fornecedores com testes independentes da Tested Media e da Cekura. A distância entre o que o fornecedor anuncia e o que se mede em um stack fixo costuma ser de 300 a 900 milissegundos, a diferença entre uma pausa natural e alguém repetindo o que acabou de dizer.
Barge-in, deixar quem liga interromper o agente no meio da frase e fazê-lo realmente parar e escutar, é a outra metade de soar humano. Vogent e Cartesia constroem sua proposta justamente em torno de turn-taking e do tratamento de interrupções, e não só da velocidade de resposta, porque um agente rápido que fala por cima de quem liga é pior do que um pouco mais lento que cede a vez com naturalidade. Ao fazer o piloto de qualquer uma dessas plataformas, teste o barge-in com uma interrupção de verdade, e não com uma pausa em silêncio, antes de confiar no número de latência da página de marketing.
1. Vapi: infraestrutura voltada a desenvolvedores para voice agents sob medida
A aposta da Vapi é que voice agents pertencem ao código, e não a um canvas de arrastar e soltar. É infraestrutura: você escolhe seus próprios provedores de STT, LLM e TTS (ou usa os padrões da Vapi), conecta ferramentas, e a Vapi cuida da orquestração em tempo real, da telefonia e do estado da ligação. Essa flexibilidade é o motivo de ela ter virado a plataforma de referência pela qual os concorrentes se medem.
O porém é que a taxa de plataforma de $0,05/min, que aparece em destaque, não é o que você paga. STT, LLM e TTS são cobrados ao custo do provedor por cima, e a maioria dos times acaba entre $0,07 e $0,25 por minuto depois de escolher modelos reais, passando de $0,30 com vozes premium e janelas de contexto grandes. Faça o orçamento do stack inteiro, não só da taxa de plataforma.
| O que você leva | O que você não leva |
|---|---|
| Controle total sobre a escolha de provedores de STT, LLM e TTS | O preço de $0,05/min em destaque é uma fração do custo real |
| Telefonia nativa e BYO Twilio, incluindo SIP trunking completo | Sem taxa fixa tudo incluído, cada troca de modelo muda a sua fatura |
| Grande comunidade e integrações de referência | Preço e suporte enterprise são sob consulta |
| 10 ligações simultâneas incluídas, escaláveis por linha | Configuração mais trabalhosa que a de um construtor no-code como a Thoughtly |
Preço: plano Build por uso, com taxa de plataforma de $0,05/min mais custos dos provedores ao custo (total real comum de $0,07-0,25/min); Scale (Enterprise) usa uma taxa fixa de plataforma mais preço por volume contratado, sob consulta. Add-on de HIPAA a $2.000/mês, add-on de zero data retention a $1.000/mês. Veja vapi.ai/pricing.
Ideal para: times de engenharia que querem controle total sobre o stack de voz e se sentem à vontade montando STT, LLM e TTS por conta própria
2. Retell AI: o rival mais próximo da Vapi, ajustado para confiabilidade
A Retell AI compete no mesmo terreno da Vapi, infraestrutura voltada a desenvolvedores para um agente sob medida, mas aposta mais na confiabilidade em produção e no tempo de resposta do suporte. A taxa base do motor de voz cobre o speech-to-text e a infraestrutura da própria Retell; por cima você escolhe um provedor de LLM e de TTS, cada um cobrado à parte e detalhado por item no console, e não escondido em uma linha de repasse.
Onde a Retell se destaca para alguns times é na amplitude das opções de telefonia: comprar um número direto, importar um de uma operadora existente ou conectar um SIP trunk da Twilio, Telnyx ou Vonage, com números locais disponíveis nos EUA, Reino Unido, Canadá e Austrália. Testes independentes de latência a colocam praticamente no mesmo nível da Vapi, às vezes um pouco à frente.
| O que você leva | O que você não leva |
|---|---|
| Preço transparente, detalhado por componente | Os $0,07/min em destaque ainda são só a camada do motor de voz |
| Três caminhos de telefonia: comprar, importar ou SIP trunk | Escolhas de LLM premium (classe GPT-5.5) empurram o custo para perto de $0,31/min |
| $10 em créditos gratuitos para testar antes de se comprometer | O plano Enterprise começa em cerca de $8.000, uma linha de orçamento real |
| Consistentemente bem avaliada pela agilidade do suporte | Documentação de telefonia menos profunda que os guias de SIP da Vapi |
Preço: pay-as-you-go a partir de $0,07/min (infraestrutura de voz e STT) até cerca de $0,31/min com um LLM premium e add-ons como knowledge base (+$0,005/min) ou remoção de PII (+$0,01/min); Enterprise a partir de cerca de $8.000. Veja retellai.com/pricing.
Ideal para: times de produto que lançam um agente de telefone em produção e preferem preços por componente, detalhados e previsíveis, a uma taxa agrupada
3. Bland AI: preço fixo por minuto, sem nada extra
Toda a proposta da Bland é um único número. Onde Vapi e Retell obrigam você a montar e precificar um stack, a Bland agrupa LLM, speech-to-text e text-to-speech em uma única taxa por minuto, sem cobrança por token e sem repasse por provedor, de modo que a fatura bate com o que o time comercial cotou.
Essa simplicidade custa mais por minuto do que os concorrentes por uso depois do plano gratuito Start, mas compra uma previsibilidade que os times financeiros gostam: uma taxa de plataforma mais uma tarifa fixa. A Bland também é uma das poucas plataformas aqui que declaram elegibilidade a HIPAA com BAA assinado de forma direta, sem esconder isso atrás de uma conversa enterprise sob consulta.
| O que você leva | O que você não leva |
|---|---|
| Uma única taxa fixa cobre LLM, STT e TTS por completo | A taxa por minuto é maior do que montar o seu próprio stack |
| Elegível a HIPAA com BAA assinado | Ainda é preciso trazer a própria telefonia para evitar taxas de transferência |
| A taxa de plataforma reduz o seu valor por minuto nos planos mais altos | É preciso o plano Scale de $499/mês para a melhor taxa valer |
| Sem cobrança por token nem fatura surpresa do provedor de modelo | Taxas personalizadas só no volume Enterprise |
Preço: Start $0/mês + $0,14/min; Build $299/mês + $0,12/min; Scale $499/mês + $0,11/min; Enterprise sob consulta. Transferências de ligação cobradas à parte, a $0,03-0,05/min conforme o plano. Veja bland.ai/pricing.
Ideal para: times que querem uma taxa única e previsível e nenhuma fatura surpresa do provedor de modelo no fim do mês
4. ElevenLabs Agents: qualidade de voz e mais de 70 idiomas, da líder em TTS
A ElevenLabs construiu seu nome com um dos text-to-speech de som mais natural do mercado, abordado no nosso guia dos melhores geradores de voz com IA, e o ElevenAgents é a camada conversacional por cima: agentes de voz e de chat em tempo real que acionam ferramentas, implantados em telefonia, web, WhatsApp e SMS a partir da mesma conta.
A proposta para times que já usam a ElevenLabs é direta: nenhum fornecedor novo para qualidade de voz, mais conectores nativos com Twilio, Genesys, Zendesk e Salesforce. O ponto de atenção é que os custos de LLM hoje são absorvidos pela ElevenLabs em vez de cobrados, o que a empresa disse que não vai durar para sempre, então a taxa por minuto de hoje tende a subir quando isso mudar.
| O que você leva | O que você não leva |
|---|---|
| A maior cobertura de idiomas desta lista (mais de 70 idiomas) | Custos de LLM absorvidos hoje, com expectativa de passarem a ser cobrados |
| Conectores nativos: Twilio, Genesys, Zendesk, Salesforce | Nenhum plano de taxa fixa publicado, créditos e PAYG misturados |
| A mesma qualidade de voz do produto de TTS da ElevenLabs | O detalhamento completo por minuto não está na página principal de preços |
| 15 minutos grátis para testar antes de pagar | As melhores taxas exigem um plano anual Business ou Enterprise |
Preço: ligações a partir de $0,10/min nos planos Creator e Pro (cerca de 50% menos após o corte de preço de 2026), $0,08/min nos planos anuais Business, menos no Enterprise; 15 minutos grátis para começar. Veja elevenlabs.io/agents.
Ideal para: times que já usam a ElevenLabs pela qualidade de voz e querem a maior cobertura de idiomas sem um segundo fornecedor
As próximas quatro plataformas trocam a flexibilidade self-serve por uma implantação gerenciada, conduzida pelo time comercial. Se essa é a faixa em que você realmente está, nosso panorama das melhores plataformas de AI agents enterprise cobre a categoria mais ampla, além de apenas voz.
5. PolyAI: voice AI gerenciada para contact centers enterprise
A PolyAI vende resultados para empresas, não um console self-serve. Não há plano gratuito nem tabela de preços pública. As implantações passam por um processo conduzido pelo time comercial, em que a própria equipe da PolyAI cuida do design das conversas, do ajuste contínuo dos modelos e do suporte 24/7 como parte do contrato, algo mais próximo de um serviço gerenciado do que de um software que você mesmo configura.
É o modelo certo para bancos, redes de hotéis e varejistas que precisam de um voice agent no ar em centenas de unidades sem contratar engenheiros de prompt internos, e é por isso que Marriott, Caesars Entertainment e Foot Locker a usam. É o modelo errado se você quer testar uma ideia nesta semana por algumas centenas de dólares.
| O que você leva | O que você não leva |
|---|---|
| Design de conversas gerenciado e ajuste contínuo incluídos | Sem cadastro self-serve, há um ciclo de vendas antes de você poder testar |
| Comprovada em escala enterprise, com mais de 100 clientes | Contratos mínimos reportados começam em torno de $150.000 por ano |
| Ampla experiência em bancos, hotelaria e varejo | Não serve para testar uma ideia antes de comprometer orçamento |
| Suporte 24/7 incluído como parte do contrato gerenciado | A falta de transparência de preço dificulta o orçamento nas fases iniciais |
Preço: não publicado; contratos enterprise conduzidos pelo time comercial. Estimativas de terceiros (reportadas, não confirmadas pelo fornecedor) apontam mínimos em torno de $150.000/ano, com implantações de nível intermediário custando $10.000-$20.000/mês. A PolyAI levantou uma Série D de $86 milhões em dezembro de 2025, com avaliação de $750 milhões. Veja o anúncio de financiamento da PolyAI.
Ideal para: contact centers enterprise de bancos, hotelaria e varejo que querem uma implantação gerenciada, e não uma construção própria
6. Parloa: preço baseado em resultado para contact centers de alto volume
A lógica de preço da Parloa é a mais incomum desta lista: em vez de cobrar por seat ou por minuto, ela cobra por conversa resolvida com sucesso. Se uma ligação é escalada para um humano, você não paga o preço de resolução por IA nela, o que alinha o incentivo do fornecedor a de fato resolver o problema de quem liga, e não apenas mantê-lo na linha.
Esse modelo só faz sentido em escala real. A Parloa deixa claro que foi feita para organizações que atendem cerca de 2 milhões de ligações por ano, e não para uma marca de e-commerce com 30.000 pedidos por mês, e o formato de "construir junto conosco" significa orçar $300.000 ou mais por ano, já com implementação e integração.
| O que você leva | O que você não leva |
|---|---|
| Preço baseado em resultado, atrelado a conversas resolvidas | Inviável abaixo de cerca de 2 milhões de ligações por ano |
| Ciclo de vida completo do agente: projetar, testar, escalar, otimizar | Orçamentos reportados começam em $300.000+ por ano |
| Opções de financiamento para contratos plurianuais (Capchase) | Modelo de construir junto com a Parloa, não um produto self-serve |
| Boa adequação a volumes de ligações regulados e de alto risco | Longo prazo de implementação em comparação a uma plataforma self-serve |
Preço: baseado em resultado, cobrado por conversa resolvida em vez de por seat ou por minuto; não listado publicamente. A orientação de orçamento nos próprios materiais da Parloa é de $300.000+ por ano para licenciamento da plataforma mais implementação. Veja o guia de preços da Parloa.
Ideal para: grandes empresas que atendem milhões de ligações por ano e querem pagar por resoluções, e não por minutos
7. Sierra (Voice): um agente em chat e telefone
A Sierra, cofundada por Bret Taylor, ex-co-CEO da Salesforce, construiu sua reputação com implantações de "agent OS" focadas em chat para marcas como Sonos, Casper e SiriusXM, antes de estender o mesmo agente às ligações telefônicas no início de 2026. A proposta é consolidação: um agente, um conjunto de políticas e integrações, atendendo o cliente quer ele mande mensagem, converse pelo site ou ligue.
O voice agent da Sierra entra na frente ou atrás de um IVR existente em vez de substituí-lo, com a escalada para um humano feita por resumos gerados por IA. E, como a voz é mais nova que o produto de chat da Sierra, peça a qualquer demo clientes de referência específicos de telefone, e não apenas métricas de chat.
| O que você leva | O que você não leva |
|---|---|
| O mesmo agente e a mesma base de conhecimento em chat e voz | A voz é mais nova que o produto de chat consolidado da Sierra |
| Funciona na frente ou atrás de um IVR existente | Sem preço público, apenas abordagem enterprise conduzida pelo time comercial |
| Resumos gerados por IA para a passagem a um humano | Orçamentos reportados ficam entre $150.000 e $350.000+ por ano |
| Apoiada por uma Série E de $950M com avaliação de $15,8B | Feita para grandes empresas, não para um teste self-serve |
Preço: não publicado; contratos enterprise baseados em resultado e conduzidos pelo time comercial, com estimativas reportadas de $150.000-$350.000+ por ano. A Sierra levantou uma Série E de $950 milhões em maio de 2026, com avaliação de $15,8 bilhões. Veja a cobertura do TechCrunch.
Ideal para: empresas que já usam a Sierra, ou um agent OS parecido, para chat e querem o mesmo agente atendendo o telefone
8. Regal: ligações outbound de vendas e retenção em escala
A Regal nasceu como um discador assistido por IA para times humanos de vendas e retenção, antes de incorporar voice agents totalmente autônomos, e essa origem aparece: foi feita para campanhas outbound estruturadas, lembretes de agendamento e ligações de reconquista em seguros, saúde e serviços financeiros, onde o telefone ainda gera receita.
A Regal não publica preços, e a própria página de preços informa um piso real: mínimo de 25 seats e 100.000 minutos de ligações por mês antes de a Regal elaborar um contrato. Isso a exclui para um time pequeno testando uma ideia, mas é uma barreira razoável para um call center que já opera esse volume com agentes humanos e quer incluir IA na mistura.
| O que você leva | O que você não leva |
|---|---|
| Feita especificamente para campanhas outbound estruturadas | Mínimo publicado de 25 seats e 100K minutos/mês |
| Integrações nativas com CRM e analytics em tempo real | Nenhum preço visível até você passar por uma conversa comercial |
| Agentes que atuam em ligações, SMS e chat | Não foi feita para o primeiro piloto de um time pequeno |
| Apoiada por mais de $100M captados, liderados pela Emergence Capital | Posicionada para times de receita, não para atendimento ao cliente em geral |
Preço: não publicado; contratos personalizados por uso, com mínimo declarado de cerca de 25 seats e 100.000 minutos de ligação por mês. Veja regal.ai/pricing.
Ideal para: times de vendas, cobrança e retenção que conduzem campanhas outbound estruturadas em volume real de ligações
9. Synthflow: construtor no-code agora atrás de um muro enterprise
A Synthflow começou como um construtor no-code de voice agents voltado a agências e SMBs, combinando o raciocínio do GPT-4o com vozes da ElevenLabs em um editor de fluxo de arrastar e soltar, a mesma categoria que o nosso panorama dos melhores construtores de AI agents no-code cobre de forma mais ampla. Esse posicionamento ainda aparece pela web em avaliações de terceiros que citam planos mensais self-serve.
Mas ele não aparece mais no site da própria Synthflow. Em agosto de 2026, synthflow.ai/pricing lista um único plano Enterprise a partir de $30.000 por ano, dimensionado em torno de volume de ligações, concorrência, configuração de telefonia e integrações, sem cadastro self-serve visível. Se você viu um plano mensal mais barato citado em outro lugar, confirme diretamente com a Synthflow antes de basear o orçamento nele; a nossa própria checagem da página ao vivo não encontrou esse plano.
| O que você leva | O que você não leva |
|---|---|
| STT, LLM e TTS totalmente gerenciados, nada para montar | Nenhum plano self-serve visível em agosto de 2026 |
| Telefonia nativa, SIP trunking ou operadoras aprovadas | O piso de $30.000/ano exclui times pequenos e quem constrói sozinho |
| Integrações com CRM, agenda e fontes de conhecimento | Sites de terceiros ainda citam preços self-serve desatualizados |
| Suporte a MSA/DPA e uma revisão formal de segurança | Ciclo de vendas mais lento que o de um concorrente self-serve de verdade |
Preço: apenas Enterprise em agosto de 2026, com contratos a partir de $30.000 por ano, e o preço final dimensionado por volume e integrações. Veja synthflow.ai/pricing.
Ideal para: empresas que querem uma construção de voice AI totalmente gerenciada, sem montar STT, LLM e TTS por conta própria
10. Thoughtly: minutos ilimitados para imobiliário, seguros e educação
A Thoughtly mira especificamente setores de alta consideração e orientados a leads: imobiliárias, seguradoras, financeiras de crédito imobiliário e times de captação de alunos, onde uma ligação recebida perdida é uma venda perdida. O agente qualifica um lead por voz, faz o follow-up por SMS, e-mail ou WhatsApp, agenda a reunião e registra tudo de volta no CRM sem que um humano encoste no processo. Nosso blueprint de AI lead qualifier agent cobre o mesmo workflow, caso você prefira construí-lo por conta própria.
O preço dela se destaca aqui: o plano Flex custa $500 fixos por mês por minutos de voz ilimitados, com limite de 10 ligações simultâneas, em vez de cobrar por minuto. Para uma imobiliária com volume de ligações em picos em torno de lançamentos, essa taxa fixa pode superar um concorrente cobrado por minuto; para um call center que precisa de 100 conversas simultâneas, o limite de concorrência força a migração para uma cotação Scale personalizada.
| O que você leva | O que você não leva |
|---|---|
| $500/mês fixos por minutos de voz ilimitados | Limite de 10 ligações simultâneas no plano Flex |
| Workflow completo: ligação, SMS, e-mail, WhatsApp, sincronização com CRM | O preço de excedente por minuto não é publicado |
| Mais de 34 idiomas e mais de 200 integrações | O plano Enterprise exige mais de 1M de minutos/mês ou um setor regulado |
| Feita especificamente para imobiliário, seguros e educação | Menos de uso geral que Vapi ou Retell para outros setores |
Preço: Flex $500/mês (minutos ilimitados, até 10 ligações simultâneas); Scale e Enterprise sob consulta, com o Enterprise exigindo mais de 1M de minutos/mês ou um setor regulado. Veja thoughtly.com/pricing.
Ideal para: times de imobiliário, seguros, crédito imobiliário e educação que querem ligações ilimitadas por uma mensalidade fixa
11. Phonely: a porta de entrada self-serve mais barata de verdade
A Phonely é uma das poucas plataformas desta lista em que uma pequena empresa consegue se cadastrar e usar no mesmo dia, sem conversa com o time comercial. O plano gratuito inclui 100 minutos por mês, um número de telefone real e ligações simultâneas ilimitadas, e o plano Starter de $50/mês é precificado para uma empresa que atende o próprio telefone, não para um contact center.
O porém aparece no excedente: acima dos minutos incluídos no plano, a Phonely cobra de $0,25 a $0,35 por minuto, bem acima das taxas self-serve de $0,05-0,10/min de outras plataformas desta lista, então funciona melhor para um volume de ligações previsível e moderado, e não para linhas com picos ou de alto volume. Clientes Enterprise conseguem negociar até cerca de 5 centavos por minuto.
| O que você leva | O que você não leva |
|---|---|
| Plano gratuito com número de telefone real, sem cartão | O excedente custa $0,25-0,35/min, alto perto dos concorrentes por uso |
| Cadastro self-serve, no ar no mesmo dia | A melhor taxa por minuto (5 centavos) exige um contrato Enterprise |
| Ligações simultâneas ilimitadas até no plano gratuito | Integrações avançadas de API e CRM restritas ao plano Pro |
| BAA de HIPAA disponível no Enterprise | Histórico enterprise mais curto que o de PolyAI ou Parloa |
Preço: Grátis (100 min/mês, 1 número); Starter $50/mês ou $33/mês no plano anual (250 min, excedente de $0,25-0,35/min); Pro $150/mês ou $100/mês no plano anual (750 min, excedente de $0,30/min); Enterprise a partir de cerca de $0,05/min, sob consulta. Veja phonely.ai/pricing.
Ideal para: pequenas empresas e profissionais autônomos que querem um agente gratuito para começar, atendendo o telefone sem ciclo de vendas
12. Cartesia Line: construída sobre o modelo de voz mais rápido da categoria
A Cartesia passou seus primeiros anos como fornecedora de infraestrutura, os modelos de fala de baixa latência que outras plataformas às vezes licenciam, antes de lançar a Line, uma plataforma completa, orientada a código, para construir voice agents diretamente. A proposta: a empresa que constrói o modelo de base mais rápido também deveria construir a melhor plataforma de agentes.
Os agentes da Line usam por padrão os modelos próprios de text-to-speech Sonic 3.5 e de speech-to-text Ink 2 da Cartesia, ambos baseados em uma arquitetura de state-space model que, segundo a empresa, chega a geração abaixo de 90ms, mais rápida que os modelos baseados em transformer que a maioria dos concorrentes licencia de terceiros. A Voximplant adicionou suporte nativo a agentes Line em fevereiro de 2026, ampliando onde um agente criado na Cartesia pode de fato atender ligações.
| O que você leva | O que você não leva |
|---|---|
| Modelos de TTS/STT de base mais rápidos da categoria, pela especificação | Plataforma de agentes completa mais nova, histórico em produção mais curto |
| Plano gratuito para começar, self-serve até o Enterprise | O raciocínio ainda precisa de um LLM conectado, não vem embutido no Sonic |
| Ligações a $0,06/min mais $0,014/min por um número da Cartesia | Biblioteca de vozes menor que a da ElevenLabs ou da Murf |
| Suporte a mais de 40 idiomas com baixa latência consistente | Hoje há menos integrações de telefonia que em Vapi ou Retell |
Preço: Grátis; Pro $5/mês; Startup $49/mês; Scale $299/mês; Enterprise sob consulta. As ligações da Line custam $0,06/min mais $0,014/min de telefonia em um número fornecido pela Cartesia. Veja cartesia.ai/pricing.
Ideal para: desenvolvedores que querem construir sobre o modelo de voz de menor latência disponível e se sentem à vontade em uma plataforma de agentes mais nova
13. Deepgram Voice Agent API: traga o seu próprio LLM, pague por tempo de uso
A Voice Agent API da Deepgram dispensa por completo a interface de construção. É speech-to-text, orquestração de LLM e text-to-speech combinados em uma única API WebSocket em tempo real, cobrada pelo tempo de conexão, para times que querem escrever a própria lógica de agente em vez de configurar o canvas de outra pessoa.
A proposta é custo e flexibilidade na camada de infraestrutura: traga o seu próprio LLM ou modelo de TTS e a taxa publicada cai ainda mais, e a Deepgram se posiciona como cerca de um quarto mais barata que o Conversational AI da ElevenLabs e três quartos mais barata que a API Realtime da OpenAI para uso comparável. É a camada certa para um time com engenheiros que preferem escrever código de orquestração a aprender um construtor de agentes de terceiros.
| O que você leva | O que você não leva |
|---|---|
| STT, orquestração de LLM e TTS em uma única API em tempo real | Sem construtor de arrastar e soltar, é apenas uma API para desenvolvedores |
| A menor taxa por minuto publicada desta lista | Você escreve a lógica do agente e o fluxo de ligação por conta própria |
| Descontos para BYO LLM ou BYO TTS além do preço base | Sem telefonia nativa, traga a sua própria operadora |
| $200 em créditos gratuitos para contas novas | Mais adequada a times com capacidade interna de engenharia |
Preço: pay-as-you-go a partir de $0,056-0,075/min (Standard); plano Growth (anual pré-pago) a partir de $0,051/min; configurações BYO LLM e BYO TTS com preço menor; plano Advanced a $0,122-0,163/min. $200 de crédito gratuito para contas novas. Veja deepgram.com/pricing.
Ideal para: times de engenharia que querem a infraestrutura de voz em tempo real mais barata e estão construindo a própria lógica de agente por cima
14. Vogent: agentes que se aprimoram sozinhos, agora com o respaldo da Aircall
O diferencial da Vogent é um ciclo de testes que a maioria dos concorrentes trata como detalhe secundário: rodar automaticamente uma nova versão do agente contra todas as ligações passadas, sinalizar onde ela teria lidado com algo de forma diferente e corrigir o prompt antes que ele fale com alguém ao vivo. Combinada com modelos feitos sob medida para navegação em IVR, agendamento e processamento de pedidos, ela serve a times que querem um agente que melhora com o tempo, e não um que entra no ar e fica parado.
A Aircall, plataforma de telefonia empresarial, adquiriu a Vogent em maio de 2026 para reforçar o seu próprio voice agent nativo e, até o momento em que escrevo, a plataforma independente para desenvolvedores da Vogent ainda aceita novos cadastros. Pergunte diretamente sobre o roadmap do produto e sobre a continuidade antes de se comprometer com uma construção de vários anos nela.
| O que você leva | O que você não leva |
|---|---|
| Suíte de avaliação automatizada que testa novas versões contra ligações passadas | Adquirida pela Aircall em maio de 2026, futuro independente menos certo |
| Modelos feitos sob medida para navegação em IVR, agendamento e processamento de pedidos | Ecossistema e comunidade menores que os de Vapi ou Retell |
| Self-serve a partir de $0,09/min, caindo para $0,05/min em volume | Detalhes do preço Enterprise mais escassos que os de rivais mais estabelecidos |
| Acesso completo a API e SDK junto com ferramentas no-code | Marca mais nova, com menos cobertura de benchmarks independentes de latência |
Preço: self-serve a partir de $0,09/min, caindo para cerca de $0,05/min para clientes enterprise; vozes premium com preço à parte; Enterprise sob consulta. Veja a página de comparação da própria Vogent.
Ideal para: times que querem um agente que se retesta automaticamente contra ligações passadas reais à medida que evolui
Telefonia: traga o seu próprio Twilio ou use o número incluído
Toda plataforma acima resolve o mesmo problema de encanamento de um jeito diferente: como uma ligação chega de fato ao agente? A maioria das plataformas voltadas a desenvolvedores aceita tanto um número incluído, que você compra na própria plataforma, quanto uma configuração de operadora própria via Twilio, Telnyx ou um SIP trunk puro, o que importa se você já tem números, minutos ou histórico de compliance atrelados a uma conta de operadora existente.

| Plataforma | Números fornecidos | BYO Twilio / SIP | Observações |
|---|---|---|---|
| Vapi | Compra na plataforma ou importação | Suporte completo a SIP trunk, inbound e outbound | A história de telefonia mais flexível entre as ferramentas voltadas a desenvolvedores |
| Retell AI | Números locais nos EUA, Reino Unido, Canadá, Austrália e outros | Twilio, Telnyx, Vonage via Elastic SIP | Três caminhos: comprar, importar ou conectar um tronco |
| Bland AI | Números incluídos | BYOT disponível, dispensa taxas de transferência | A taxa fixa por minuto cobre tudo, menos as transferências |
| ElevenLabs Agents | Nativo mais Twilio, Genesys, Amazon Connect | Sim | Multicanal além da voz: WhatsApp, SMS, web |
| Cartesia Line | Números fornecidos pela Cartesia a $0,014/min | Via Voximplant e outros parceiros de telefonia | Camada de telefonia mais nova, menos integrações diretas |
| Deepgram Voice Agent API | Nenhum nativo | Totalmente BYO, é uma API | A telefonia é inteiramente responsabilidade do desenvolvedor |
| Phonely | 1 a 5 números grátis conforme o plano | SIP trunking no Enterprise | Números incluídos em todos os planos self-serve |
| Thoughtly | Incluídos ou operadora própria | Twilio, Telnyx | Construtor no-code sobre um número incluído ou BYO |
| PolyAI, Parloa, Regal, Sierra, Synthflow | Telefonia enterprise ou o stack de contact center existente | Definido por contrato | Feitos para ficar na frente ou atrás de um discador ou IVR existente |
Se o seu time já usa Twilio, uma plataforma com suporte completo a SIP trunk (Vapi, Retell AI, Thoughtly) mantém seus números e o histórico de ligações em um só lugar. Começando do zero, um número incluído permite discar em minutos, e é aí que Bland, Phonely e os números da própria Cartesia são o caminho mais rápido.
A conta real por minuto: AI voice agent vs. agente humano
A taxa por minuto de todo fornecedor de voice agents compete, na prática, com um único número: quanto um humano custa para fazer o mesmo trabalho. Um agente de call center onshore nos EUA, com todos os custos incluídos, sai por cerca de $26 por hora em 2026, aproximadamente $0,43 por minuto, contra $6 a $14 por hora offshore ($0,10-0,23/min) e $12 a $18 por hora nearshore ($0,20-0,30/min), segundo os dados de custo de 2026 da Call Force Global.

| Comparação | Custo por minuto | O que está incluído |
|---|---|---|
| Agente humano onshore nos EUA (todos os custos incluídos) | ~$0,43/min | Salários, benefícios, software, custos fixos, recrutamento, rotatividade |
| Agente humano nearshore (Caribe, América Latina) | $0,20-0,30/min | O mesmo acima, mercado de trabalho de menor custo |
| Agente humano offshore (Filipinas, Índia) | $0,10-0,23/min | O mesmo acima, mercado de trabalho de menor custo de todos |
| Deepgram Voice Agent API (self-serve) | $0,051-0,075/min | STT, orquestração de LLM, TTS; telefonia BYO |
| Cartesia Line (self-serve) | $0,06/min + $0,014/min de telefonia | TTS, STT, orquestração, número fornecido pela Cartesia |
| Vapi / Retell AI (self-serve, tudo incluído) | $0,07-0,31/min | STT, LLM, TTS, varia muito conforme o modelo escolhido |
| Bland AI (taxa fixa) | $0,11-0,14/min + taxa de plataforma | LLM, STT, TTS agrupados, sem cobrança por token |
| Phonely (excedente self-serve) | $0,25-0,35/min | Stack completo mais um número de telefone, plano para pequenas empresas |
No papel, a maioria das plataformas self-serve sai mais barata até que a mão de obra humana offshore quando o volume justifica a configuração, e é a comparação com que toda proposta de fornecedor abre. É uma comparação justa para um trabalho de escopo estreito, qualificar um lead, confirmar um agendamento, responder a uma pergunta frequente, que um roteiro consegue resolver de ponta a ponta. É menos honesta para qualquer coisa que exija julgamento ou desescalada, e é por isso que a previsão da Gartner de $80 bilhões em economia de mão de obra para 2026 vem acompanhada da ressalva de que apenas cerca de 1 em cada 10 interações de agentes será totalmente automatizada este ano. Compare o preço do agente com o tipo de ligação específico, e não com o orçamento total de headcount.
Compliance e consentimento: o que muda quando a ligação é gravada
Um AI voice agent não é só uma ligação mais barata. Ele herda um conjunto específico de obrigações legais no instante em que disca ou grava o que ouve.

Consentimento outbound. A FCC confirmou em fevereiro de 2024 que uma voz gerada por IA ou clonada conta como "voz artificial" sob a TCPA, então uma ligação outbound de um voice agent exige o mesmo consentimento prévio expresso de uma robochamada pré-gravada, além de identificação clara de quem liga e de uma opção de cancelamento que funcione. Uma relação comercial já existente não isenta uma ligação de AI voice como pode isentar uma ligação manual, e as multas vão de $500 a $1.500 por ligação, sem teto agregado.
Gravação de ligações e PCI. No momento em que quem liga lê um número de cartão para um agente que grava a ligação, essa gravação entra no escopo do PCI DSS, e armazenar um CVV falado após a autorização é uma violação direta. Plataformas feitas para setores regulados (Bland, Phonely, Synthflow, Thoughtly, Sierra) oferecem gravação com pausa e retomada ou um fluxo separado de captura segura para manter os dados do cartão fora da transcrição. Verifique isso de forma explícita, em vez de presumir que já vem resolvido por padrão.
HIPAA. Se a ligação envolve informações de saúde protegidas, você precisa de um Business Associate Agreement assinado, e não apenas da página de segurança de um fornecedor. A Bland AI declara elegibilidade a HIPAA com BAA de forma direta; Vapi, Thoughtly e Phonely restringem isso aos planos enterprise mais altos; PolyAI, Parloa e Sierra definem por contrato.
Nada disso é opcional nem exclusivo de um fornecedor. Confirme por escrito os fluxos de consentimento, os controles de gravação e a disponibilidade de BAA antes que um piloto chegue perto de ligações reais de clientes, e não depois.
Como escolher: framework de decisão
Comece pela restrição operacional que mais pesa: controle de construção, suporte a contact center, estrutura outbound, previsibilidade de preço ou latência de voz.

| Se você precisa de... | Escolha... | Por quê |
|---|---|---|
| Controle total sobre o seu próprio stack de STT, LLM e TTS | Vapi | A escolha mais flexível de telefonia e de modelos desta lista |
| Um agente em produção com preço detalhado e previsível | Retell AI | Cobrança transparente por componente, boa reputação de suporte |
| Uma taxa fixa sem surpresas do provedor de modelo | Bland AI | LLM, STT e TTS agrupados em um único preço por minuto |
| A maior cobertura de idiomas e o melhor realismo de voz | ElevenLabs Agents | Mais de 70 idiomas, o mesmo motor do melhor produto de TTS do mercado |
| Uma implantação enterprise totalmente gerenciada em muitas unidades | PolyAI | Design de conversas e ajuste gerenciados incluídos no contrato |
| Preço baseado em resultado em volume de ligações muito alto | Parloa | Pague por conversa resolvida, feita para mais de 2M de ligações por ano |
| Um agente atendendo chat e telefone da mesma forma | Sierra (Voice) | Unifica um agente de chat existente com um novo canal de voz |
| Ligações outbound estruturadas de vendas ou retenção | Regal | Feita sob medida para campanhas outbound em volume real |
| Uma construção gerenciada sem engenharia de IA interna | Synthflow | Stack totalmente gerenciado, agora dimensionado como contrato enterprise |
| Minutos ilimitados para leads de imobiliário, seguros ou educação | Thoughtly | $500/mês fixos cobrem minutos de voz ilimitados |
| Um agente gratuito para começar, para a linha de telefone de uma pequena empresa | Phonely | Cadastro self-serve de verdade, plano gratuito, sem conversa com vendas |
| O modelo de voz de menor latência como base | Cartesia Line | Modelos de TTS/STT abaixo de 90ms, plataforma Line feita sob medida |
| A infraestrutura mais barata se você constrói a lógica do agente | Deepgram Voice Agent API | A menor taxa por minuto publicada, suporte completo a BYO LLM |
| Um agente que se retesta automaticamente contra ligações passadas | Vogent | Suíte de avaliação embutida que a maioria dos concorrentes não tem |
O que fazer em seguida
Escolha a sua faixa antes de escolher um fornecedor: construir o seu próprio agente (Vapi, Retell AI, Cartesia Line, Deepgram) ou comprar um gerenciado (PolyAI, Parloa, Synthflow, Sierra). Depois faça um piloto de verdade, e não um roteiro de demo, com uma interrupção real no meio da frase e alguém que fala embolado, e cronometre a resposta você mesmo em vez de confiar na página de latência do fornecedor. Confirme por escrito os fluxos de consentimento e a disponibilidade de BAA antes que uma única ligação real de cliente toque o sistema.
Se você prefere desenhar o workflow do agente por conta própria a procurar uma plataforma, nosso blueprint de AI voice call agent e o guia de como construir um AI agent cobrem o caminho da construção, e o framework de como escolher uma plataforma de AI agents vale tanto para voz quanto para chat. Para workflows de suporte próximos ao telefone, veja o nosso blueprint de AI support triage agent. E, para o conjunto mais amplo de produtos de AI agents, comece pelo nosso guia das melhores plataformas de AI agents.

On this page
- Atualizado em agosto de 2026: o que mudou
- Fatos Principais
- Tabela comparativa rápida
- Latência e barge-in: o número que realmente decide se uma ligação parece humana
- 1. Vapi: infraestrutura voltada a desenvolvedores para voice agents sob medida
- 2. Retell AI: o rival mais próximo da Vapi, ajustado para confiabilidade
- 3. Bland AI: preço fixo por minuto, sem nada extra
- 4. ElevenLabs Agents: qualidade de voz e mais de 70 idiomas, da líder em TTS
- 5. PolyAI: voice AI gerenciada para contact centers enterprise
- 6. Parloa: preço baseado em resultado para contact centers de alto volume
- 7. Sierra (Voice): um agente em chat e telefone
- 8. Regal: ligações outbound de vendas e retenção em escala
- 9. Synthflow: construtor no-code agora atrás de um muro enterprise
- 10. Thoughtly: minutos ilimitados para imobiliário, seguros e educação
- 11. Phonely: a porta de entrada self-serve mais barata de verdade
- 12. Cartesia Line: construída sobre o modelo de voz mais rápido da categoria
- 13. Deepgram Voice Agent API: traga o seu próprio LLM, pague por tempo de uso
- 14. Vogent: agentes que se aprimoram sozinhos, agora com o respaldo da Aircall
- Telefonia: traga o seu próprio Twilio ou use o número incluído
- A conta real por minuto: AI voice agent vs. agente humano
- Compliance e consentimento: o que muda quando a ligação é gravada
- Como escolher: framework de decisão
- O que fazer em seguida