Agente de voz full duplex ou em cascata?
Compare agente de voz full duplex e arquitetura em cascata por latência, interrupções, controle, integração, custo e qualidade operacional no atendimento.
Uma voz natural pode esconder uma operação mal conectada
Agentes de voz estão ficando melhores em ritmo, pausas, interrupções e ruído. Isso reduz uma fricção evidente das experiências antigas: a conversa em turnos rígidos, na qual a pessoa precisa esperar o sistema terminar de falar para corrigir ou acrescentar algo.
A melhora abre uma decisão técnica. A empresa pode usar uma arquitetura em cascata, separando transcrição, raciocínio e síntese de voz, ou adotar um modelo full duplex capaz de ouvir e falar dentro da mesma sessão em tempo real.
As duas abordagens podem atender clientes. Elas distribuem latência, controle, custo, evidência e dependência de maneiras diferentes. O melhor desenho depende do tipo de conversa e do trabalho que precisa ficar concluído depois da ligação.
Em 10 de setembro de 2026, a OpenAI anunciou o GPT-Live-1 para API e apresentou uma arquitetura de voz full duplex, com tratamento de interrupções e possibilidade de delegar raciocínio e uso de ferramentas a modelos de retaguarda. O lançamento torna a comparação mais concreta, mas não elimina a necessidade de testar telefonia, regras, fontes, registro e escalonamento no processo da empresa.
Como funciona a arquitetura em cascata
Uma arquitetura em cascata costuma dividir a conversa em componentes especializados.
- A telefonia recebe o áudio.
- Um sistema de detecção identifica o turno.
- O reconhecimento de fala converte áudio em texto.
- Um modelo interpreta a solicitação e decide a resposta.
- Ferramentas consultam ou atualizam sistemas.
- Um sintetizador transforma a resposta em voz.
- A telefonia reproduz o áudio para a pessoa.
Cada componente pode vir de um fornecedor diferente. A empresa escolhe o serviço de transcrição, o modelo de linguagem, o sintetizador, a camada de telefonia e o orquestrador.
Essa composição cria pontos de espera. O reconhecimento precisa confirmar parte da fala, o modelo processa o texto e a síntese começa a produzir áudio. Interrupções exigem cancelar reprodução, capturar a nova fala e atualizar o estado da conversa.
A cascata também oferece fronteiras úteis. A equipe pode inspecionar transcrição antes do raciocínio, trocar a voz sem alterar o modelo e aplicar filtros determinísticos entre etapas.
Como funciona a voz full duplex
Em uma arquitetura full duplex, o modelo de voz processa áudio de entrada e produz áudio de saída na mesma sessão, com capacidade de lidar com sobreposição, silêncio, hesitação e mudança de intenção durante a fala.
A experiência fica menos dependente de turnos rígidos. O sistema pode perceber que a pessoa começou a falar, interromper a resposta e incorporar a correção sem esperar uma rodada completa.
O modelo de voz pode resolver interações simples diretamente ou delegar trabalho para uma camada de retaguarda. Essa camada consulta fontes, aplica raciocínio mais demorado ou usa ferramentas. O resultado retorna à sessão em uma forma adequada para fala.
O desenho reduz algumas passagens do caminho de áudio. Ao mesmo tempo, concentra comportamento conversacional em um componente que precisa ser avaliado como sistema em tempo real, não somente como transcritor ou sintetizador.
Compare as arquiteturas pelo tipo de conversa
Turnos previsíveis favorecem controle modular
Confirmação de data, coleta de número de pedido, pesquisa curta e menus conversacionais possuem turnos relativamente delimitados. A cascata pode atender bem quando a latência fica dentro da expectativa e a empresa valoriza componentes substituíveis.
Interrupções frequentes favorecem full duplex
Conversas em que a pessoa corrige, hesita, muda de assunto ou fala sobre a resposta exigem tratamento fino de sobreposição. Full duplex reduz a sensação de bloqueio quando a tecnologia realmente consegue distinguir interrupção, ruído e fala de terceiros.
Trabalho longo pede uma retaguarda separada
Uma pessoa pode perguntar algo que exige consultar histórico, verificar política e chamar dois sistemas. Manter toda a lógica dentro da sessão de voz aumenta espera e complexidade. A camada de voz deve reconhecer o pedido, informar o próximo passo e delegar a execução.
O guia sobre agentes de IA para tarefas longas mostra como preservar estado, checkpoints e retomada quando o resultado não cabe no tempo da conversa.
Consequências sensíveis pedem barreiras fora da voz
Mudar cadastro, confirmar pagamento, alterar contrato ou fornecer informação protegida exige identidade, regra e autorização. Nenhuma naturalidade conversacional substitui esses controles. A voz coleta intenção; políticas e ferramentas limitadas governam a ação.
Latência precisa ser medida de ponta a ponta
Uma demonstração pode apresentar resposta rápida em conexão ideal e sem integração. A operação inclui telefonia, rede, detecção de fala, modelo, ferramentas, validação e reprodução.
Meça pelo menos:
- tempo entre o fim da fala e o início da resposta;
- tempo até a primeira confirmação útil;
- atraso para interromper uma resposta em curso;
- tempo de consulta a cada sistema;
- duração de escalonamento para uma pessoa;
- percentual de respostas dentro da janela definida;
- abandono associado à espera;
- repetição causada por áudio cortado ou entendimento incorreto.
A latência média esconde chamadas ruins. Observe percentis e classes de tarefa. Consulta de status e investigação de exceção possuem tempos diferentes.
O artigo sobre latência em agentes de IA ajuda a distribuir o orçamento de tempo entre fila, modelo, ferramentas e confirmação.
Interrupção é um problema de intenção, não só de áudio
Parar de falar quando outro som aparece é fácil de demonstrar e difícil de acertar em produção. O sistema precisa distinguir situações como:
- a pessoa corrigiu um dado;
- pediu para parar;
- apenas confirmou que está ouvindo;
- falou com alguém ao lado;
- produziu um ruído curto;
- começou outra pergunta;
- ficou em silêncio para pensar;
- a ligação teve eco ou atraso.
Cada caso pede comportamento diferente. Uma confirmação curta, como "certo", pode permitir que o agente continue. Uma correção de data precisa cancelar a ação em preparação. Fala paralela sem relação com a ligação pode ser ignorada.
Teste a política de turnos com pessoas e ambientes representativos. O fornecedor pode melhorar a capacidade do modelo, mas a empresa continua responsável por definir quando interromper, confirmar, repetir, esperar ou transferir.
Segundo a OpenAI, avaliações iniciais do GPT-Live-1 indicaram redução de quase 80% nas interrupções durante pausas de pensamento em um caso da Speak, em comparação com sistemas anteriores usados pela empresa. Esse resultado pertence à avaliação informada para aquele produto. Ele serve como sinal de capacidade, não como previsão para atendimento, idioma, telefonia ou público diferentes.
Controle modular: onde a cascata leva vantagem
A cascata permite escolher e trocar componentes individualmente. Isso pode ser relevante quando:
- a empresa precisa de transcrição especializada por setor ou idioma;
- a voz exige provedor, pronúncia ou identidade própria;
- um modelo específico possui melhor desempenho na tarefa;
- políticas precisam inspecionar texto antes de cada resposta;
- existe obrigação de armazenar ou tratar componentes em ambientes distintos;
- custo e disponibilidade precisam de rotas alternativas por etapa;
- a equipe já possui uma plataforma de voz madura.
O controle modular só ajuda quando a empresa consegue operar a composição. Vários fornecedores criam contratos, credenciais, métricas e falhas de fronteira. Uma ligação ruim pode exigir investigação em cinco painéis.
Simplicidade de interação: onde full duplex leva vantagem
Full duplex pode reduzir a quantidade de componentes no caminho conversacional e melhorar a coordenação entre escuta e fala. A abordagem ganha força quando:
- a naturalidade do turno muda a conclusão da tarefa;
- interrupções são frequentes;
- a sessão precisa acompanhar correções em tempo real;
- latência da cascata atual causa abandono ou repetição;
- uma única camada de voz simplifica a manutenção;
- o fornecedor atende requisitos de idioma, dados e disponibilidade;
- existe uma retaguarda clara para ações e raciocínio complexo.
Concentrar a experiência de voz também concentra dependência. Mudanças de preço, qualidade, disponibilidade ou política do provedor podem afetar escuta e fala ao mesmo tempo. Portabilidade e contingência entram na compra desde o início.
Raciocínio e ferramentas devem ficar fora do caminho de áudio quando possível
Nem toda resposta precisa acionar um modelo maior ou uma integração. Separe rotas por trabalho.
Resposta conversacional curta
Saudações, confirmação de entendimento e explicação de opções podem permanecer na camada de voz, dentro de conteúdo aprovado.
Consulta rápida
Status, disponibilidade ou cadastro podem usar ferramentas estreitas, com prazo curto e retorno estruturado. A resposta só informa conclusão depois de confirmar o sistema oficial.
Análise mais profunda
Histórico extenso, política complexa, comparação de documentos ou investigação deve seguir para uma camada de retaguarda. O agente de voz informa que está verificando, mantém estado e decide se a pessoa pode esperar ou receber retorno.
Ação sensível
A ferramenta aplica autenticação, alçada, limites e confirmação. Em casos definidos, uma pessoa aprova. O modelo de voz não ganha permissão adicional porque a conversa parece clara.
Essa separação permite usar uma experiência full duplex sem transformar o componente de áudio em dono do processo inteiro.
O estado da conversa precisa sobreviver à chamada
A sessão de voz mantém informações temporárias: intenção atual, dados confirmados, correções, ferramentas chamadas e próximo passo. Parte desse estado precisa virar registro operacional.
Ao final da ligação, o sistema deveria produzir:
- identidade confirmada ou nível de incerteza;
- motivo do contato;
- fatos coletados;
- fontes consultadas;
- ações tentadas;
- confirmações recebidas;
- pendências;
- responsável pela próxima etapa;
- prazo informado;
- consentimentos ou restrições relevantes;
- referência para gravação ou transcrição, conforme a política.
O CRM, help desk, agenda ou ERP continua como fonte oficial do objeto. O histórico interno da sessão não pode ser o único lugar onde uma promessa ou alteração existe.
O guia sobre fonte da verdade para agentes de IA ajuda a definir que sistema governa cada dado e como tratar divergências.
Como avaliar qualidade de voz em operação
Taxa de resolução isolada pode premiar encerramentos rápidos e incorretos. Combine experiência, entendimento, execução e resultado.
Experiência conversacional
Observe latência, interrupções mal tratadas, repetições, silêncio, fala sobreposta, abandono e pedido de transferência.
Entendimento
Avalie nomes, números, datas, códigos, intenção, correções e mudança de assunto. Teste sotaques, velocidades de fala, ruído, eco e qualidade variável da telefonia.
Uso de ferramentas
Verifique seleção da ferramenta, argumentos, autorização, prazo, resposta do sistema e comunicação honesta quando a consulta falha.
Resultado operacional
Meça casos resolvidos dentro do escopo, transferências com contexto, registros completos, pendências com dono, retrabalho e custo por desfecho válido.
Segurança e conformidade
Acompanhe falhas de autenticação, acesso bloqueado, dado indevido na resposta, retenção, consentimento e ações interrompidas pela política.
O guia de implementação de agentes de voz organiza jornada, identidade, fontes, handoff humano e métricas do processo completo.
Faça um teste comparável entre as duas opções
Use as mesmas ligações simuladas, tarefas e integrações. Inclua:
- pergunta simples com resposta conhecida;
- correção de nome ou data no meio da resposta;
- pausa longa de pensamento;
- confirmação curta enquanto o agente fala;
- ruído e fala de terceiros;
- código alfanumérico;
- consulta lenta a um sistema;
- ferramenta indisponível;
- identidade insuficiente para a ação;
- pedido fora do escopo;
- transferência para pessoa;
- chamada encerrada antes da conclusão.
Registre áudio, transcrição, eventos, chamadas de ferramenta e estado final de acordo com a política de dados. Avaliadores devem usar critérios definidos antes do teste.
Compare também o trabalho de operar a solução: quantidade de componentes, tempo para localizar falha, esforço de mudança, dependência do fornecedor e capacidade de fallback.
Custos que ficam fora do preço por minuto
O preço da camada de voz representa uma parte do custo. Inclua:
- telefonia e números;
- reconhecimento e síntese, quando separados;
- modelo de retaguarda;
- chamadas de ferramentas;
- busca e armazenamento de contexto;
- gravação e transcrição;
- monitoramento;
- revisão de amostras;
- transferência humana;
- testes de regressão;
- manutenção de integrações;
- suporte e incidentes;
- chamadas sem resultado válido.
A OpenAI informou preço de US$ 0,05 por minuto para a camada de voz do GPT-Live-1 no lançamento. Modelos de retaguarda, ferramentas, telefonia e demais componentes possuem custos próprios. Preço e condições podem mudar, por isso a comparação deve usar a tabela vigente no momento da compra.
Calcule custo por chamada concluída dentro do critério, e não somente custo por minuto processado.
Continuidade e fallback
Uma arquitetura de voz precisa degradar sem abandonar o cliente.
Defina o que acontece quando:
- a camada full duplex fica indisponível;
- a transcrição perde qualidade;
- a síntese falha;
- uma integração ultrapassa o prazo;
- o modelo de retaguarda não responde;
- a telefonia cai;
- o contexto não pode ser carregado;
- a transferência humana não está disponível.
As rotas podem incluir mensagem curta, coleta de contato, criação de protocolo, retorno assíncrono, transferência para fila, uso de resposta aprovada ou bloqueio de ação sensível.
Full duplex pode usar uma cascata simplificada como contingência. Uma cascata pode trocar fornecedores por componente. Nos dois casos, teste o fallback em chamadas reais controladas. Um plano escrito que nunca foi acionado costuma falhar na primeira indisponibilidade.
Checklist de decisão
- [ ] A conversa escolhida possui resultado operacional claro?
- [ ] Interrupções afetam a conclusão ou apenas a sensação de naturalidade?
- [ ] A latência foi medida com telefonia e ferramentas reais?
- [ ] Sotaques, ruído, silêncio e sobreposição foram testados?
- [ ] A camada de voz está separada das autorizações sensíveis?
- [ ] Raciocínio longo possui rota de retaguarda?
- [ ] Cada ação recebe confirmação do sistema oficial?
- [ ] O estado útil vira registro depois da chamada?
- [ ] A transferência leva contexto completo para a pessoa?
- [ ] Existe política para áudio, transcrição e retenção?
- [ ] O custo inclui telefonia, retaguarda, ferramentas e revisão?
- [ ] A equipe consegue investigar uma falha de ponta a ponta?
- [ ] Existe fallback testado?
- [ ] A dependência do fornecedor é conhecida?
- [ ] Métricas avaliam o desfecho, não somente a conversa?
Escolha a arquitetura pelo trabalho que precisa terminar
Full duplex melhora a dinâmica de conversas nas quais pausa, sobreposição e correção importam. A cascata preserva modularidade e pode oferecer controle mais direto sobre cada componente. Uma composição híbrida também é possível: voz em tempo real na frente, raciocínio e ferramentas governadas na retaguarda.
A decisão deve começar pela chamada concreta. Meça latência, entendimento e interrupções com o ambiente real. Depois verifique identidade, fontes, ações, registro, handoff e custo por resultado válido.
Uma conversa fluida ajuda o cliente. A arquitetura só entrega valor quando essa conversa deixa o processo em um estado correto, verificável e com a próxima responsabilidade definida.
Fonte consultada: OpenAI, Build more natural voice experiences with GPT-Live-1 in the API, 10 de setembro de 2026.