Como montar seu professor de inglês no WhatsApp com IA e n8n, no seu nível, passo a passo

Avalie!

Aula particular de inglês em São Paulo custa entre R$ 80 e R$ 150 a hora. Duas por semana dão perto de R$ 900 por mês, e ainda assim você fala inglês por duas horas e passa as outras cento e sessenta e seis sem praticar.

Dá para montar um professor que vive no seu WhatsApp. Conversa a qualquer hora, corrige do jeito certo, lembra do que você errou na semana passada, segue uma trilha de estudo de verdade, analisa a sua pronúncia pelo áudio e até puxa você para dinâmicas em grupo com outros alunos.

Leva uma tarde para construir e alguns reais por mês para rodar. Vou do servidor até os recursos avançados, na ordem.

O que você vai construir

  • Um número de WhatsApp que conversa em inglês por texto e por áudio
  • Correção que não interrompe a conversa
  • Memória do que você já falou e do que costuma errar
  • Uma trilha de estudo progressiva, com unidades e avaliação de passagem de nível
  • Análise do seu áudio além da transcrição: ritmo, hesitação e pronúncia
  • Grupos de estudo onde o professor media a conversa entre alunos
  • Lição diária e revisão espaçada baseada nos seus erros reais
  • Caminho para videochamada com professor virtual, no nível avançado

Ferramentas: uma VPS, Docker, n8n, uma conta de IA com créditos e o WhatsApp. Nenhuma linha de código.

A decisão que você precisa tomar antes de começar

Existem dois caminhos para colocar automação no WhatsApp, e a escolha muda tudo. Vou ser direto sobre os dois.

Caminho 1: API oficial da Meta. É a Cloud API. Você registra um número comercial, passa pela verificação e paga por conversa iniciada. Risco de bloqueio: zero. O problema é a regra da janela de 24 horas: fora dela, você só consegue iniciar conversa com modelo de mensagem previamente aprovado pela Meta. Isso atrapalha justamente a lição diária espontânea.

Caminho 2: Evolution API. É uma solução open source que expõe o WhatsApp como API REST, rodando no seu servidor e conectando pelo QR Code, como o WhatsApp Web. Sem custo por mensagem, sem janela de 24 horas e sem aprovação de template. Em compensação, não é oficial, e existe risco real de bloqueio do número se o comportamento parecer robótico em volume.

Para uso pessoal e estudo, com um número dedicado e volume de conversa humana, a Evolution é o caminho prático, e é o que vou detalhar. Para uso comercial com centenas de contatos, vá de API oficial. Não use o seu número pessoal em nenhum dos dois casos.

Passo 1: subir o servidor

Você precisa de uma VPS modesta, algo com 2 vCPU e 4 GB de RAM já roda folgado, em Ubuntu, com Docker e Docker Compose instalados.

A stack tem três peças: a Evolution API, um PostgreSQL para o histórico e um Redis para cache. Crie uma pasta e dentro dela um arquivo docker-compose.yml definindo esses três serviços, mais o n8n se quiser tudo no mesmo lugar.

As variáveis de ambiente que realmente importam na Evolution:

  • AUTHENTICATION_API_KEY: a senha da sua API. Troque por algo longo e aleatório, nunca deixe o valor de exemplo.
  • SERVER_URL: a URL pública onde a API vai responder.
  • DATABASE_PROVIDER e DATABASE_CONNECTION_URI: apontando para o Postgres.
  • CACHE_REDIS_ENABLED e a URI do Redis.
  • TZ: America/Sao_Paulo, para os agendamentos baterem com o seu horário.

Suba tudo com docker compose up -d. Coloque um proxy reverso na frente com HTTPS, porque webhook sem certificado é problema na certa.

Passo 2: conectar o WhatsApp

Acesse o gerenciador da Evolution no endereço da sua API, com a chave que você definiu. Crie uma instância, dê um nome, e ela vai gerar um QR Code.

Abra o WhatsApp do número dedicado, vá em dispositivos conectados e escaneie. Pronto: a partir daqui, toda mensagem que chegar nesse número passa pela sua API.

Antes de automatizar, use esse número normalmente por alguns dias, conversando com pessoas reais. Número novo que nasce disparando mensagem automática é o perfil clássico que leva bloqueio.

Passo 3: ligar no n8n

No n8n, crie um workflow com um nó Webhook e copie a URL dele.

Na Evolution, configure o webhook da instância apontando para essa URL, marcando o evento de mensagem recebida. Mande uma mensagem de teste para o número e veja o corpo chegar no n8n. É nesse corpo que estão o número do remetente, o tipo de mensagem e o conteúdo.

Existe também um nó comunitário da Evolution para o n8n, que facilita o envio. Vale instalar, mas o envio por requisição HTTP direta funciona igual e depende menos de terceiros.

Passo 4: separar texto, áudio e imagem

Adicione um nó Switch com três saídas, lendo o tipo da mensagem que veio no webhook.

Texto segue direto. Áudio vai para a transcrição. Imagem vai para um caminho de leitura visual, que serve para quando o aluno fotografa um exercício do caderno ou um trecho de livro e pergunta sobre aquilo.

Depois dos três caminhos, use um nó Edit Fields para padronizar tudo em um campo só, algo como mensagem_aluno. Assim o resto do fluxo não precisa saber de onde veio.

Passo 5: transcrever o áudio

No caminho do áudio, baixe o arquivo da mídia pela Evolution e passe para um nó de transcrição.

Peça a transcrição com marcação de tempo, não só o texto puro. Parece detalhe, mas é o que vai permitir a análise de fluência mais adiante. Texto sem tempo só diz o que você falou; texto com tempo diz como você falou.

Passo 6: o agente e a memória

Adicione o nó AI Agent e conecte nele um modelo de chat e uma memória.

Na chave de sessão da memória, use o número do remetente. É isso que amarra a conversa a cada aluno e faz o professor lembrar de ontem. Se você pretende ter mais de um aluno, use memória persistente em banco, e não a memória simples em, porque ela se perde quando o fluxo reinicia.

Passo 7: o prompt que deixa a conversa fluida

Aqui está o coração do projeto. A diferença entre um tutor que você usa todo dia e um que você abandona na terça-feira não é o modelo, é a instrução.

Você é um professor particular de inglês conversando por WhatsApp. O aluno é brasileiro. Consulte a ficha dele antes de responder.

Conversa:

1. Fale em inglês num nível ligeiramente acima do nível do aluno, nunca muito acima.

2. Escreva como se escreve no WhatsApp: três a cinco frases, tom leve, sem parecer livro didático.

3. Termine sempre com uma pergunta, para a conversa continuar.

4. Não interrompa a conversa para corrigir. Responda ao conteúdo primeiro. No final, acrescente um bloco curto “Correction” com no máximo dois erros, o certo e o motivo em português, uma linha cada.

5. Corrija só o que atrapalha a comunicação ou o que o aluno já repetiu antes. Ignore deslizes pequenos.

6. Se o aluno escrever em português, responda em inglês simples e convide ele a tentar de novo.

7. Registre na ficha todo erro repetido e toda palavra nova.

8. Puxe o assunto do objetivo do aluno. Se ele estuda para entrevista, leve a conversa para trabalho, carreira e experiência.

As regras 2, 4 e 5 são as que salvam o projeto. Sem elas o modelo vira um corretor cansativo que devolve parágrafos, e ninguém aguenta isso por mais de três dias.

Post-its coloridos em um quadro, representando o vocabulário registrado para revisão pelo tutor de inglês
Conversa solta vira passatempo. O que transforma em aprendizado é a trilha e o registro do que você erra.

Passo 8: a trilha de estudo

Conversar todo dia ajuda, mas sozinho não leva ninguém de A2 para B2. O que faz progredir é currículo: uma sequência com começo, meio e avaliação.

Monte uma tabela de trilha com estas colunas: nivel, unidade, tema, estrutura_alvo, vocabulario_alvo e criterio_de_aprovacao.

Um exemplo de recorte para B1, só para você ver o formato: unidade 1, tema viagem e aeroporto, estrutura alvo passado simples contra presente perfeito, vocabulário alvo trinta termos, critério de aprovação usar a estrutura corretamente em oito de dez tentativas espontâneas.

Agora a ficha do aluno ganha as colunas unidade_atual, acertos_na_estrutura e tentativas_na_estrutura.

No prompt, acrescente: “puxe a conversa naturalmente para a estrutura alvo da unidade atual, sem anunciar que está fazendo isso. A cada uso espontâneo da estrutura pelo aluno, registre acerto ou erro. Quando o critério de aprovação for atingido, avise o aluno que ele passou de unidade e comece a próxima.”

Esse é o detalhe que separa esse projeto de um chat bonitinho. O aluno acha que está só conversando sobre a viagem dele. Na verdade está sendo levado a praticar uma estrutura específica até dominar.

Passo 9: análise de áudio de verdade

Transcrever é o básico. Com a transcrição marcada no tempo, você consegue medir coisas que nem professor humano mede com precisão.

Crie um fluxo que, a partir do áudio e da transcrição, calcule e registre:

  • Palavras por minuto. Fluência tem número. Acompanhar a curva ao longo dos meses é o feedback mais motivador que existe.
  • Pausas longas. Silêncios acima de dois segundos no meio da frase indicam onde você trava. Se travar sempre antes de verbo no passado, achamos o problema.
  • Marcadores de hesitação. Quantidade de “ãhn”, “hmm” e repetições.
  • Palavras em português no meio. Sinal claro de lacuna de vocabulário, e uma lista perfeita para a revisão.
  • Divergência de pronúncia. Quando a transcrição devolve uma palavra diferente da que você quis dizer, quase sempre é pronúncia, não vocabulário. Registre o par: o que você quis dizer e o que a máquina entendeu.

Esse último item é ouro. Ele produz, automaticamente, a sua lista pessoal de palavras que ninguém entende quando você fala. Peça ao professor para trabalhar essa lista uma vez por semana.

Guarde tudo isso numa tabela de métricas por data. Um relatório mensal comparando os números é o tipo de coisa que mantém aluno estudando.

Passo 10: estudo em grupo

Essa é a parte que quase ninguém monta, e é onde o projeto fica realmente parecido com escola.

A Evolution permite que o número participe de grupos do WhatsApp. Coloque o professor num grupo com três a seis alunos de nível parecido e configure um fluxo separado, com regras próprias, porque conversa em grupo pede outro comportamento.

No prompt do grupo:

Você media um grupo de estudo de inglês. Regras:

1. Não responda toda mensagem. Responda quando alguém falar com você, quando houver silêncio de mais de dez minutos, ou quando um erro se repetir entre vários alunos.

2. Prefira devolver a pergunta ao grupo a responder você mesmo: “Ana, how would you say that?”

3. Corrija erros no grupo sem expor ninguém. Nunca cite quem errou. Diga que apareceu uma construção comum e mostre a forma correta.

4. Distribua a fala. Puxe quem está calado com uma pergunta fácil e direta.

5. Uma vez por dia, proponha uma dinâmica curta: um tema para todos comentarem, uma palavra para cada um usar numa frase, uma situação para dois alunos encenarem.

A regra 3 não é frescura, é o que faz as pessoas continuarem falando. Correção pública com nome é o jeito mais rápido de silenciar um grupo inteiro.

Funciona bem combinar: conversa individual para prática sem vergonha, grupo para pressão social saudável e constância. A vergonha inicial some no individual, e o compromisso com os colegas é o que traz a pessoa de volta no dia seguinte.

Passo 11: lição diária e revisão

Duplique o fluxo e troque o gatilho por um Schedule Trigger.

No prompt: “consulte a ficha do aluno, pegue os três erros mais recorrentes, as palavras da lista de pronúncia e o vocabulário da unidade atual. Monte um exercício de cinco frases usando exatamente esses pontos e mande no WhatsApp.”

Isso é revisão espaçada baseada nos erros reais da pessoa, e é o mecanismo que faz vocabulário fixar. Nenhum aplicativo de idioma faz isso com base nas suas conversas, porque nenhum deles tem as suas conversas.

Aqui, aliás, está a vantagem prática da Evolution: sem a janela de 24 horas da API oficial, você manda a lição às sete da manhã sem template aprovado nem burocracia.

Nível avançado: videochamada com professor virtual

Texto e áudio resolvem muita coisa, mas conversa por vídeo, com alguém olhando para você e respondendo em tempo real, é outro tipo de treino. Existe caminho para isso hoje, usando serviços externos.

A arquitetura, em três camadas:

Voz em tempo real. Já existem APIs de conversação por voz com latência baixa o suficiente para diálogo natural, sem aquele atraso constrangedor entre falar e ouvir.

Avatar em vídeo. Serviços de avatar conversacional geram um rosto que fala em tempo real, sincronizado com a resposta. É o que dá a sensação de estar diante de uma pessoa.

Infraestrutura de sala. Plataformas de comunicação em tempo real cuidam do transporte de áudio e vídeo, da sala e da conexão.

O n8n entra como orquestrador: ele agenda a sessão, entrega o contexto do aluno ao serviço de vídeo, recebe a gravação ao final e roda a mesma análise de fluência que você já montou no passo 9. Depois manda o resumo no WhatsApp.

Dois avisos honestos. Primeiro, é caro: cobrança por minuto de vídeo torna a conta bem diferente da conversa por texto. Segundo, é a parte mais instável do projeto, porque essas APIs mudam rápido. Monte isso por último, depois que o resto estiver rodando e você tiver certeza de que vai usar.

Quanto custa

Três linhas de custo:

Servidor. Uma VPS que aguenta a stack inteira fica na faixa de algumas dezenas de reais por mês.

Modelo de IA. Conversa de estudo com modelos da linha mini custa centavos por dia. Transcrição de áudio é cobrada por minuto e é barata. Geração de voz é o mais caro dos três.

Vídeo, se você chegar lá, é o item que domina a conta.

Sem vídeo, o conjunto costuma ficar em algumas dezenas de reais por mês para uso pessoal intenso. Contra R$ 900 de aula particular, a diferença fala por si. E o professor atende às seis da manhã e às onze da noite.

Os limites, com honestidade

Risco do número. Solução não oficial pode ter o número bloqueado. Use número dedicado, nunca o pessoal, e evite disparo em massa.

Pronúncia fina. A análise que descrevi pega padrão e divergência, e isso já é muito. Mas ritmo, entonação e aquele ajuste sutil que um professor experiente faz ouvindo você ainda são humanos.

Disciplina. Aula paga e marcada faz você aparecer. O bot não cobra nada de você, e é por isso que o grupo de estudo do passo 10 importa tanto: o compromisso com pessoas é o que sustenta a rotina.

O uso ideal é combinado: uma aula por semana com professor humano para correção de fundo, e o resto da semana com o tutor para ganhar quilometragem. Volume de prática é exatamente o que falta em quem estuda inglês há anos e continua travado.

O que você aprendeu construindo isso

Olhe o que tem dentro desse projeto: servidor próprio, API de mensagens, webhook, roteamento por tipo de mídia, transcrição, agente com memória, leitura e escrita em base de dados, progressão de estado, execução agendada, mediação em grupo e integração com serviços externos.

É a mesma arquitetura de um atendente de WhatsApp que consulta o sistema da empresa, de um assistente que responde a equipe com base nas planilhas internas ou de uma régua de cobrança que conversa com o cliente. Trocou o prompt e a fonte de dados, mudou a aplicação.

É por isso que eu gosto desse exercício como primeiro projeto: tem retorno imediato na sua vida e ensina exatamente a estrutura que resolve problema de empresa. Se você quer aprender isso com acompanhamento, em vez de descobrir sozinho no tentativa e erro, é o que fazemos nos cursos de IA da Dasckup, ao vivo e com casos reais.

Se o seu interesse é aplicar a mesma lógica na sua operação, escrevi sobre como escolher o primeiro processo a automatizar e sobre quando faz sentido usar agente em vez de automação simples. Para quem vai automatizar atendimento, vale ler também sobre automação de atendimento no WhatsApp.

Construa o professor primeiro. É pequeno, tem retorno na mesma semana e ensina tudo que você precisa para o próximo.

Sobre o autor

Miguel Dendasck é fundador e CEO da Dasckup, agência de marketing e tecnologia em Higienópolis, São Paulo, com mais de dez anos de atuação e mais de 180 clientes atendidos. Trabalha com automação e inteligência artificial aplicada a negócios, é autor do livro “A Empresa Autônoma” e criador do Método Dasckup. Também responde pela gestão da Revista Científica Multidisciplinar Núcleo do Conhecimento, ISSN 2448-0959.

Fale com Miguel Dendasck

Gostou? Então compartilhe!

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *