Aula particular de inglês em São Paulo custa entre R$ 80 e R$ 150 a hora. Duas por semana dão perto de R$ 900 por mês, e ainda assim você fala inglês por duas horas e passa as outras cento e sessenta e seis sem praticar.
Dá para montar um professor que vive no seu WhatsApp. Conversa a qualquer hora, corrige do jeito certo, lembra do que você errou na semana passada, segue uma trilha de estudo de verdade, analisa a sua pronúncia pelo áudio e até puxa você para dinâmicas em grupo com outros alunos.
Leva uma tarde para construir e alguns reais por mês para rodar. Vou do servidor até os recursos avançados, na ordem.
Ferramentas: uma VPS, Docker, n8n, uma conta de IA com créditos e o WhatsApp. Nenhuma linha de código.
Existem dois caminhos para colocar automação no WhatsApp, e a escolha muda tudo. Vou ser direto sobre os dois.
Caminho 1: API oficial da Meta. É a Cloud API. Você registra um número comercial, passa pela verificação e paga por conversa iniciada. Risco de bloqueio: zero. O problema é a regra da janela de 24 horas: fora dela, você só consegue iniciar conversa com modelo de mensagem previamente aprovado pela Meta. Isso atrapalha justamente a lição diária espontânea.
Caminho 2: Evolution API. É uma solução open source que expõe o WhatsApp como API REST, rodando no seu servidor e conectando pelo QR Code, como o WhatsApp Web. Sem custo por mensagem, sem janela de 24 horas e sem aprovação de template. Em compensação, não é oficial, e existe risco real de bloqueio do número se o comportamento parecer robótico em volume.
Para uso pessoal e estudo, com um número dedicado e volume de conversa humana, a Evolution é o caminho prático, e é o que vou detalhar. Para uso comercial com centenas de contatos, vá de API oficial. Não use o seu número pessoal em nenhum dos dois casos.
Você precisa de uma VPS modesta, algo com 2 vCPU e 4 GB de RAM já roda folgado, em Ubuntu, com Docker e Docker Compose instalados.
A stack tem três peças: a Evolution API, um PostgreSQL para o histórico e um Redis para cache. Crie uma pasta e dentro dela um arquivo docker-compose.yml definindo esses três serviços, mais o n8n se quiser tudo no mesmo lugar.
As variáveis de ambiente que realmente importam na Evolution:
AUTHENTICATION_API_KEY: a senha da sua API. Troque por algo longo e aleatório, nunca deixe o valor de exemplo.SERVER_URL: a URL pública onde a API vai responder.DATABASE_PROVIDER e DATABASE_CONNECTION_URI: apontando para o Postgres.CACHE_REDIS_ENABLED e a URI do Redis.TZ: America/Sao_Paulo, para os agendamentos baterem com o seu horário.Suba tudo com docker compose up -d. Coloque um proxy reverso na frente com HTTPS, porque webhook sem certificado é problema na certa.
Acesse o gerenciador da Evolution no endereço da sua API, com a chave que você definiu. Crie uma instância, dê um nome, e ela vai gerar um QR Code.
Abra o WhatsApp do número dedicado, vá em dispositivos conectados e escaneie. Pronto: a partir daqui, toda mensagem que chegar nesse número passa pela sua API.
Antes de automatizar, use esse número normalmente por alguns dias, conversando com pessoas reais. Número novo que nasce disparando mensagem automática é o perfil clássico que leva bloqueio.
No n8n, crie um workflow com um nó Webhook e copie a URL dele.
Na Evolution, configure o webhook da instância apontando para essa URL, marcando o evento de mensagem recebida. Mande uma mensagem de teste para o número e veja o corpo chegar no n8n. É nesse corpo que estão o número do remetente, o tipo de mensagem e o conteúdo.
Existe também um nó comunitário da Evolution para o n8n, que facilita o envio. Vale instalar, mas o envio por requisição HTTP direta funciona igual e depende menos de terceiros.
Adicione um nó Switch com três saídas, lendo o tipo da mensagem que veio no webhook.
Texto segue direto. Áudio vai para a transcrição. Imagem vai para um caminho de leitura visual, que serve para quando o aluno fotografa um exercício do caderno ou um trecho de livro e pergunta sobre aquilo.
Depois dos três caminhos, use um nó Edit Fields para padronizar tudo em um campo só, algo como mensagem_aluno. Assim o resto do fluxo não precisa saber de onde veio.
No caminho do áudio, baixe o arquivo da mídia pela Evolution e passe para um nó de transcrição.
Peça a transcrição com marcação de tempo, não só o texto puro. Parece detalhe, mas é o que vai permitir a análise de fluência mais adiante. Texto sem tempo só diz o que você falou; texto com tempo diz como você falou.
Adicione o nó AI Agent e conecte nele um modelo de chat e uma memória.
Na chave de sessão da memória, use o número do remetente. É isso que amarra a conversa a cada aluno e faz o professor lembrar de ontem. Se você pretende ter mais de um aluno, use memória persistente em banco, e não a memória simples em, porque ela se perde quando o fluxo reinicia.
Aqui está o coração do projeto. A diferença entre um tutor que você usa todo dia e um que você abandona na terça-feira não é o modelo, é a instrução.
Você é um professor particular de inglês conversando por WhatsApp. O aluno é brasileiro. Consulte a ficha dele antes de responder.
Conversa:
1. Fale em inglês num nível ligeiramente acima do nível do aluno, nunca muito acima.
2. Escreva como se escreve no WhatsApp: três a cinco frases, tom leve, sem parecer livro didático.
3. Termine sempre com uma pergunta, para a conversa continuar.
4. Não interrompa a conversa para corrigir. Responda ao conteúdo primeiro. No final, acrescente um bloco curto “Correction” com no máximo dois erros, o certo e o motivo em português, uma linha cada.
5. Corrija só o que atrapalha a comunicação ou o que o aluno já repetiu antes. Ignore deslizes pequenos.
6. Se o aluno escrever em português, responda em inglês simples e convide ele a tentar de novo.
7. Registre na ficha todo erro repetido e toda palavra nova.
8. Puxe o assunto do objetivo do aluno. Se ele estuda para entrevista, leve a conversa para trabalho, carreira e experiência.
As regras 2, 4 e 5 são as que salvam o projeto. Sem elas o modelo vira um corretor cansativo que devolve parágrafos, e ninguém aguenta isso por mais de três dias.
Conversar todo dia ajuda, mas sozinho não leva ninguém de A2 para B2. O que faz progredir é currículo: uma sequência com começo, meio e avaliação.
Monte uma tabela de trilha com estas colunas: nivel, unidade, tema, estrutura_alvo, vocabulario_alvo e criterio_de_aprovacao.
Um exemplo de recorte para B1, só para você ver o formato: unidade 1, tema viagem e aeroporto, estrutura alvo passado simples contra presente perfeito, vocabulário alvo trinta termos, critério de aprovação usar a estrutura corretamente em oito de dez tentativas espontâneas.
Agora a ficha do aluno ganha as colunas unidade_atual, acertos_na_estrutura e tentativas_na_estrutura.
No prompt, acrescente: “puxe a conversa naturalmente para a estrutura alvo da unidade atual, sem anunciar que está fazendo isso. A cada uso espontâneo da estrutura pelo aluno, registre acerto ou erro. Quando o critério de aprovação for atingido, avise o aluno que ele passou de unidade e comece a próxima.”
Esse é o detalhe que separa esse projeto de um chat bonitinho. O aluno acha que está só conversando sobre a viagem dele. Na verdade está sendo levado a praticar uma estrutura específica até dominar.
Transcrever é o básico. Com a transcrição marcada no tempo, você consegue medir coisas que nem professor humano mede com precisão.
Crie um fluxo que, a partir do áudio e da transcrição, calcule e registre:
Esse último item é ouro. Ele produz, automaticamente, a sua lista pessoal de palavras que ninguém entende quando você fala. Peça ao professor para trabalhar essa lista uma vez por semana.
Guarde tudo isso numa tabela de métricas por data. Um relatório mensal comparando os números é o tipo de coisa que mantém aluno estudando.
Essa é a parte que quase ninguém monta, e é onde o projeto fica realmente parecido com escola.
A Evolution permite que o número participe de grupos do WhatsApp. Coloque o professor num grupo com três a seis alunos de nível parecido e configure um fluxo separado, com regras próprias, porque conversa em grupo pede outro comportamento.
No prompt do grupo:
Você media um grupo de estudo de inglês. Regras:
1. Não responda toda mensagem. Responda quando alguém falar com você, quando houver silêncio de mais de dez minutos, ou quando um erro se repetir entre vários alunos.
2. Prefira devolver a pergunta ao grupo a responder você mesmo: “Ana, how would you say that?”
3. Corrija erros no grupo sem expor ninguém. Nunca cite quem errou. Diga que apareceu uma construção comum e mostre a forma correta.
4. Distribua a fala. Puxe quem está calado com uma pergunta fácil e direta.
5. Uma vez por dia, proponha uma dinâmica curta: um tema para todos comentarem, uma palavra para cada um usar numa frase, uma situação para dois alunos encenarem.
A regra 3 não é frescura, é o que faz as pessoas continuarem falando. Correção pública com nome é o jeito mais rápido de silenciar um grupo inteiro.
Funciona bem combinar: conversa individual para prática sem vergonha, grupo para pressão social saudável e constância. A vergonha inicial some no individual, e o compromisso com os colegas é o que traz a pessoa de volta no dia seguinte.
Duplique o fluxo e troque o gatilho por um Schedule Trigger.
No prompt: “consulte a ficha do aluno, pegue os três erros mais recorrentes, as palavras da lista de pronúncia e o vocabulário da unidade atual. Monte um exercício de cinco frases usando exatamente esses pontos e mande no WhatsApp.”
Isso é revisão espaçada baseada nos erros reais da pessoa, e é o mecanismo que faz vocabulário fixar. Nenhum aplicativo de idioma faz isso com base nas suas conversas, porque nenhum deles tem as suas conversas.
Aqui, aliás, está a vantagem prática da Evolution: sem a janela de 24 horas da API oficial, você manda a lição às sete da manhã sem template aprovado nem burocracia.
Texto e áudio resolvem muita coisa, mas conversa por vídeo, com alguém olhando para você e respondendo em tempo real, é outro tipo de treino. Existe caminho para isso hoje, usando serviços externos.
A arquitetura, em três camadas:
Voz em tempo real. Já existem APIs de conversação por voz com latência baixa o suficiente para diálogo natural, sem aquele atraso constrangedor entre falar e ouvir.
Avatar em vídeo. Serviços de avatar conversacional geram um rosto que fala em tempo real, sincronizado com a resposta. É o que dá a sensação de estar diante de uma pessoa.
Infraestrutura de sala. Plataformas de comunicação em tempo real cuidam do transporte de áudio e vídeo, da sala e da conexão.
O n8n entra como orquestrador: ele agenda a sessão, entrega o contexto do aluno ao serviço de vídeo, recebe a gravação ao final e roda a mesma análise de fluência que você já montou no passo 9. Depois manda o resumo no WhatsApp.
Dois avisos honestos. Primeiro, é caro: cobrança por minuto de vídeo torna a conta bem diferente da conversa por texto. Segundo, é a parte mais instável do projeto, porque essas APIs mudam rápido. Monte isso por último, depois que o resto estiver rodando e você tiver certeza de que vai usar.
Três linhas de custo:
Servidor. Uma VPS que aguenta a stack inteira fica na faixa de algumas dezenas de reais por mês.
Modelo de IA. Conversa de estudo com modelos da linha mini custa centavos por dia. Transcrição de áudio é cobrada por minuto e é barata. Geração de voz é o mais caro dos três.
Vídeo, se você chegar lá, é o item que domina a conta.
Sem vídeo, o conjunto costuma ficar em algumas dezenas de reais por mês para uso pessoal intenso. Contra R$ 900 de aula particular, a diferença fala por si. E o professor atende às seis da manhã e às onze da noite.
Risco do número. Solução não oficial pode ter o número bloqueado. Use número dedicado, nunca o pessoal, e evite disparo em massa.
Pronúncia fina. A análise que descrevi pega padrão e divergência, e isso já é muito. Mas ritmo, entonação e aquele ajuste sutil que um professor experiente faz ouvindo você ainda são humanos.
Disciplina. Aula paga e marcada faz você aparecer. O bot não cobra nada de você, e é por isso que o grupo de estudo do passo 10 importa tanto: o compromisso com pessoas é o que sustenta a rotina.
O uso ideal é combinado: uma aula por semana com professor humano para correção de fundo, e o resto da semana com o tutor para ganhar quilometragem. Volume de prática é exatamente o que falta em quem estuda inglês há anos e continua travado.
Olhe o que tem dentro desse projeto: servidor próprio, API de mensagens, webhook, roteamento por tipo de mídia, transcrição, agente com memória, leitura e escrita em base de dados, progressão de estado, execução agendada, mediação em grupo e integração com serviços externos.
É a mesma arquitetura de um atendente de WhatsApp que consulta o sistema da empresa, de um assistente que responde a equipe com base nas planilhas internas ou de uma régua de cobrança que conversa com o cliente. Trocou o prompt e a fonte de dados, mudou a aplicação.
É por isso que eu gosto desse exercício como primeiro projeto: tem retorno imediato na sua vida e ensina exatamente a estrutura que resolve problema de empresa. Se você quer aprender isso com acompanhamento, em vez de descobrir sozinho no tentativa e erro, é o que fazemos nos cursos de IA da Dasckup, ao vivo e com casos reais.
Se o seu interesse é aplicar a mesma lógica na sua operação, escrevi sobre como escolher o primeiro processo a automatizar e sobre quando faz sentido usar agente em vez de automação simples. Para quem vai automatizar atendimento, vale ler também sobre automação de atendimento no WhatsApp.
Construa o professor primeiro. É pequeno, tem retorno na mesma semana e ensina tudo que você precisa para o próximo.
Sobre o autor
Miguel Dendasck é fundador e CEO da Dasckup, agência de marketing e tecnologia em Higienópolis, São Paulo, com mais de dez anos de atuação e mais de 180 clientes atendidos. Trabalha com automação e inteligência artificial aplicada a negócios, é autor do livro “A Empresa Autônoma” e criador do Método Dasckup. Também responde pela gestão da Revista Científica Multidisciplinar Núcleo do Conhecimento, ISSN 2448-0959.
São José dos Campos concentra perto de 100 mil empresas com registro ativo, cerca de…
Existe um momento na vida de toda empresa em que o dono percebe que a…
Pergunte a qualquer engenheiro de obra qual é o maior problema dele hoje e a…
O Sebrae divulgou em agosto de 2026 a pesquisa "Transformação Digital nos Pequenos Negócios", feita…
"Agente de IA" é o termo do momento. Toda proposta comercial que chega na sua…
Quando eu apresento um projeto de automação para uma empresa de porte médio ou grande,…