O modelo de transcrição de voz da OpenAI que converte qualquer gravação em texto.
Por Thiago Lourenço Martins
O Whisper é um modelo de reconhecimento de voz criado pela OpenAI e disponibilizado gratuitamente como código aberto. Pense nele como um estenógrafo que nunca cansa: você entrega uma gravação — de audiência, reunião ou consulta — e ele devolve o texto completo, em português, sem precisar digitar uma única palavra. O arquivo de áudio entra, o texto sai. É isso.
Uma audiência trabalhista de 2 horas pode gerar mais de 30 páginas de transcrição se alguém precisar digitar tudo manualmente. Um perito que grava laudos por voz e depois precisa reescrever o mesmo conteúdo. Um gestor que sai da reunião sem saber o que ficou decidido porque ninguém conseguiu anotar tudo.
É o tempo que o Whisper leva para transcrever 90 minutos de áudio de boa qualidade, em português. O modelo processa em velocidade superior ao tempo real — o que levaria horas de digitação fica pronto antes de você ir buscar o café.
Grava a audiência no celular, sobe o arquivo no Whisper e recebe a transcrição completa. Em vez de passar horas reconstituindo o que foi dito, começa direto a montar a peça — com o texto real da oitiva em mãos.
Transcreve entrevistas de emprego gravadas e gera um resumo por candidato. Elimina a necessidade de escrever durante a conversa e mantém o foco no entrevistado, não nas anotações.
Dita o prontuário por voz durante ou após a consulta. O Whisper converte em texto estruturado, pronto para revisar e salvar. Sem ditafone, sem secretária, sem retrabalho.
Entrevista em campo com o celular. Volta para a redação com o arquivo de áudio e, em minutos, tem a transcrição pronta para virar reportagem — sem perder tempo com a tarefa mecânica de ouvir e digitar.
Grava reuniões e transcreve ao final. Usa o texto junto com o ChatGPT para extrair decisões, responsáveis e prazos. A ata que levava 1 hora a escrever fica pronta em 5 minutos.
O método abaixo usa o Google Colab — uma planilha de código no navegador, gratuita, sem instalar nada. Você não precisa saber programar: é só copiar e colar.
Faça login com qualquer conta Google. É gratuito.
Uma célula de código vazia aparece na tela.
pense nela como uma linha de instrução que você vai mandar para o computadorNa célula, cole exatamente: !pip install openai-whisper — e clique no triângulo à esquerda. Aguarde a instalação (pode levar 1 a 2 minutos).
No painel esquerdo, clique no ícone de pasta. Em seguida, arraste o arquivo de áudio (.mp3, .mp4, .wav, .m4a) para a área que aparecer. Aguarde o upload terminar.
o arquivo some ao fechar o Colab — isso é normal; os resultados ficam salvos separadamenteClique em "+ Código" para criar outra célula. Cole o bloco abaixo, substituindo audiencia.mp3 pelo nome exato do seu arquivo:
import whisper
model = whisper.load_model("medium")
result = model.transcribe("audiencia.mp3", language="pt")
print(result["text"])O modelo carrega e transcreve. Para um áudio de 90 minutos, o processo leva cerca de 3 a 6 minutos. O texto completo aparece logo abaixo da célula.
use o modelo "base" se quiser resultado mais rápido; use "large-v3" para máxima precisão em termos técnicosDepois de obter o texto do Whisper, cole este pedido no ChatGPT — junto com a transcrição:
Aqui está a transcrição de uma audiência judicial: [cole o texto].
Crie uma ata formal com as seguintes seções:
1. Participantes (identifique por papel: juiz, advogado de defesa, advogado da parte contrária, testemunha)
2. Fatos incontroversos — pontos aceitos por ambas as partes
3. Pontos em conflito — divergências relevantes
4. Decisões tomadas — com prazo e responsável quando mencionado
Use linguagem jurídica formal e organize em tópicos numerados.
Você recebe uma ata estruturada pronta para revisar, adaptar e assinar — sem reescrever tudo do zero.
* Sugestão independente, escolhida pela qualidade do conteúdo. Não temos nenhuma relação nem patrocínio com o canal.
Grave um áudio de 1 minuto no celular — pode ser você lendo qualquer parágrafo de um documento da sua área. Siga o passo a passo acima com o modelo "base" (mais rápido) e compare o texto gerado com o original.
Deu certo se mais de 90% das palavras estiverem corretas — incluindo os termos técnicos da sua área. Se não chegar lá, troque o modelo para "medium" e compare de novo.
4,1 de 5
Aqui o 'grátis' é de verdade, sem asterisco de cota: o Whisper é código aberto (licença MIT), transcreve português com qualidade excelente e, rodando no seu computador, o áudio não sai da sua máquina — privacidade que nenhum serviço online dá. A pegadinha não é preço, é fricção: não existe site nem app oficial de 'arrastar o arquivo'. O caminho grátis passa por Google Colab ou linha de comando, uns 10 minutos de tutorial. E ele não separa quem falou (sai texto corrido) e às vezes 'alucina' em trechos de silêncio. Se você topa seguir um passo a passo, é imbatível em custo e privacidade. Se quer apertar um botão, veja o Fathom ou o Otter.
Testado e conferido em fontes oficiais em 2 de julho de 2026.
Rodando você mesmo, é R$ 0 e sem limite de minutos — é código aberto. Se não quiser mexer em Colab, a API da OpenAI faz por um preço baixíssimo, por minuto, em dólar.
R$ 0 — rode no seu PC ou no Google Colab, sem mensalidade e sem limite de minutos (licença MIT). Precisa seguir um tutorial.
US$ 0,006/min (~US$ 0,36 por hora) — transcreve sem instalar nada, pela API oficial. Em dólar.
US$ 0,003/min — versão econômica, boa pra grande volume. Em dólar.
Detalhe técnico: pela API, o limite é 25 MB por arquivo — áudio longo precisa ser fatiado. Preços da OpenAI em dólar, julho de 2026.
É grátis de verdade: código aberto (licença MIT), sem mensalidade e sem limite de minutos. A 'pegadinha' não é preço, é fricção — não existe site oficial de arrastar o arquivo; você roda no Google Colab (gratuito) ou instala no PC. A API da OpenAI, opcional, custa US$ 0,006 por minuto.
Não. Pelo caminho gratuito (Colab ou seu computador) basta uma conta Google. Cartão só entra se você escolher usar a API paga da OpenAI.
Sim, muito bem — o Whisper cobre ~100 idiomas e o português está entre os de melhor desempenho. Dica: no comando, fixe o idioma com language='pt' pra evitar que ele confunda com espanhol em trechos ruidosos.
Não existe app oficial do Whisper. Dá pra abrir o Colab no navegador do celular, mas é desajeitado. Se a sua rotina é 100% celular, uma ferramenta pronta (Fathom, Otter.ai) ou o ditado nativo do aparelho atende melhor.
Não — na versão gratuita o texto sai corrido, sem separar juiz, advogado e testemunha. Quem precisa disso deve usar uma ferramenta de diarização à parte, o modelo pago da OpenAI na API (gpt-4o-transcribe-diarize) ou apps prontos como Fathom.
Depende de onde você roda: no seu próprio computador, o áudio não sai da máquina (cenário mais privado que existe). No Colab, o arquivo sobe pra um servidor do Google; pela API, vai pra OpenAI. Pra material realmente sigiloso, rode localmente.
De graça, se você rodar no Colab ou no seu PC. Pela API da OpenAI, 60 minutos × US$ 0,006 = US$ 0,36 — cobrado em dólar, então o valor em reais depende do câmbio e dos impostos do seu cartão.
Ganha sempre que o áudio é uma reunião online: entra sozinho no Zoom/Meet/Teams, grava, transcreve e resume com falantes separados, com plano grátis generoso — zero código, zero Colab
Ganha quando você quer um app pronto que grava e transcreve em tempo real com separação de falantes e resumo automático — mas atenção: o suporte a português é limitado, o forte dela é inglês/espanhol
Ganha quando você quer transcrever pelo navegador, sem código, com identificação de quem fala (o Scribe deles tem interface pronta e diarização) — e também no caminho inverso, texto virando voz
Ganha na etapa seguinte: é onde a transcrição bruta do Whisper vira ata, resumo ou peça formatada — e pra ditados curtos por voz no celular, o app dele é muito mais prático que montar um Colab
Todo dia, uma ferramenta nova explicada.
Receber no WhatsApp