Áudio & Voz

Whisper

O modelo de transcrição de voz da OpenAI que converte qualquer gravação em texto.

Modelo gratuitoNível intermediário8 min de leitura
* Análise independente e gratuita. Conteúdo educativo, não é patrocinado nem remunerado de forma alguma. Mostramos os pontos fortes e também as limitações — como um review honesto, para você decidir.
O que é

Um estenógrafo digital que entende português

O Whisper é um modelo de reconhecimento de voz criado pela OpenAI e disponibilizado gratuitamente como código aberto. Pense nele como um estenógrafo que nunca cansa: você entrega uma gravação — de audiência, reunião ou consulta — e ele devolve o texto completo, em português, sem precisar digitar uma única palavra. O arquivo de áudio entra, o texto sai. É isso.

Por que importa

Horas de gravação que deveriam virar texto ontem

Uma audiência trabalhista de 2 horas pode gerar mais de 30 páginas de transcrição se alguém precisar digitar tudo manualmente. Um perito que grava laudos por voz e depois precisa reescrever o mesmo conteúdo. Um gestor que sai da reunião sem saber o que ficou decidido porque ninguém conseguiu anotar tudo.

~4 min

É o tempo que o Whisper leva para transcrever 90 minutos de áudio de boa qualidade, em português. O modelo processa em velocidade superior ao tempo real — o que levaria horas de digitação fica pronto antes de você ir buscar o café.

5 maneiras de usar

Quem usa e para quê

01 Advogado(a)

Grava a audiência no celular, sobe o arquivo no Whisper e recebe a transcrição completa. Em vez de passar horas reconstituindo o que foi dito, começa direto a montar a peça — com o texto real da oitiva em mãos.

02 RH / Recrutamento

Transcreve entrevistas de emprego gravadas e gera um resumo por candidato. Elimina a necessidade de escrever durante a conversa e mantém o foco no entrevistado, não nas anotações.

03 Médico / Psicólogo

Dita o prontuário por voz durante ou após a consulta. O Whisper converte em texto estruturado, pronto para revisar e salvar. Sem ditafone, sem secretária, sem retrabalho.

04 Jornalista / Comunicador

Entrevista em campo com o celular. Volta para a redação com o arquivo de áudio e, em minutos, tem a transcrição pronta para virar reportagem — sem perder tempo com a tarefa mecânica de ouvir e digitar.

05 Gestor / Diretor

Grava reuniões e transcreve ao final. Usa o texto junto com o ChatGPT para extrair decisões, responsáveis e prazos. A ata que levava 1 hora a escrever fica pronta em 5 minutos.

Passo a passo

Do zero ao texto em menos de 10 minutos

O método abaixo usa o Google Colab — uma planilha de código no navegador, gratuita, sem instalar nada. Você não precisa saber programar: é só copiar e colar.

// interface conferida em junho de 2026 — se algo estiver diferente, procure pelo nome do botão na ajuda do Google Colab
  1. Acesse colab.research.google.com

    Faça login com qualquer conta Google. É gratuito.

  2. Clique em "+ Novo notebook"

    Uma célula de código vazia aparece na tela.

    pense nela como uma linha de instrução que você vai mandar para o computador
  3. Cole o comando de instalação e clique em "Executar" (o triângulo)

    Na célula, cole exatamente: !pip install openai-whisper — e clique no triângulo à esquerda. Aguarde a instalação (pode levar 1 a 2 minutos).

  4. Suba o seu arquivo de áudio

    No painel esquerdo, clique no ícone de pasta. Em seguida, arraste o arquivo de áudio (.mp3, .mp4, .wav, .m4a) para a área que aparecer. Aguarde o upload terminar.

    o arquivo some ao fechar o Colab — isso é normal; os resultados ficam salvos separadamente
  5. Crie uma nova célula e cole o comando de transcrição

    Clique em "+ Código" para criar outra célula. Cole o bloco abaixo, substituindo audiencia.mp3 pelo nome exato do seu arquivo:

    import whisper model = whisper.load_model("medium") result = model.transcribe("audiencia.mp3", language="pt") print(result["text"])
  6. Clique em "Executar" e aguarde

    O modelo carrega e transcreve. Para um áudio de 90 minutos, o processo leva cerca de 3 a 6 minutos. O texto completo aparece logo abaixo da célula.

    use o modelo "base" se quiser resultado mais rápido; use "large-v3" para máxima precisão em termos técnicos
Copie e use agora

Da transcrição bruta à ata jurídica

Depois de obter o texto do Whisper, cole este pedido no ChatGPT — junto com a transcrição:

prompt Aqui está a transcrição de uma audiência judicial: [cole o texto]. Crie uma ata formal com as seguintes seções: 1. Participantes (identifique por papel: juiz, advogado de defesa, advogado da parte contrária, testemunha) 2. Fatos incontroversos — pontos aceitos por ambas as partes 3. Pontos em conflito — divergências relevantes 4. Decisões tomadas — com prazo e responsável quando mencionado Use linguagem jurídica formal e organize em tópicos numerados.

Você recebe uma ata estruturada pronta para revisar, adaptar e assinar — sem reescrever tudo do zero.

O que poucos sabem

Dicas & limitações reais

Faça assim

  • Grave em ambiente silencioso e com o microfone perto da boca — o Whisper não filtra ruído de fundo; a qualidade do áudio define a qualidade da transcrição.
  • Use o modelo "medium" ou "large-v3" para áudios com terminologia técnica (jurídica, médica) — eles erram menos nos termos específicos.
  • Sempre revise o texto final antes de usar em documentos oficiais — nomes próprios, CPFs e siglas são os pontos com mais variação.

Limitações reais

  • O Whisper não identifica quem está falando: a transcrição sai como texto corrido, sem separar os participantes. Para isso, é preciso usar uma ferramenta adicional de diarização.
  • Pela API paga da OpenAI, o limite é de 25 MB por arquivo. Gravações longas precisam ser divididas antes do envio — caso contrário a requisição falha.
  • O modelo não transcreve em tempo real na versão de código aberto — ele precisa do arquivo de áudio completo para começar. Para legendagem ao vivo, existem ferramentas específicas.
Quer ver em vídeo?

Um tutorial completo em português

Whisper OpenAI: Guia Completo de Transcrição
Otávio Miranda

Whisper OpenAI: Guia Completo de Transcrição com Inteligência Artificial (vídeo e áudio)

Assistir no YouTube →

* Sugestão independente, escolhida pela qualidade do conteúdo. Não temos nenhuma relação nem patrocínio com o canal.

Desafio · 5 minutos

Transcreva 1 minuto de voz agora

Grave um áudio de 1 minuto no celular — pode ser você lendo qualquer parágrafo de um documento da sua área. Siga o passo a passo acima com o modelo "base" (mais rápido) e compare o texto gerado com o original.

Deu certo se mais de 90% das palavras estiverem corretas — incluindo os termos técnicos da sua área. Se não chegar lá, troque o modelo para "medium" e compare de novo.

Vale a pena?

O veredito sobre o Whisper

4,1

4,1 de 5

Aqui o 'grátis' é de verdade, sem asterisco de cota: o Whisper é código aberto (licença MIT), transcreve português com qualidade excelente e, rodando no seu computador, o áudio não sai da sua máquina — privacidade que nenhum serviço online dá. A pegadinha não é preço, é fricção: não existe site nem app oficial de 'arrastar o arquivo'. O caminho grátis passa por Google Colab ou linha de comando, uns 10 minutos de tutorial. E ele não separa quem falou (sai texto corrido) e às vezes 'alucina' em trechos de silêncio. Se você topa seguir um passo a passo, é imbatível em custo e privacidade. Se quer apertar um botão, veja o Fathom ou o Otter.

Testado e conferido em fontes oficiais em 2 de julho de 2026.

O que joga a favor

  • 100% gratuito e de código aberto (licença MIT): sem mensalidade, sem limite de minutos, sem marca-d'água — raro em ferramentas de IA úteis de verdade
  • Português excelente: o modelo cobre ~100 idiomas e o português está entre os de melhor desempenho, inclusive com sotaques regionais e termos do dia a dia
  • Privacidade real quando roda no seu computador: o áudio da audiência ou da consulta não sai da sua máquina — nenhum serviço de nuvem vê o conteúdo
  • Mesmo a via paga é barata: pela API da OpenAI, 1 hora de áudio custa ~US$ 0,36 (whisper-1 ou gpt-4o-transcribe, US$ 0,006/min)

Onde ele complica

  • Não existe app nem site oficial de 'aperte o botão': o caminho gratuito passa por Google Colab ou linha de comando — barreira real pra quem nunca copiou um comando na vida
  • Não separa quem está falando: a transcrição sai como texto corrido, sem 'Juiz:', 'Testemunha:' — pra isso é preciso ferramenta extra (a própria OpenAI só oferece diarização no modelo pago gpt-4o-transcribe-diarize, via API)
  • Pode 'alucinar': em trechos de silêncio, música ou áudio ruim, o Whisper às vezes inventa frases que ninguém disse — problema documentado publicamente; revisar é obrigatório antes de usar em documento oficial
  • Não transcreve ao vivo na versão gratuita: precisa do arquivo de áudio completo antes de começar (tempo real só pela API paga, gpt-realtime-whisper)
É pra você?

Pra quem o Whisper faz sentido

Vale muito se você…

  • Advogados, jornalistas, pesquisadores e estudantes que acumulam horas de gravação por mês e não querem (ou não podem) pagar assinatura — o custo zero compensa a curva de aprendizado
  • Quem lida com áudio sigiloso (audiências, entrevistas confidenciais, consultas médicas ou psicológicas) e precisa que o arquivo não saia da própria máquina — rodando local, é a opção mais privada do mercado
  • Quem topa seguir um tutorial de copiar e colar (o passo a passo no Colab leva ~10 minutos) ou tem alguém 'de TI' por perto pra montar uma vez e usar sempre

Procure outra se você…

  • Quem quer apertar um botão no celular e receber a ata pronta com o nome de quem falou — ferramentas prontas como Fathom ou Otter.ai fazem isso sem nenhum código
  • Quem precisa de legenda ou transcrição ao vivo durante a reunião — a versão gratuita só funciona com o arquivo já gravado
  • Quem transcreve raramente (um áudio por mês): a fricção do Colab não compensa; um app pronto ou o próprio ditado do celular resolve
Grátis de verdade (e a via paga)

Quanto custa usar o Whisper

Rodando você mesmo, é R$ 0 e sem limite de minutos — é código aberto. Se não quiser mexer em Colab, a API da OpenAI faz por um preço baixíssimo, por minuto, em dólar.

Código aberto

R$ 0 — rode no seu PC ou no Google Colab, sem mensalidade e sem limite de minutos (licença MIT). Precisa seguir um tutorial.

API whisper-1

US$ 0,006/min (~US$ 0,36 por hora) — transcreve sem instalar nada, pela API oficial. Em dólar.

API gpt-4o-mini-transcribe

US$ 0,003/min — versão econômica, boa pra grande volume. Em dólar.

Detalhe técnico: pela API, o limite é 25 MB por arquivo — áudio longo precisa ser fatiado. Preços da OpenAI em dólar, julho de 2026.

Perguntas comuns

As dúvidas mais frequentes sobre o Whisper

O Whisper é grátis mesmo? Onde está a pegadinha?

É grátis de verdade: código aberto (licença MIT), sem mensalidade e sem limite de minutos. A 'pegadinha' não é preço, é fricção — não existe site oficial de arrastar o arquivo; você roda no Google Colab (gratuito) ou instala no PC. A API da OpenAI, opcional, custa US$ 0,006 por minuto.

Precisa de cartão de crédito?

Não. Pelo caminho gratuito (Colab ou seu computador) basta uma conta Google. Cartão só entra se você escolher usar a API paga da OpenAI.

Funciona bem em português?

Sim, muito bem — o Whisper cobre ~100 idiomas e o português está entre os de melhor desempenho. Dica: no comando, fixe o idioma com language='pt' pra evitar que ele confunda com espanhol em trechos ruidosos.

Funciona no celular?

Não existe app oficial do Whisper. Dá pra abrir o Colab no navegador do celular, mas é desajeitado. Se a sua rotina é 100% celular, uma ferramenta pronta (Fathom, Otter.ai) ou o ditado nativo do aparelho atende melhor.

Ele identifica quem está falando na gravação?

Não — na versão gratuita o texto sai corrido, sem separar juiz, advogado e testemunha. Quem precisa disso deve usar uma ferramenta de diarização à parte, o modelo pago da OpenAI na API (gpt-4o-transcribe-diarize) ou apps prontos como Fathom.

Meu áudio fica seguro? Posso transcrever uma audiência sigilosa?

Depende de onde você roda: no seu próprio computador, o áudio não sai da máquina (cenário mais privado que existe). No Colab, o arquivo sobe pra um servidor do Google; pela API, vai pra OpenAI. Pra material realmente sigiloso, rode localmente.

Quanto custa transcrever 1 hora de áudio?

De graça, se você rodar no Colab ou no seu PC. Pela API da OpenAI, 60 minutos × US$ 0,006 = US$ 0,36 — cobrado em dólar, então o valor em reais depende do câmbio e dos impostos do seu cartão.

Se quer apertar um botão

Alternativas mais fáceis (sem Colab)

Fathom

Ganha sempre que o áudio é uma reunião online: entra sozinho no Zoom/Meet/Teams, grava, transcreve e resume com falantes separados, com plano grátis generoso — zero código, zero Colab

Ver a aula →

Otter.ai

Ganha quando você quer um app pronto que grava e transcreve em tempo real com separação de falantes e resumo automático — mas atenção: o suporte a português é limitado, o forte dela é inglês/espanhol

Ver a aula →

ElevenLabs

Ganha quando você quer transcrever pelo navegador, sem código, com identificação de quem fala (o Scribe deles tem interface pronta e diarização) — e também no caminho inverso, texto virando voz

Ver a aula →

ChatGPT

Ganha na etapa seguinte: é onde a transcrição bruta do Whisper vira ata, resumo ou peça formatada — e pra ditados curtos por voz no celular, o app dele é muito mais prático que montar um Colab

Ver a aula →

Todo dia, uma ferramenta nova explicada.

Receber no WhatsApp