Ir para o conteúdo

Whisper

O que é

Whisper é um modelo de reconhecimento de fala desenvolvido pela OpenAI e disponibilizado gratuitamente como código aberto. Ele transcreve automaticamente áudio e vídeo para texto em mais de 90 idiomas, incluindo o português brasileiro, com alta precisão. Ao contrário de serviços como o Google Docs por voz, o Whisper pode ser instalado no próprio computador e funcionar completamente sem conexão à internet.

Para que serve

  • Transcrever gravações de entrevistas, depoimentos orais e registros sonoros
  • Converter gravações de áudio ou vídeo em texto editável
  • Transcrever materiais em português, inglês e dezenas de outros idiomas
  • Processar arquivos de áudio em lote (vários arquivos de uma vez)
  • Funcionar sem enviar dados a servidores externos, preservando a privacidade das fontes

Exemplo de uso

Um pesquisador realizou 30 entrevistas de história oral com trabalhadores da saúde pública. As entrevistas foram gravadas em MP3. Usando o Whisper instalado no próprio computador, ele transcreve automaticamente todos os arquivos em texto, que depois revisa manualmente. O processo leva horas em vez de semanas, e nenhum áudio é enviado a terceiros.

Quando pode não ser a melhor opção

  • Se você não tem familiaridade com terminal ou linha de comando: a instalação e o uso do Whisper exigem executar comandos de texto, o que pode ser intimidador sem experiência prévia. Existem interfaces gráficas de terceiros (como o Whisper Transcription para macOS ou o Const-me/Whisper para Windows) que facilitam o uso
  • Se o áudio for de falantes não nativos de inglês: Graham e Roll (2024) mediram a taxa de erro do modelo em inglês falado por pessoas de origens linguísticas variadas e registraram desempenho pior nesse grupo. Sobreposição de vozes, ruído de fundo intenso e sotaques muito regionais também derrubam a precisão. Em projetos com entrevistas multilíngues, conte com mais tempo de revisão
  • Se você precisar de uma solução imediata e simples sem instalação: serviços web como AssemblyAI ou Otter.ai são mais acessíveis, mas enviam os dados a servidores externos
  • O processamento pode ser lento em computadores antigos sem placa de vídeo dedicada

Tipo de acesso

Gratuito e de código aberto (licença MIT). Não há custo algum para uso. Requer instalação via Python (linguagem de programação) e um gerenciador de pacotes. Existem também versões otimizadas para uso local, como o whisper.cpp, que roda em computadores com hardware mais modesto.

Sistemas em que roda

Windows, macOS e Linux. Requer Python 3.8 ou superior instalado no computador. O processamento pode ser acelerado com placa de vídeo NVIDIA (GPU), mas funciona também apenas com o processador principal (CPU).

Integrações

  • Python (linguagem necessária para rodar o Whisper padrão)
  • ffmpeg (programa de linha de comando para processamento de áudio e vídeo, necessário para alguns formatos)
  • Interfaces gráficas de terceiros disponíveis para Windows e macOS

Alternativas

  • oTranscribe (transcrição manual assistida, gratuito, funciona no navegador)
  • AssemblyAI (transcrição automática via API, pago, sem necessidade de instalação)
  • Otter.ai (transcrição automática, freemium, foco em inglês)
  • whisper.cpp (versão do Whisper otimizada para rodar localmente com menor consumo de recursos)

Aprenda a usar

Onde encontrar

Material de apoio

O Whisper é um modelo, e o material que ensina a usá-lo vem em boa parte de fora da OpenAI. O guia da UFPel é o ponto de entrada mais direto para quem lê em português: foi produzido por um grupo de pesquisa brasileiro e percorre a tarefa inteira, da instalação à transcrição de um arquivo. A documentação oficial cobre o mesmo percurso em inglês, com o comando de transcrição e os modelos disponíveis.

Uso em pesquisa e ensino

O Whisper aparece na literatura acadêmica como objeto de avaliação e como ferramenta de trabalho em acervos. Graham e Roll mediram seu desempenho em falantes de inglês com sotaques diversos e traços variados de fala. As bibliotecas da Emory testaram o modelo sobre uma amostra de 250 horas de material audiovisual, com financiamento do Lyrasis Catalyst Fund, avaliando o desempenho por tipo de conteúdo, vocabulário técnico, variedade regional e qualidade de gravação.

Observações

Whisper foi lançado pela OpenAI em 2022 e rapidamente se tornou referência em transcrição automática de código aberto. O fato de rodar localmente é especialmente relevante para pesquisas que envolvem fontes sensíveis, como entrevistas com sujeitos vulneráveis ou documentos sigilosos: nenhum dado é enviado a servidores de terceiros. Para quem não tem conforto com linha de comando, recomenda-se buscar interfaces gráficas de terceiros ou pedir apoio técnico para a instalação inicial.

Casa de Oswaldo Cruz / Fiocruz · Anita Lucchesi e Daiane Silveira Rossi · Material de apoio ao curso Letramento Acadêmico em Inteligência Artificial · 2026

Capa: Silmara Mansur (Ascom/COC/Fiocruz)

Conteúdo sob CC BY-NC-SA 4.0 · Política de Acesso Aberto ao Conhecimento na Fiocruz · Licença