Teste sem conta

Transforme qualquer áudio em texto

Solte uma gravação e leve a transcrição com marcas de tempo, os falantes separados e um resumo. Você começa sem conta e sem instalar nada.

Arraste seu arquivo para cá

MP3, WAV, M4A, MP4, MOV… até 10 GB

  • Falantes separados e com nome, deduzido do que é dito
  • Marcas de tempo que levam ao áudio com um clique
  • Resumo com pontos principais, acordos e tarefas
  • MP3
  • WAV
  • M4A
  • AAC
  • OGG
  • FLAC
  • WMA
  • AIFF

O que esta ferramenta faz

Uma hora de áudio dá cerca de quatro horas de digitação manual. Aqui são uns três minutos, e o resultado não é um paredão de texto: vem dividido por falante, com marcas de tempo, dá para pesquisar dentro e corrigir no navegador.

No formato em que você gravou — MP3, WAV, M4A, AAC, OGG, FLAC — e até 10 GB por arquivo. O idioma é detectado sozinho, então não há nada para configurar se você não quiser.

O que aqui é levado em conta

  • Mais de 90 idiomas, detectados sozinhos. Você não precisa nos dizer qual é.
  • Separação de falantes que ainda dá nome a cada um a partir dos cumprimentos da gravação.
  • Pesquise dentro de todas as suas transcrições, não só desta.
  • Seus arquivos ficam em servidores da União Europeia e são apagados quando você mandar.

Como funciona

  1. 1

    Solte o áudio

    Ou escolha no computador. Até 10 GB, e quantos arquivos quiser de uma vez.

  2. 2

    Nós transcrevemos

    Cerca de 5 % da duração: uma reunião de uma hora fica pronta em uns três minutos.

  3. 3

    Leia, corrija e baixe

    Ajuste o que for preciso clicando em cima e baixe em DOCX, PDF, SRT, CSV ou JSON.

Para que se usa

Entrevistas

Pergunta e resposta separadas por voz, com o minuto para conferir a citação de novo.

Reuniões

O resumo traz acordos e tarefas, então ninguém precisa escrever a ata.

Podcasts

A transcrição vira as notas do episódio, o artigo e as legendas ao mesmo tempo.

Em detalhe

O que faz uma transcrição sair bem ou mal

Três coisas, e nenhuma é o sotaque. A primeira é a distância do microfone: um celular no centro de uma mesa capta muito mais ruído de sala do que o mesmo celular na frente de quem fala, e esse ruído é o que se traduz em palavras inventadas. A segunda é se as pessoas se atropelam: quando duas vozes soam ao mesmo tempo, nenhum sistema — nem uma pessoa — entende as duas.

A terceira é o vocabulário próprio. Nomes de empresas, sobrenomes e siglas do setor são o que mais falha, porque são justamente o que não aparece em lugar nenhum além da sua gravação. Resolvem-se em dois minutos com a correção do texto, e é aí que de verdade se ganha precisão, não trocando de provedor.

O que se pode fazer com o texto depois

Pesquisar dentro é a primeira coisa e a mais usada: encontrar em que minuto se falou de um assunto específico sem escutar nada de novo. Com as vozes separadas, dá para filtrar por quem fala, o que em uma entrevista de uma hora economiza metade do trabalho.

E depois há a parte de levar para fora daqui: um documento para compartilhar, um SRT para colocar embaixo do vídeo, uma planilha para analisar o tempo de fala de cada participante. Nada disso obriga a repetir a transcrição; exporta-se quantas vezes for preciso, no formato que for preciso.

Perguntas

E se o que você tem é o vídeo?

Envie-o e devolvemos a transcrição com marcas de tempo, os falantes separados e com nome, e um resumo com os pontos principais. Você começa sem conta.