必要なのは音声だけ
事前の変換は一切不要です。ファイルはそのままアップロードされ、中の音声トラックが読み取られます。映像には触れず、どのモデルにも送られません。文字起こしには何の役にも立たず、処理が遅くなって高くつくだけだからです。
これは日常的に届くあらゆるコンテナに当てはまります。スマホのMP4、iPhoneのMOV、画面録画のMKV、ダウンロードした会議のWEBM。音声があれば文字起こしできます。なければ、利用枠を1分も使う前にお知らせします。
動画はそのままアップロードしてください。音声はこちらで取り出して文字起こしし、タイムスタンプと話者付きのテキストをお返しします。
事前に音声を抽出する必要はありません。MP4、MOV、MKVをそのままドロップすれば、音声トラックはこちら側で取り出します。動画が再エンコードされたり、別の場所に再アップロードされたりすることもありません。
これは見た目以上に大切なことです。2時間の録音を事前にMP3へ変換すると、30分もかかるうえ、不要な音質劣化まで起きます。多くの人が諦めてしまうのが、まさにこの手順です。
一般的なコンテナ形式なら10 GBまで。送られるのは音声だけで、映像はそのまま手元に残ります。
声が複数ある場合は話者を分け、各行に時刻を付けます。
読むならDOCXかPDF、動画に付けるならSRTかVTTです。
テキストがそのままノートになり、検索用の索引になり、アクセシブルな版にもなります。
Zoom、Meet、TeamsはMP4で出力されます。出てきたままドロップしてください。
同じ処理で字幕も出来上がります。ほとんどの人は音を消して見ています。
事前の変換は一切不要です。ファイルはそのままアップロードされ、中の音声トラックが読み取られます。映像には触れず、どのモデルにも送られません。文字起こしには何の役にも立たず、処理が遅くなって高くつくだけだからです。
これは日常的に届くあらゆるコンテナに当てはまります。スマホのMP4、iPhoneのMOV、画面録画のMKV、ダウンロードした会議のWEBM。音声があれば文字起こしできます。なければ、利用枠を1分も使う前にお知らせします。
文字起こしは、読むための連続したテキストです。段落があり、誰が話しているかが分かり、ご希望なら上に要約も付きます。字幕は、同じテキストを、画面に表示される時間に収まる2行の塊に分けたもので、それぞれに開始と終了のタイムコードがあります。
ここで得られるのは前者で、後者は同じ画面から、文字起こしし直すことなくSRTやVTTでダウンロードできます。始める前に、どちらが必要かを知っておくと便利です。記事やメモなら文字起こし、動画の下に付けるなら字幕です。
アップロードするだけで、タイムスタンプ付きの文字起こし、名前付きで分けられた話者、要点をまとめた要約をお返しします。アカウントなしで始められます。