動画
字幕
Whisper はここ、あなたのブラウザーの中で動き、動画自身の音声から字幕を書き起こします。何もアップロードされず、アカウントも要りません。
どんな動画にも、どこにもアップロードせずに字幕を。
OpenSubs は音声を文字起こしし、翻訳し、スタイルを付け、映像に焼き込みます — すべてあなたのブラウザーの中で。動画ファイルが手元の機械から出ることはありません。出ていく先が無いからです。
アカウント不要。アップロードなし。透かしなし。オープンソース。
既存の字幕ファイルを探していますか?字幕がどこにあるかを見る。
Whisper はここ、あなたのブラウザーの中で動き、動画自身の音声から字幕を書き起こします。何もアップロードされず、アカウントも要りません。
上の4つの手順を、もう少し詳しく。明示的に別を選ばないかぎり、そのどれもがあなた自身の機械で動きます。
Whisper はあなたのブラウザーで、GPU があれば GPU で動きます。40 MB から 250 MB のあいだでモデルを選んでください。一度だけダウンロードされ、以後はキャッシュされます。取得されるのはモデルだけ — 音声はそのままです。
Chrome の組み込み翻訳は端末上で無料で動きます。長い会話でより良い結果が欲しければ、ご自分の Claude・OpenAI・DeepL のキーを使うか、こちらのものをクレジットで使ってください。字幕翻訳の仕組み
12 のプリセット。すっきりした放送用字幕から、目を引くソーシャル向けまで、どれもご自身の映像の上でプレビューできます。話すのに合わせて文字を大きくしたり光らせたりもできます。
字幕が画素に入った完成版の MP4 を、WebCodecs でブラウザ内エンコードして書き出せます。あるいは .srt・.vtt・.ass を持ち出して別の場所で使ってください。
文字起こしは優秀ですが完璧ではありません。名前、専門用語、通りがかりのトラックにかき消された一語 — 手を入れたくなるのはそういう行で、これはそのために作られています。
各キューはただのテキスト欄です。言い回しを書き直したり、中で Enter を押して 1 行を 2 行に分けたりすると、動画の上の字幕もその場で変わります。
各キューの横の時刻はボタンです。押せば動画がその場面に飛びます。探すより速く、たいていは実際に何と言ったかを知る唯一の方法です。
翻訳者や編集ソフト、ほかのツールから来た .srt や .vtt を開いて、ここで編集できます。文字化けして届いた場合は、そのファイルの文字コードを選べば読み直されます。
タイミングは固定です。キューの文言は書き直せますが、開始時刻や表示の長さは変えられず、キューの追加・削除・結合もできません。動画とずれているファイルには別のツールが要ります。
上のページは何もインストールせずに使えます。こちらは必要ですが、その代わりページにはできないことをします — タブで再生中の動画に字幕を付ける、あるいは2時間のファイルをブラウザー抜きで焼き込む。どれも同じ Rust エンジンなので、出力は同一です。
タブで再生中のものに、再生しながら字幕を重ねます。Chrome、Edge、Firefox 対応。ストアにはまだ出していません — ビルドは自分で読み込む .zip です。
macOS、Windows、Linux 向け。長いファイルやバッチ処理のために。焼き込みには ffmpeg を使うので、ass フィルター付きでビルドされたものが必要です — macOS なら brew install ffmpeg-full。ビルドは署名されていません。
ファイルごとに1コマンド、スクリプトと CI のために。同じエンジン、同じプリセット、同じ出力。ソースからビルドしてください。デスクトップアプリと同じく ffmpeg が必要です。
エンジン、ウェブアプリ、拡張機能、デスクトップアプリ、コマンドラインは一つのリポジトリです。このページの言い分を信じるより、機械で動くものを読んでください。
現在のビルドはリリース候補です。機能は揃っていてテスト済みですが、バージョン番号は安定版のリリース手順をまだ通っていないことを表しています。
たいていの字幕ツールは動画をアップロードし、処理し、削除すると約束します。OpenSubs はその逆の作りです。
無料で、オープンソースです。あなたの動画に触れるコードは AGPL-3.0 のもと GitHub にあります — つまり上の段落は、信じるものではなく確かめられるものです。
ファイルは object URL 経由で読み込まれ、ブラウザーがデコードします。この製品にアップロード先は存在しないので、映像の流出は「しないと約束する」類のことではありません — そもそも起こりえません。
クラウド翻訳を選んだ場合の字幕テキスト。あるいはクラウド文字起こしを選んだ場合の、切り出した音声の範囲。端末上で動く選択肢は何も送らず、そちらが既定です。
自分の API キーを持ち込めば、それはブラウザーから使われるだけで、保存されず、当社に送られず、ディスクにも書き込まれません。
つまりほぼ全部です。当社があなたの代わりに費用を負担する部分にだけ課金し、ボタンを押す前に料金をお伝えします。
いいえ。約束するからではなく、この製品にアップロード先そのものがないからです。OpenSubs はファイルをブラウザで直接読み、文字起こし・スタイル設定・端末上の翻訳・焼き込みはすべてご自身の端末で動きます。信じる必要はなく、確かめられます — ネットワークタブを開いて動画に字幕を付けてみてください。ページと音声モデルの読み込みが終わったあとは、リクエストは出ません。端末から出うるのは字幕のテキストか音声だけで、それもクラウドの選択肢を選んだときだけです。
いいえ。ご自分のプロバイダーを使うために入力した API キーは、ページのメモリー上にしか置かれません。localStorage にも sessionStorage にも IndexedDB にも Cookie にも書かれず、ブラウザが選んだ提供元 — OpenAI や OpenAI 互換のサーバー、Anthropic、DeepL — に直接送ります。OpenSubs のサーバーを経由することはありません。再読み込みするかタブを閉じれば消えるので、次回はまた入力してください。
いいえ。文字起こし、端末内の翻訳、スタイル設定、トリミング、焼き込み、そしてすべての書き出しは、アカウントもサインインも無しで使えます。アカウントが要るのは、当社バックエンドでのクラウド翻訳に支払う場合だけです。
動画をこのページにドロップして、その音声から字幕を作ってください。Whisper はご自身の端末で動くので、何もアップロードされず、料金もかかりません。間違った行はテキストを直し、スタイルを選び、字幕を .srt・.vtt・.ass として書き出すか、MP4 に焼き込んでください。アカウントもウォーターマークもありません。
OpenAI の Whisper をローカルで動かします —— transformers.js が動かす ONNX の重みを、機械にあれば WebGPU で、無ければ WebAssembly で。モデルは3種類:Tiny(英語のみ、約 40 MB)、Base(約 80 MB)、Small(約 250 MB)。モデルは一度だけダウンロードされ、以後はブラウザーにキャッシュされます。取得されるのはモデルだけで、音声は決して送られません。話されている言語はファイルごとに一度ではなく4秒ごとに判定するので、二つの言語を行き来する動画も、両方を含む一つの字幕ファイルとして出てきます。
はい。字幕は libass — ffmpeg が使うのと同じレンダラー — を WebAssembly にコンパイルしたもので描画し、WebCodecs で MP4 にエンコードし直します。プレビューで見えているものがそのままピクセルになり、音声はそのままコピーされます。
あなたの機械で動くものはすべて無料です:文字起こし、端末内の翻訳、12 種類すべての字幕スタイル、単語ごとのハイライト、トリミング、MP4 への焼き込み、そしてすべての書き出し形式。透かしも、ファイルサイズの上限も、順番待ちもありません — その作業の費用を負担するサーバーが無いので、そもそも存在しないのです。有料なのは当社バックエンドでの翻訳だけで、1,000 クレジット 5 ドル。ジョブの料金は実行前に表示され、失敗したジョブは無料です。
いいえ。焼き込まれた MP4 に入るのは選んだ字幕だけですし、書き出した .srt・.vtt・.ass はただの字幕ファイルです。誰かが費用を払うサーバーではなくブラウザの中で処理しているので、付け足すものがありません。
20言語。簡体字中国語、繁体字中国語、日本語、韓国語、スペイン語、ポルトガル語、フランス語、ドイツ語、イタリア語、ロシア語、アラビア語、ヒンディー語、インドネシア語、タイ語、ベトナム語、トルコ語、ポーランド語、オランダ語、ウクライナ語を含みます。非ラテン文字用のフォントも同梱しているので、中国語やアラビア語の字幕も空の四角にならず正しく焼き込まれます。
初回の訪問以降はおおむね可能です。音声モデルは最初のダウンロードのあとブラウザーにキャッシュされ、クラウド翻訳以外はすべてローカルで動きます。端末内での翻訳は Chrome 内蔵の翻訳モデルを使い、こちらも一度だけダウンロードされます。
はい、AGPL-3.0 です。同じエンジン — 字幕の分割、改行、読み速度の上限、スタイルプリセット、ASS の書き出し — がブラウザー向けに WebAssembly へ、デスクトップアプリとコマンドラインツール向けにネイティブバイナリへコンパイルされるので、三つとも同じ出力になります。
動画をこのページにドロップしてください。話した内容がタブの中で書き起こされ、間違った行を直し、スタイルを選び、あとは字幕を映像に焼き込むか、ファイルとして書き出して一緒に渡すかです。何もアップロードされず、アカウントもウォーターマークもありません。プラットフォームが字幕を受け取る二通りのやり方も含めた詳しい説明は動画に字幕を付ける方法にあります。
はい、むしろそれが持ち出しかたの定番です。字幕を書いて直し終えたら、.srt・.vtt・.ass として書き出してください。.srt は行番号、開始と終了の時刻、そして文字だけが入ったテキストファイルで — 字幕を受け取るものならどれでも読めます。
ここではできません。キューの文字は編集できますが、開始と終了の時刻は編集できず、キューの追加・削除・結合もできません。言い換えではなくタイミングの直しが必要なファイルには、専用の字幕エディターが適していて、これはそれではありません。
それぞれの形式の役目、どのプラットフォームがどの出力を受け取るか、そして人が追える字幕の書き方。
キャプションは言葉だけでなく音も伝え、字幕は話された言葉を別の言語にします。どちらを求められているのか。
二つの形式で実際に何が変わるのか、例を添えて。そしてアップロードせずにここで変換する方法。
同じ字幕を 3 つの形式で書いたもの。どのプレーヤーとどのプラットフォームがどれを受け取るか。
やり方は三つ — 自分で打ち込む、プラットフォームに任せる、自分の端末で生成する — それぞれの代償も含めて。
別の .srt のままにするか、映像に描き込むか。それぞれがプレーヤーと後の編集に何を意味するか。
どちらも字幕ファイルを受け取らないので、文字は映像の中に入れるしかありません。作って、整えて、焼き込むまで。
一語ずつ光るカラオケ風の字幕。どんなときに効くのか、自分の動画からどう作るのか。