Claude Codeで動画編集を自動化する方法!1人語り動画の実例と手順を解説

1人で話すYouTube動画は、撮影よりも編集に手間がかかります。無音のカット・言いよどみの削除・テロップの入力は、どれも動画が長くなるほど増える作業です。
Claude Codeは動画編集ソフトではないものの、文字起こしや書き出しの道具を組み合わせて動かせるAIエージェントです。この記事では、Touch AI編集部が1人語りの動画を素材から完成品まで自動編集した実例をもとに、Claude Codeに頼むことと人が判断することを工程順に解説します。記事を読めば、自社の動画編集のどこまでをAIに任せられるかを判断できます。
編集部の実例では、25分の素材の全編書き出しは約3分で終わりました。自動化の成否を分けたのは書き出しの速さではなく、テロップを人とAIでどう読むかでした。
Claude Codeで動画編集を自動化するとできること
Claude Codeで動画編集を自動化すると、撮影した動画ファイルを渡すだけで、カットからテロップ・画像・効果音までを入れた完成品を書き出せます。編集部が1人語りの動画の完成品に入れている要素は、以下の表のとおりです。
| 要素 | 内容 | 自動化の方法 |
|---|---|---|
| カット | 0.6秒以上の無音を詰める | 無音を検出して残す区間を決める |
| テロップ | 極太・黒縁・句読点付き・1画面2行まで | 言いよどみを消し、声の時刻に合わせる |
| 左上のタイトル | 番組名を常に表示 | 画像生成AIで作る |
| 右上のコーナー名 | 「間違い①」のような章の名前 | 章の変わり目で切り替える |
| 章カード | 章の変わり目に2秒表示 | ぼかした本編の映像の上に絵柄を重ねる |
| 説明スライド | 話の内容を図で補足 | 該当の話の間ずっと表示する |
| イメージ動画 | 1本の動画に5本の短いアニメ | 動画生成AIで作る |
| 効果音 | 章の変わり目の拍子木 | 効果音だけの音声を重ねる |
| 冒頭と末尾 | 固定のオープニングとエンディング | 最後の工程でつなぐ |
編集部がこの形を最初に作ったのは、2026年8月に仕上げた、Claude Codeの使い方の解説動画(53分)です。その後も同じ手順で、ライブ配信からの抜き出しや40分前後の解説動画など9本を仕上げました。
BGMは入れていません。動画の話し手本人が、BGMより場面に合った効果音の方が分かりやすいと判断したためです。
自動化の対象は1人が座って話す16:9の動画で、縦型のショート動画はこの手順の対象外です。映像そのものをAIで作る道具は動画生成AIのおすすめで比べています。人物や音声までAIで作る広告はAIでショート動画広告を作る方法で、台本から投稿までの流れはAIでYouTube動画を作る方法で解説しています。
Claude Codeで動画編集を自動化する仕組みと使う道具
Claude Codeで動画編集を自動化するとき、映像を切ったりつないだりするのはClaude Code自身ではなく、FFmpegなどの別の道具です。仕組みと道具は、以下の4つに分けて説明します。
- Claude Codeは編集の手順を書いて動かす役
- 文字起こしはmlx-whisperで単語ごとの時刻を取る
- カット・合成・書き出しはFFmpegで行う
- 動きのある図解が要る部分だけRemotionを使う
Claude Codeは編集の手順を書いて動かす役
Claude Codeは、ファイルの読み書きとコマンドの実行ができるAnthropicのAIエージェントです。動画編集では、Claude Codeが処理の手順をプログラム(スクリプト)として書き、文字起こしや書き出しの道具を順番に動かします。Claude Code公式ドキュメント
人がClaude Codeに伝えるのは、「0.6秒以上の無音を詰めて」「テロップは1画面2行まで」のような仕上がりの条件です。Claude Codeそのものの特徴はClaude Codeとはで、日々の操作はClaude Codeの使い方で確認できます。
編集部は、1本目の動画で固まった手順と失敗の記録をClaude Codeのスキル機能で手順書にまとめ、2本目以降はその手順書を読ませてから作業を始めています。手順書の作り方は、Claude Codeのスキルの記事で解説済みです。
文字起こしはmlx-whisperで単語ごとの時刻を取る
文字起こしには、OpenAIの音声認識モデルWhisperを、Apple製チップ向けの機械学習の仕組みMLXで動かすmlx-whisperを使っています。モデルはlarge-v3-turboを選びました。large-v3-turboは、Whisperのlarge-v3を速く動くように最適化し、精度の低下を小さく抑えた版です。mlx-whisper、MLX、MLX版モデル、Whisper
mlx-whisperには、単語ごとの時刻を出す設定(word_timestamps)と、固有名詞などを最初に教えておく設定(initial_prompt)があります。編集部は単語ごとの時刻を必ず取り、句読点付きの例文と「Claude Code」などの固有名詞をinitial_promptに入れて、句読点と表記を安定させています。mlx-whisperの処理
文字起こしの結果には、辞書にない聞き違いが残ります。「Claude Code」が「クロノコード」と書き起こされた例のように、完成品で見つけた誤りは、文字起こしの原稿とテロップの両方で直します。
カット・合成・書き出しはFFmpegで行う
映像のカット・テロップの焼き込み・画像の重ね合わせ・書き出しには、無料の動画処理ソフトFFmpegを使っています。編集部が使っているFFmpegの主な機能は、以下のとおりです。FFmpegのフィルタ一覧
- 無音の検出(silencedetect)
- 区間の切り出し(trimとatrim)
- 区間のつなぎ(concat)
- テロップの焼き込み(libassを使うsubtitles)
silencedetectの初期設定の判定基準は、−60dBより小さい音が2秒続くことです。編集部は話の合間を詰めるため、−32dBより小さい音が0.6秒以上続いた部分を無音とし、前後を0.125秒ずつ残して詰めています。
書き出しを速くする方法は、NVIDIAのGPUに載っている動画用のエンコーダ(NVENC)をFFmpegから使うことです。編集部は社内のGPUサーバーでh264_nvencを使い、全編を区間に分けて並列で書き出しています。NVIDIAのFFmpeg解説
動きのある図解が要る部分だけRemotionを使う
Reactのコードで動画を作れるRemotionも、Claude Codeと組み合わせてよく使われます。Remotionは、個人・従業員3人以下の営利企業・非営利団体なら無料で使えますが、それ以外の会社には有料のCompany Licenseが必要です。Remotion、RemotionのLICENSE
編集部も話し手本人から、FFmpegは古いのでRemotionを使うべきではないかと問われ、時間の使われ方を測ってから判断しました。書き出しは約4分で、時間の大半は日本語テロップの切れ目の設計と校正に消えていました。テロップの校正は道具を変えても残るため、編集部はFFmpegを使い続け、数字が増えていくアニメのような図解だけをRemotionで作る方針です。
Claude Codeで1人語り動画を自動編集する手順
Claude Codeで1人語り動画を自動編集する手順は、7つの工程に分かれます。工程ごとにClaude Codeに頼むことと人が判断することは、以下の表のとおりです。
| 工程 | Claude Codeに頼むこと | 人が判断すること |
|---|---|---|
| 1. 文字起こしと無音カット | 単語ごとの時刻付きの文字起こし・残す区間の一覧 | 動画の始まりと終わりの位置 |
| 2. テロップ | 言いよどみの削除・1画面2行の割り付け・声の時刻への吸着 | テロップの見た目・聞き取れない語の確認 |
| 3. 章立て | 章の区切りを原稿の中の位置に当てる | 章の一覧を箇条書きで渡す |
| 4. 画像 | タイトル・章カード・スライド・イメージ動画の作成と全数の確認 | 並べた案から見た目を選ぶ |
| 5. 効果音 | 候補の場所と音の一覧・選ぶための画面の作成 | 鳴らす場所と音 |
| 6. 試し書き出し | 24秒だけの書き出しとコマの確認 | なし |
| 7. 本番の書き出し | 確認版と本番の書き出し・公開前の点検 | 確認版を見て公開してよいか |
工程ごとの進め方は、以下のとおりです。
- 素材を渡して文字起こしと無音カットを頼む
- 言いよどみを消したテロップを作らせる
- 章立ては話し手が箇条書きで渡す
- タイトル・章カード・スライドの画像を作らせる
- 効果音は候補を出させて人が選ぶ
- 24秒だけ試しに書き出して確認する
- 確認版を見てから本番を書き出す
素材を渡して文字起こしと無音カットを頼む
最初の工程では、撮影した動画ファイルをClaude Codeに渡し、文字起こしと無音カットの一覧を作らせます。Claude Codeへの依頼の例は、以下のとおりです。
- 「この動画を単語ごとの時刻付きで文字起こしして」
- 「0.6秒以上の無音を詰めて、残す区間の一覧を作って」
- 「冒頭は挨拶の声が出た瞬間から始めて」
人が確かめるのは、動画をどこから始めてどこで終えるかです。文字起こしの開始時刻は実際の声から2秒以上ずれることがあるため、冒頭の位置は音量の変化から実測させます。収録の末尾に「この後にちょっとだけお知らせ挟みたい」のような編集の指示が入っていた回もあるため、範囲を決める前に末尾の文字起こしも読みます。
Whisperの文字起こしで注意したいのは、長い無音に言葉を作り出す現象です。編集部の素材では、107秒の沈黙に「ご視聴ありがとうございました」が13回書き起こされました。無音の区間に重なる文字起こしは疑って消すように、最初の依頼で伝えておくと安心です。
言いよどみを消したテロップを作らせる
テロップは、文字起こしから言いよどみを消し、1画面に収まる長さに割り付けて作らせます。編集部が固めたテロップの条件は、以下のとおりです。
- 1画面は2行まで、1行は22字まで
- 句読点を付ける
- 語の途中で行や画面を切らない
- 助詞から画面を始めない
- 「まあ」「あの」「えー」などの言いよどみを消す
最初の版は1画面を1行で割っていたため、文の途中で画面が変わり、話し手本人から「分けてる意味があるの?」と指摘されました。1画面を2行まで使うように直すと、テロップの件数は2,043件から1,209件に減りました。
テロップの見た目は、文章ではなく画像で決めます。編集部は文字の大きさや縁の太さを変えた案を画像にして並べ、話し手本人に選んでもらいました。
聞き取れない語は、AIに推測で埋めさせません。主題の語が抜けた箇所のように文脈で1つに決まる誤りはClaude Codeに直させ、候補が複数残る語だけを人が音声で確認します。1回に確認へ回す件数は10件前後までにしています。29件を並べた回は、確認する側の負担が大きすぎました。
章立ては話し手が箇条書きで渡す
章の区切りは話し手が箇条書きで渡し、Claude Codeには原稿のどこに当たるかだけを探させます。原稿の「続いて」などの言葉を手がかりにAIに章を拾わせた回は、12章あったところを9章しか拾えませんでした。
反対に、人が渡した一覧が正しいとも限りません。14項目を渡した回では、そのうち2項目を動画の中で話していませんでした。章の一覧は、Claude Codeに原稿と突き合わせて確かめさせてから使います。
タイトル・章カード・スライドの画像を作らせる
左上のタイトル・章カード・説明スライドは、Claude Codeに画像生成AIへの指示文を書かせて作ります。編集部はOpenAIの画像生成モデルgpt-image-2を使い、2026年8月の時点で1枚あたり約25円でした。GPT Image 2
画像の大きさや配色は、並べた案から人が選びます。左上のタイトルは最初の案が大きすぎたため、幅を変えた案を並べて選び直しました。
説明スライドは、その内容を話している間ずっと表示します。1枚12秒の固定表示を話し手本人の指示で改め、49分の動画のうち34分がスライドの表示になりました。スライドの表示中は右上に話し手を丸く切り抜いて出すため、顔が画面から長く消えることはありません。
動画生成AIのMiniMax H3で作る5秒のアニメも、1本の動画に5本入れています。編集部の実績では5秒1本が0.40ドルで、動きを秒ごとに指示しないと静止画に近い映像になりました。MiniMax H3
効果音は候補を出させて人が選ぶ
効果音は、Claude Codeに候補の場所と音を出させ、鳴らすかどうかを人が選びます。編集部は、効果音を選ぶための簡単な画面をClaude Codeに作らせました。画面に入れた機能は、以下のとおりです。
- 効果音の種類ごとの入り切り
- ボタンを押すと音が鳴る試聴
- 時間軸の上での位置の表示
- 近すぎる効果音を間引く最低間隔の設定
- 選んだ結果をテキストでコピーする機能
1本目の動画には6種類・50箇所の効果音を入れました。3本目からは話し手本人の指示で、章の変わり目の拍子木1種類だけにしています。
24秒だけ試しに書き出して確認する
全編を書き出す前に、同じ設定で24秒だけを手元で書き出し、変更が見える時刻のコマを画像で開いて確かめます。処理の記録にエラーが出ていなくても、丸く切り抜いた話し手の縁だけが大きく出るような見た目のずれは、画像を見ないと分かりません。
編集部は、この試し書き出しを省いて全編をクラウドの計算機に送り、4回失敗しました。書き出しが数分で終わる場合でも、24秒の確認を先に挟む方が全体は早く終わります。
確認版を見てから本番を書き出す
本番の前に、画質を落とした確認版を全編書き出し、話し手本人に見てもらいます。編集部の順番は、「24秒の試し書き出し→確認版→本人の確認→本番」の4段階です。
書き出した完成品は、公開前に機械と人の目の両方で点検します。機械で点検する項目は、音量の一定さ・無音・末尾のフェード・章カードやスライドが予定の時刻に出ているか・テロップと声のずれなど14項目で、1つでも不合格なら渡さない決まりです。
Claude Codeの動画編集でやってはいけないと分かったこと
編集部は、動画を1本仕上げるたびに話し手本人から受けた指摘を、手順書の決まりに足してきました。Claude Codeで動画編集を自動化するときに避けたいことは、以下の5つです。
- テロップの時刻を文字数で割り振らない
- 機械の検査だけでテロップを渡さない
- 言いよどみと一緒に文を削らない
- 画像の確認を抜き取りで済ませない
- 原因を測らずに作り直さない
テロップの時刻を文字数で割り振らない
テロップの表示時刻は、区間の長さを文字数で等分して決めてはいけません。編集部の最初の版は、言いよどみを消したあとの文字数で時刻を割っていました。「まあ」を話していた時間が残りの文字に配られ、テロップの25%が0.1秒以上ずれ、最大のずれは1.76秒に達しました。
正しい方法は、文字起こしの単語ごとの時刻をそのまま使い、消した文字の時刻だけを落とすことです。さらに実際に話し始めた位置に合わせ直すと、ずれの中央値は0.333秒から0.081秒に縮み、±0.1秒以内に収まる割合は16.6%から83.7%に上がりました。
時刻を合わせ直す処理は、章の文言を直したあとなどに通し忘れると効果が消えます。通し忘れたまま書き出した回は、±0.1秒以内の割合が99.5%から56.1%に戻りました。映像を見ただけでは気づけず、公開前の機械の点検で見つかっています。
機械の検査だけでテロップを渡さない
機械の検査で問題が0件でも、テロップを1画面ずつ読まずに渡してはいけません。編集部は機械の検査を通しただけのテロップを渡し、「ありが」と「とうございました」が別の行に分かれた画面を話し手本人に見つけられました。
テロップを読むときの基準は、その1画面だけを見て文として読めるかどうかです。1画面を読むときに確かめる壊れ方は、以下の3つです。
- 画面の頭が「と」「て」などで始まり、前の画面に掛かっている
- 画面の終わりが「〜を」「〜が」などで、次の画面に掛かっている
- 聞き違いや言い直しの残りが入っている
1,000行を超えるテロップを1人で通し読みすると、数時間かかります。編集部はClaude Codeのサブエージェント12体に100行ずつ割り振り、同時に読ませました。指摘は1回目が298件、2回目が222件、3回目が149件と回を追うごとに減っています。複数のエージェントに分けて読ませる仕組みは、Claude Codeのサブエージェントで解説しています。
言いよどみと一緒に文を削らない
言いよどみは消しても、話し手の言い回しや文そのものを削ってはいけません。Claude Codeが「刈り込み」として締めの一文を削る案を出したとき、話し手本人はその案を却下しました。言いよどみの扱いは、以下のように分けています。
- 消す: 「まあ」「あの」「えー」、文頭の「はい」「なので」、相づちの「ね」
- 1回にまとめる: 言い直しで同じ言葉が続いた部分
- 残す: 「めちゃめちゃ」「もっともっと」などの強調の繰り返し
- 残す: 単語そのものを説明している箇所の元の言葉
言いよどみを消すときは、残った文字が元の時刻を持ち続けるように処理させます。文字列を置き換える方法で消すと、テロップの時刻がずれてしまうからです。
画像の確認を抜き取りで済ませない
章カードやスライドを作り直したら、全数を実際の合成状態で並べて目で確かめます。編集部は、切り抜きの警告が全カードに出ていたのに2枚だけを見て進め、タイトルの上端が欠けたカードを見落としました。
画像生成の仕組みに付いている品質判定も、そのまま信じてはいけません。品質判定が文字しか見ていなかったため、年表の順番が前後したスライドが合格として通った回がありました。順序のある図は指示文で左から右への並びを列挙し、完成品で番号と順番を1枚ずつ確かめます。
原因を測らずに作り直さない
書き出しが遅いときは、原因を推測で決めて作り直す前に測ります。編集部は書き出しの遅さを頭出しの方式のせいだと決めつけて6回作り直しましたが、原因を切り分けて測ると10分で本当の原因が分かりました。
本当の原因は、重ねる画像の時刻が0秒から始まっていたことです。動画の後半ほどFFmpegが画像側のコマを空回ししてから重ねるため、書き出しの速さは先頭の8.6倍速から後半の1.1倍速まで落ちていました。画像に区間の開始時刻を指定すると、この遅れは解消しました。
Claude Codeの動画編集にかかる時間と費用
Claude Codeで動画編集を自動化するときの時間と費用は、どこで書き出すかと、何をAIで生成するかで変わります。編集部の実績は、以下の表のとおりです。
| 項目 | 編集部の実績 |
|---|---|
| 全編の書き出し(手元のMac) | 49分の動画で2時間45分 |
| 全編の書き出し(クラウドの計算機) | 49分の動画で4分1秒・1回あたり約0.06〜0.11ドル |
| 全編の書き出し(社内のGPUサーバー) | 25分の素材を64区間・6本並列で約3分 |
| 画像1枚(gpt-image-2) | 約25円 |
| イメージ動画1本(MiniMax H3・5秒) | 0.40ドル |
手元のMacの2時間45分は、画像の重ね方の不具合による遅れを含む数字です。不具合を直したあとは、手元でも動画の長さの5分の1前後の時間で書き出せました。
表の金額にClaude Codeそのものの利用料は含めていないため、プランと月額はClaude Codeの料金で確認してください。
時間が一番かかったのは、書き出しではなくテロップの校正です。ライブ配信から抜き出した20分の動画では、機械で割り付けた507画面のうち209画面を、文としてつながるかの目で手直ししました。自動化で短くなるのは書き出しと繰り返しの作業で、テロップを読む作業はなくなりません。
Claude Codeの動画編集が向いている動画と始める前の準備
Claude Codeで動画編集を自動化しても、すべての動画が同じように楽になるわけではありません。始める前に確かめたいことは、以下の3つです。
- Claude Codeの動画編集が向いている動画
- APIキーと社内サーバーへの接続は人が実行する
- 見た目の決め方と最終確認の担当を決めておく
Claude Codeの動画編集が向いている動画
Claude Codeの動画編集が向いているのは、同じ型の動画を繰り返し作る場合です。編集部の手順は、1人が座って話す20〜60分・16:9の動画に合わせて作りました。向いている動画の例は、以下のとおりです。
- YouTubeの解説動画
- ライブ配信やウェビナーの録画からの抜き出し
- 社内研修や説明会の録画
1本目は手順づくりと失敗の洗い出しに時間がかかり、効果が出るのは2本目以降です。話の間や表情に合わせた演出を毎回変えたい動画は、編集ソフトで人が仕上げる方が早い場合もあります。エンジニアでない人がClaude Codeを仕事に取り入れる考え方は、非エンジニアのClaude Code活用で紹介しています。
APIキーと社内サーバーへの接続は人が実行する
画像生成AIのAPIキーや社内サーバーへの接続は、Claude Codeに持たせず、人のターミナルで実行します。編集部のClaude Codeは安全のための制限(サンドボックス)の中で動いており、APIキーを含む設定ファイルを読めず、社内サーバーへの接続もできない設定です。
文字起こしのmlx-whisperもMacのGPUを使うため、サンドボックスの中では動かず、人が実行しています。実行するコマンドはClaude Codeが用意するので、人の作業は貼り付けて実行するだけです。Claude Codeに任せる範囲の決め方は、Claude Codeのサンドボックスで解説しています。
見た目の決め方と最終確認の担当を決めておく
見た目を誰が決め、完成品を誰が確認するかは、始める前に決めておきます。Claude Codeは見た目の案を何通りでも作れますが、どの案を採るかは人の判断です。
編集部では、話し手本人が並べた案から見た目を選び、確認版を見て公開してよいかを決めています。テロップの大きさや章カードの配色も、本人が案を見比べて決めました。
Claude Codeの動画編集は作業をAIに任せ、判断を人が持てば自動化できる
Claude Codeで動画編集を自動化すると、1人語りの動画は素材のファイルから完成品まで通して仕上げられます。Claude Codeは手順を書いてFFmpegやmlx-whisperを動かし、人は見た目・章立て・公開の可否を決めます。
編集部の実例で分かった進め方の要点は、以下のとおりです。
- 章の一覧・見た目・効果音は人が選ぶ
- テロップの時刻は単語ごとの時刻から作る
- テロップは1画面ずつ文として読めるかを確かめる
- 24秒の試し書き出しと確認版を挟んでから本番を書き出す
- 遅いときや壊れたときは、推測で作り直さず原因を測る
書き出しは数分で終わっても、テロップを読む作業は残ります。映像そのものをAIで作りたい場合は、動画生成AIのおすすめもあわせて確認してください。まずは手元にある10分程度の1人語り動画を1本選び、文字起こしと無音カットだけをClaude Codeに頼むところから始めましょう。



