AIでYouTube動画を作る方法|台本・編集・サムネイル・投稿を工程別に解説

YouTube用の撮影は済んだのに、無音部分のカットと1行ずつのテロップ入れで手が止まり、次の動画の投稿が先延ばしになっている会社があります。更新を止めている壁は、話す中身ではなく編集の工程です。
AIは企画・台本・音声・編集・テロップ・サムネイル・投稿のどの工程にも使えるものの、任せてよい範囲は工程ごとに違うのが実情です。この記事では、編集部が1人語りの動画をAIで仕上げている手順をもとに、工程ごとのAIの使い方とYouTubeのAI開示・収益化のルールを解説します。記事を読めば、自社の動画で最初にAIへ任せる工程を決められます。話す中身は人が決め、カット・テロップ・サムネイルのような量の多い作業をAIに任せる分担が、更新を続けるための近道です。
AIでYouTube動画を作る工程と各工程でAIに任せること
AIでYouTube動画を作る方法は、話し手を撮影した動画をAIで編集する方法と、人物・音声・映像まですべてAIで生成する方法の2つに分かれます。どちらの方法でも、企画から投稿までの工程は同じです。
工程ごとにAIへ任せることと人が決めることは、以下の表のとおりです。
| 工程 | AIに任せること | 人が決めること |
|---|---|---|
| 企画・台本 | 構成案とタイトル案の下書き | 話す項目と動画の結論 |
| 音声 | 文字起こし、AI音声でのナレーション | 自分で話すかAI音声にするか |
| 編集 | 無音カット、言いよどみの削除、差し込み画像・動画の生成、書き出し | 章の区切りと残す話 |
| テロップ | 表示の時刻合わせ、改行、誤りの洗い出し | 聞き取れない語の確認 |
| サムネイル | 見出し入り画像の複数案 | 見出しの文言、人物のポーズ、採用する案 |
| 投稿 | 概要欄と目次の下書き | 公開範囲、AI使用の開示 |
編集部の1人語りの動画では、話し手が話す項目を箇条書きで決めて収録し、文字起こしから書き出しまでの作業をAIが担当しています。話し手が関わるのは、主に話す項目の箇条書き・聞き取れない語の確認・サムネイルの選択・確認版のチェックです。
人物や映像までAIで作る方法は、顔を出さない解説動画や広告に向いています。映像を作るAIの選び方は動画生成AIのおすすめで、人物・音声・映像をすべてAIで作る手順はAIだけでショート動画広告を作る方法で解説しています。
AIでYouTubeの企画と台本を作る方法
企画と台本の段階でAIが役に立つのは、白紙から構成案を出す作業です。企画と台本でAIを使うときの進め方は、以下の2つです。
- AIに構成案とタイトル案を複数出させる
- 話す項目は自分で箇条書きにして決める
AIに構成案とタイトル案を複数出させる
構成案づくりでは、ChatGPTやClaudeのような対話型AIに条件を渡して、複数の案を出させます。1案だけでは比べる材料がなく、AIの案をそのまま採用しがちです。
AIに構成案を頼むときに伝える項目は、次のとおりです。
- 想定する視聴者と、その人が抱えている悩み
- 動画で伝えたい結論
- 動画の長さ
- 自分だけが話せる経験や具体例
構成案やタイトル案、台本の作成にAIを使っても、YouTubeへの開示は必要ありません。YouTubeは、構成案・台本・サムネイル・図表の作成や改善に生成AIを使うことを「制作の補助」として扱い、開示が不要な例に挙げています。YouTubeヘルプ(改変または合成されたコンテンツの開示)
話す項目は自分で箇条書きにして決める
動画の骨組みになる「話す項目」は、AIに決めさせず話し手が箇条書きで書きます。編集部の1人語りの動画では、話し手が章の項目を箇条書きで渡し、AIはその項目が台本のどこで話されているかを探して章の位置を決めています。
AIに話の区切りを自動で拾わせる方法は、編集部では採用していません。「続いて」などの言葉から章を拾わせたところ、実際は12個ある章を9個しか見つけられなかったためです。
話し手の箇条書きも、そのまま使わずに文字起こしと照らし合わせます。ある回では14項目の箇条書きのうち2項目を動画で話しておらず、照合で見つけて章から外しました。台本を用意した回は、テロップの句読点や表記を台本にそろえる作業にも台本を使っています。
AIでYouTubeのナレーション音声を用意する方法
音声の用意は、自分で話して収録する方法と、AI音声にナレーションを読ませる方法に分かれます。音声を用意する2つの方法は、以下のとおりです。
- 自分で話して収録し文字起こしAIでテキストにする
- AI音声でナレーションを作る
自分で話して収録し文字起こしAIでテキストにする
自分で話す動画では、収録した音声を文字起こしAIでテキストに戻し、そのテキストを編集とテロップの土台にします。編集部は、OpenAIがオープンソースで公開している音声認識モデルWhisperの高速版を、手元のMacで動かしています。Whisperは日本語を含む多言語に対応した、MITライセンスのモデルです。Whisper(GitHub)
文字起こしでは、単語ごとの時刻も一緒に取り出します。単語の時刻は、あとでテロップを話し声に合わせる工程で使います。
文字起こしの結果は、そのまま使える状態ではありません。編集部の記録に残る誤りの例は、以下のとおりです。
- AIのモデル名の聞き違い(「Sonnet」が「Solet」、「Haiku」が「俳句」になる)
- 長い無音の区間に、話していない「ご視聴ありがとうございました」が繰り返し入る
- 固有名詞が別の語になる(「Claude Code」が「クロノコード」になる)
固有名詞は、正しい表記と誤りやすい表記を並べた辞書を作って置き換えます。辞書は機械的に当てず、話し手が実際に言った語かを前後の文で確かめてから直す運用です。
AI音声でナレーションを作る
顔も声も出さない動画では、台本をAI音声に読ませてナレーションを作ります。編集部がショート広告で使っているElevenLabsは、文章を音声にする機能と、自分の声を複製する機能を持つ音声生成サービスです。
ElevenLabsの無料プランは月1万クレジットまで使えますが、商用ライセンスは含まれません。商用ライセンスと声の複製は、月6ドルのStarterプランから使えます。ElevenLabsの料金ページ
編集部のショート広告では、音声1本の生成費用は約1.5円で、動画1本の約120円の100分の1程度でした。安い音声の段階で台本と声を決め切ってから映像を作ると、高い映像の作り直しを減らせます。広告での具体的な進め方はAIだけでショート動画広告を作る方法で解説しています。
自分の声を複製してナレーションや吹き替えを作る場合も、YouTubeへの開示は不要です。YouTubeヘルプ(改変または合成されたコンテンツの開示)
AIでYouTube動画を編集してテロップを入れる方法
編集とテロップ(画面に入れる字幕)は、無音のカットや文字の入力など細かい作業が続く工程です。編集部は1人語りの動画の編集をAIに任せ、話し手は途中の確認と最終確認だけを担当しています。編集とテロップの工程でAIに任せていることは、以下の5つです。
- 無音カットと言いよどみの削除をAIに任せる
- テロップは文字起こしの時刻に合わせて1画面1文で出す
- テロップの誤りはAIに全行を読ませて洗い出す
- 章カード・説明スライド・イメージ動画を差し込む
- 全編を書き出して納品前に検品する
Claude Codeを使った編集の自動化の組み立て方は、Claude Codeで動画編集を自動化する方法で解説しています。
無音カットと言いよどみの削除をAIに任せる
編集部の1人語りの動画は、0.6秒以上続く無音を検出して詰めています。無音の前後に0.125秒ずつ残すのは、言葉の頭と終わりを切らないための設定です。
言いよどみも、AIがテロップと映像の両方から消します。消す語は「まあ」「あの」「えー」などの言いよどみと、文頭の「はい」「なので」です。
言いよどみは消しても、話し手の言い回しは変えず、文も削りません。AIが「整理」のつもりで締めの一文を削った案は、話し手が却下しました。動画の冒頭は、挨拶の声が実際に立ち上がる位置を音量の変化で測って決めています。
テロップは文字起こしの時刻に合わせて1画面1文で出す
テロップの時刻は、文字起こしで取った単語ごとの時刻に合わせます。編集部は最初、言いよどみを消したあとの文字数で区間の時間を割り振っていました。割り振り方式では全体の25%の行が0.1秒以上ずれ、最大のずれは1.76秒に及びました。
単語の時刻を使い、さらに実際の話し出しの位置へ吸着させる方法に変えると、ずれが0.1秒以内に収まる行は16.6%から83.7%に増えています。
テロップの見た目と区切り方の決まりは、以下のとおりです。
- 極太の文字に太い黒縁、影は小さく
- 句読点を入れて、1画面に1文を出す
- 1画面は2行まで、1行は22字まで
- 「ありが/とう」のように語の途中で改行しない
テロップの誤りはAIに全行を読ませて洗い出す
テロップの校正では、機械的な検査だけでは見つからない誤りが残ります。語の途中で改行した「ありが/とう」は、「が」を助詞と判定する検査をすり抜けました。
編集部は、テロップを100行ずつに分けて複数のAIに同時に読ませ、1画面だけを見て文として成り立つかを判定させています。ある回では、見つかった誤りの件数が3周で137件→92件→22件→0件と減りました。
AIが直してよいのは、動画の主題や前後の文から正解が1つに決まる誤りだけです。候補が複数残る語は、番号を焼き込んだ短い映像にまとめて話し手に確認してもらいます。聞き取れない語を前後の文脈から推測してテロップにすると、誤ったテロップが残ります。
章カード・説明スライド・イメージ動画を差し込む
1人語りの動画は、話し手の顔だけが続くと単調になります。編集部は、次の3種類の画像や映像をAIで作って差し込んでいます。
- 章の変わり目に2秒出す章カード
- 説明を補う全画面の説明スライド
- 1本の動画に5本入れる5秒のイメージ動画
説明スライドの表示は、その内容を話している間ずっと続け、右上には話し手の顔を丸く切り抜いて重ねる形です。ある49分の回では、34分がスライドを表示した時間でした。
イメージ動画は、MiniMaxの動画生成モデルH3で作っています。H3は2026年7月31日に公開されたモデルで、生成できる動画は音声付きで最大15秒・2K解像度です。編集部は2体のキャラクター画像を参照として渡し、秒単位で動きを指示して、動画全体に均等な間隔で5本配置しています。MiniMax H3の発表
BGMは入れず、効果音は章の変わり目の拍子木1種類にそろえています。
全編を書き出して納品前に検品する
長い動画の書き出しは、動画を細かい区間に分けて並列で処理すると短時間で終わります。編集部は社内のGPUサーバーで動画を64区間に分け、6本ずつ並列で書き出しており、25分の素材の書き出しは約3分です。
書き出した動画は、納品前に機械の検査と目視の両方で確かめます。編集部の主な検品項目は、以下のとおりです。
- 音量が動画全体で一定か、目標の音量(−14LUFS)にそろっているか
- 章カード・スライド・イメージ動画が決めた時刻に出ているか
- テロップが話し出しからずれていないか
- 区間のつなぎ目に別のコマが1コマだけ混ざっていないか
1コマだけの混入は、要所のコマを見るだけでは見つかりません。編集部の動画では、区間の頭の1コマに別の映像が焼き込まれた不具合は、話し手が見つけました。検品で全区間の頭のコマを並べて見る手順は、この見落としから加えたものです。
AIでYouTubeのサムネイルを作る方法
サムネイルは、動画がクリックされるかを左右する画像です。画像生成AIを使えば、見出しの文字まで入った案を短時間で何枚も作れます。編集部がサムネイルを作る手順は、以下の3段階です。
- 人物の表情とポーズは写真から先に作っておく
- 見出しの文字ごと画像生成AIで複数案を作る
- 全案を原寸で見て文字と顔を確かめる
人物の表情とポーズは写真から先に作っておく
話し手が写るサムネイルでは、画像生成AIに表情やポーズを変えさせないことが大切です。画像生成AIに表情を変えさせると、顔立ちまで変わり、別人のように見えるからです。
編集部は、話し手の写真をMiniMaxの動画生成モデルH3の最初のコマとして渡し、腕組み・指差し・驚きなどの別ポーズの映像を作っています。映像から切り出したコマを17種類のポーズ一覧にまとめ、話し手が一覧から使うポーズを選びます。
一覧にあるポーズは作り直さず、次の動画でも使い回す運用です。写真から追加で作るのは、新しい表情が必要な回だけです。
見出しの文字ごと画像生成AIで複数案を作る
ポーズが決まったら、見出しの文字まで入った完成形のサムネイルを画像生成AIで作ります。編集部は選んだポーズ1つにつき10通りの構図を作り、色違いで済ませず、巨大な文字・斜めの分割・映画風などの構成で違いを出しています。
サムネイルを作るときに画像生成AIへ守らせる決まりは、以下のとおりです。
- スマートフォンの小さな画面で読める、極太で大きな日本語の見出し
- 文字の色は基本の1色と強調の1色まで
- 選んだポーズの顔・表情・角度を変えない
- 視線や指先が見出しの方向を向く位置に人物を置く
- 配信中の表示や架空の画面の文字、透かしを入れない
画像の生成には、ChatGPTのサブスクリプションの利用枠で動くCodexの画像生成機能を使い、既定では別料金のAPIを使っていません。画像生成AIの使い方や料金はGPT Image 2.5とはで解説しています。
全案を原寸で見て文字と顔を確かめる
画像生成AIが作ったサムネイルは、全案を原寸で開いて確かめます。画像生成AIの出力には、見出しの誤字や、2行で指定した見出しが3行に崩れる誤りが混ざることがあるためです。
編集部が全案で確かめる項目は、以下のとおりです。
- 見出しの文字を1字ずつ照合する
- 顔・表情・手指を元のポーズと比べる
- 文字が顔や指先を隠していないか見る
- 16:9の画面で文字が欠けていないか見る
確かめた全案は番号付きの一覧にまとめ、採用する案は話し手が選びます。AIに勝者を決めさせず、選ぶ判断は人に残す分担です。
AIで作ったYouTube動画を投稿するときの開示と収益化のルール
AIを使った動画をYouTubeに投稿するときは、AIの使用を開示するルールと、収益化の対象になる条件を確認します。YouTubeのヘルプで確認できる主なルールと投稿後の改善方法は、以下の4つです。
- リアルな人物や出来事をAIで作ったら「AIの使用」で開示する
- 台本・サムネイル・字幕へのAI利用は開示しなくてよい
- 量産型のコンテンツは収益化の対象外になる
- 投稿後はA/Bテストでサムネイルを比べる
リアルな人物や出来事をAIで作ったら「AIの使用」で開示する
YouTubeは、視聴者が本物と見間違えるようなAI生成・改変の動画に開示を求めています。開示が必要になるのは、次のような内容です。
- 実在の人物が、実際には言っていないことを言っているように見せる
- 実際の出来事や場所の映像を改変する
- 実際には起きていない場面を、現実のように見せる
開示は、YouTube Studioで動画をアップロードするときに「属性」の「AIの使用」で「はい」を選んで行います。写真のようにリアルな内容は動画プレーヤーに、写真のようにリアルでない内容やアニメーションは説明欄を開いたときに、ラベルが表示される場合があります。
開示を繰り返し怠った作り手は、YouTubeによるラベルの付与や動画の削除、YouTubeパートナープログラムの停止の対象です。YouTubeの生成AIツールで作った動画や、C2PAと呼ばれる来歴情報を含む動画には、YouTube側でラベルが自動で付く場合があります。YouTubeヘルプ(改変または合成されたコンテンツの開示)
台本・サムネイル・字幕へのAI利用は開示しなくてよい
制作を助ける目的のAI利用は、開示しなくてかまいません。YouTubeが開示の不要な例に挙げているものは、以下のとおりです。
- 構成案・台本・サムネイル・図表の作成や改善
- 字幕の作成
- 自分の声を複製したナレーションや吹き替え
- 美顔フィルターや色調整、背景のぼかし
- ユニコーンに乗る場面のような、明らかに非現実的な内容
編集部の1人語りの動画は、本人を撮影した映像に、AIで作ったテロップ・スライド・アニメを重ねる作り方です。AIの使い方の大半は、開示の不要な例と同じ種類の作業にあたります。迷う場合は、開示が必要な3つの内容に当たるかどうかを基準にしてください。YouTubeヘルプ(改変または合成されたコンテンツの開示)
量産型のコンテンツは収益化の対象外になる
AIを使った動画でも収益化はできますが、量産型と判断された動画は収益化の対象になりません。YouTubeは2025年7月15日、収益化ポリシーの「繰り返しの多いコンテンツ」を「量産型のコンテンツ」に改め、大量生産された内容が含まれることを明確にしました。
収益化ポリシーで認められない例と認められる例は、以下の表のとおりです。
| 認められない例 | 認められる例 |
|---|---|
| 作り手の見方を加えず、汎用的なテンプレートで量産したAI生成の動画 | 自分で考えたキャラクターと物語を、AIで映像にした動画 |
| 無関係なAIの映像をつなぎ合わせて、視聴者を驚かせるだけの動画 | 台本の編集や独自の背景映像の生成にAIを使った動画 |
| AIの「医師」が診断や健康の助言をする動画、AIの司会が投資の助言をする動画 | 同じオープニングとエンディングを使い、本編の中身は毎回違う動画 |
他の動画やネット上の素材を、独自の解説や大きな変更を加えずに使った動画も「再利用されたコンテンツ」として収益化の対象外です。AIに任せる範囲を広げるほど、話し手自身の経験や見方をどこに入れるかを先に決めておく必要があります。YouTubeヘルプ(チャンネル収益化ポリシー)
投稿後はA/Bテストでサムネイルを比べる
AIで複数のサムネイル案を作ったら、投稿後にYouTube Studioの「A/Bテスト」で比べられます。A/Bテストは、最大3つのタイトルやサムネイルを視聴者に出し分け、総再生時間が最も長かった案を選ぶ機能です。
A/Bテストの主な条件は、以下のとおりです。
- パソコン版のYouTube Studioで設定する
- 上級者向け機能を有効にしておく
- ショート動画は対象外
- テストは2週間以内に終わる
- 差がはっきりしない場合は、最初にアップロードした案が使われる
編集部は完成した動画をまず限定公開でアップロードし、サムネイルは1枚だけ付けて、残りの候補をA/Bテストで追加しています。概要欄の目次は、オープニングを差し込んだ後の完成版の時刻で作ります。編集前の時刻で目次を作ると、オープニングの長さの分だけ目次がずれるためです。
AIでYouTube動画を作るなら中身は人が決めて作業をAIに任せよう
AIでYouTube動画を作るときは、工程ごとにAIへ任せる範囲と人が決める範囲を分けることが大切です。編集部の1人語りの動画では、文字起こし・カット・テロップ・差し込み画像・書き出しをAIが担当し、話し手は話す項目・聞き取れない語・サムネイルの採用を決めています。
YouTubeへの開示が必要なのは、実在の人物や出来事を本物のように見せるAI生成・改変の動画です。台本・サムネイル・字幕にAIを使うだけなら開示は要りません。量産型のコンテンツは収益化の対象外なので、話し手自身の経験や見方を動画の中心に置きます。
AIでYouTube動画を作り始めるときの手順は、以下のとおりです。
- 話す項目を箇条書きで決め、AIに構成案を複数出させる
- 自分で話して収録し、文字起こしAIでテキストにする
- 無音カットとテロップをAIに任せ、テロップは1画面ずつ読んで確かめる
- 画像生成AIでサムネイルを複数案作り、原寸で確かめて選ぶ
- 開示が必要な内容かを確認し、限定公開で最終確認してから公開する
最初の1本は、手間が最もかかっている工程だけをAIに任せ、どれだけ時間が減るかを測ってみましょう。



