AIだけでショート動画広告を作る方法|人物・音声まで生成する手順と注意点

商品のショート動画広告を出したくても、出演者を探して撮影し、何パターンも撮り分ける手間と費用が壁になります。人物・声・映像をすべてAIで作れば撮影は要りませんが、AIに任せきりにすると、売れる構成になっていない動画や、広告のルールに合わない動画ができあがります。
差が出るのは生成AIの性能より、作る順番とAIを使ってはいけない場面の見極めです。この記事では、編集部がヘアシャンプーの広告を撮影なしで作った実例をもとに、売れている広告の分析から台本・音声・映像・テロップまでの手順と、広告に使うときの注意点を解説します。記事を読めば、型の違う広告を何本も試す準備が整います。AIだけの広告づくりは、安い音声で台本と声を固めてから映像を作り、型の違う広告を並べて当たりを探すのが近道です。
AIだけでショート動画広告を作る流れと費用
撮影をせずにショート動画広告を作るには、人物・声・映像をそれぞれAIで作り、最後に編集でつなぎます。全体の流れと費用の目安は、以下の3点です。
- 撮影なしで広告を作る6つの工程
- 音声は1本約1.5円、動画の素材は1本約120円
- TikTokの無料ツールで作る方法もある
撮影なしで広告を作る6つの工程
編集部は2026年8月、ヘアシャンプーのショート動画広告(縦9:16・10〜25秒)を、人物・音声・映像のすべてをAIで生成して作りました。
編集部が通した工程は、次の6つです。
- 売れている広告を集めて分析し、広告の型を選ぶ
- 選んだ型に沿って台本を書く
- AI音声で台本を読ませ、声と読み方を決める
- 動画生成AIで人物や商品の映像を作る
- 映像を短く詰めてつなぎ、AI音声を乗せる
- テロップを入れて書き出す
各工程で使った道具は、以下の表のとおりです。
| 工程 | 使った道具 | 役割 |
|---|---|---|
| 映像の素材 | MiniMax H3 | 人物・商品・場面の映像を生成する |
| 音声 | ElevenLabs | 台本をAI音声で読み上げる |
| 編集・テロップ | ffmpeg | カットをつなぎ、音声とテロップを重ねる |
ffmpegは、動画や音声の変換・結合・加工ができるオープンソースのソフトで、LGPL 2.1以降のライセンスで公開されています。FFmpegの概要、FFmpegのライセンス
編集部は、分析から書き出しまでの作業をClaude Codeに指示して進めました。Claude Codeに動画の編集作業を任せる方法は、Claude Codeで動画編集を自動化する方法で解説しています。
音声は1本約1.5円、動画の素材は1本約120円
編集部の実績では、AI音声の生成は1本約1.5円、動画生成AIの素材は1本約120円でした。音声の費用は、動画の約80分の1にあたります。
費用の差から決まる進め方は、台本と声を音声だけで固めてから動画を作る順番です。動画を作りながら台詞を直すと、直すたびに約120円の素材を作り直すことになります。
2026年10月1日時点の公式の料金は、以下の表のとおりです。
| サービスとモデル | 料金 |
|---|---|
| MiniMax H3(768P) | 動画1秒あたり0.08ドル |
| MiniMax H3(2K) | 動画1秒あたり0.13ドル |
| ElevenLabs Eleven v3(API) | 1,000文字あたり0.08ドル |
| ElevenLabs Eleven v3 Conversational(API) | 1,000文字あたり0.04ドル |
MiniMaxの従量課金の料金、ElevenLabsのAPI料金
ElevenLabsの無料プランは商用ライセンスを含まないため、広告には使えません。商用ライセンスは有料プランに含まれ、最も安いStarterプランは月額6ドルです。ElevenLabsの料金プラン、ElevenLabsの商用利用の案内
TikTokの無料ツールで作る方法もある
TikTokの広告主向けには、無料の生成AIツール「Symphony Creative Studio」があります。Symphony Creative Studioの主な機能は、以下のとおりです。
- TikTok向けの動画クリップの生成
- 台本を読み上げるナレーター型のアバター動画
- 商品の画像から、アバターが商品を紹介する動画
- 動画の多言語への吹き替え
手早く1本作るなら、公式ツールが近道です。売れている広告の型を自分で選んで作り込むなら、道具を工程ごとに分けて使う方法が向いています。
売れているショート動画広告を分析して広告の型を決める
AIで広告を作るときに最初に決めるのは、映像の中身ではなく広告の型です。型を決める手順で押さえたい点は、以下の3つです。
- 売れている広告32本の分析で分かったこと
- 冒頭は対象者の名指しが最も強い
- 広告の型は商品の実際の売られ方に合わせて選ぶ
売れている広告32本の分析で分かったこと
編集部は、売上が10万〜1,000万円と確認できたTikTokの商品広告32本について、長さとカットの切り替えを測り、全コマを目で確認しました。分析の結果は、以下の表のとおりです。
| 項目 | 分かったこと |
|---|---|
| カットの長さ | 中央値2.25秒。32本中20本が2.5秒未満 |
| テロップ | 文字が1つもない広告が3本(うち1本は全編AI生成) |
| 構成 | 高速モンタージュ・無音・静止画とスクリーンショット・問題提起から解決・VLOGの5つの型 |
| 冒頭(フック) | 6種類に集約 |
| 価格の見せ方 | 20秒未満は冒頭か出しっぱなし、24秒以上は終盤。2回出す広告が最多 |
| 購入への誘導 | リンクの位置を言葉で示す |
| 信頼の作り方 | 第三者が自分で違いに気づく場面が最も強く、次に物理的な実験 |
| 本数 | 1商品で何本も配信。美顔器1商品で5本、どれもトーンが違う |
ショート動画広告は、完璧な1本を作る競技ではありません。同じ商品・同じ条件で、場所も人物も編集のテンポも違う動画を並行して配信し、反応の良い型を伸ばす進め方が中心です。出演者を集めて5パターン撮り分ける費用がほとんどかからない分、AI生成は構造的に有利です。
冒頭は対象者の名指しが最も強い
32本の冒頭は6種類に集約でき、最も強かったのは「〜で悩んでる人一旦集合」のように対象者を名指しする型です。名指しの冒頭は、商品を必要とする人に、自分に向けた広告だと気づかせます。
購入への誘導にも共通点がありました。「左下の黄色いカバンをタップ」のように、画面のどこを押せばよいかを言葉で示す広告が売れていた広告の特徴です。
広告の型は商品の実際の売られ方に合わせて選ぶ
分析で強かった型でも、その商品の事実と合わなければ広告には使えません。編集部は当初、ドラッグストアの棚から商品を手に取る場面を入れようとしました。実績の広告にあった強い型でしたが、今回の商品が店頭に並んでいるかを確認できていなかったため、採用を見送っています。商品が届く配送箱の場面も、同じ理由で使っていません。
型を当てはめる前に確かめる商品の事実は、以下のとおりです。
- 商品がどこで売られているか
- 商品がどのように届くか
- パッケージの見た目
確認していない場面を映像にすると、広告の中に事実と違う描写が入ります。AIは存在しない場面も作れてしまうため、撮影する場合よりも事前の確認が重要です。
ショート動画広告の台本とAI音声を作る
台本とAI音声は、動画より先に仕上げる工程です。音声は動画の約80分の1の費用で、何度でも作り直せます。台本と音声の作り方は、以下の3つです。
- 台詞は売れている広告の言い回しから引く
- 台本は手元にある映像だけで書く
- 声は読み方だけを比べて先に固める
台詞は売れている広告の言い回しから引く
台詞は自分で作文せず、分析した広告で実際に使われていた言い回しから選びます。編集部が最初に作文した台詞は、売れている広告に1本も出てこない書き言葉の報告調でした。
分析した32本に見られた話し言葉の特徴は、以下のとおりです。
- 「〜んだけど」で次の文へつなぐ
- 驚きは「やばい」「これはすごいな」のような感嘆と言い切りで表す
- 「〜すごくない?」と視聴者に問いかける
- 効果よりも「出る前に慌てなくなった」のような生活の変化を話す
「〜んだ、と思って」のような報告調や「〜の。」で閉じる話し方は、32本に1回も出てきませんでした。
台本を書き終えたら、分析で選んだ型の要素と台本を1行ずつ照らし合わせます。良さそうな台詞を先に書いて後から理由を探すと、根拠のない行が台本に残るためです。
台本は手元にある映像だけで書く
台本には、実際に用意できる映像の内容だけを書きます。映像にない場面を台詞で話すと、声と画面が食い違い、見る人に違和感を与えるからです。
編集部も、映像のない場面を台詞にしてしまう失敗を2回しています。動画生成AIで作れない場面を台本に入れると、声に合う映像を後から用意できません。台本を書く前に、作れる映像と作れない映像を分けておくと手戻りが減ります。
声は読み方だけを比べて先に固める
AI音声は、同じ台本で読み方だけを変えたテイクを何本か作り、聞き比べて決めます。台本の良し悪しは読めば判断できますが、読み方は聞かないと判断できないためです。
ElevenLabsでは同じ設定でも生成のたびに読み方が変わったため、本命の設定では複数のテイクを作りました。編集部の契約プランでは、同時に作れる音声は3本まででした。
声だけで決めきれないときは、映像に乗せてから聞き比べます。声だけで聞いた印象と、映像と一緒に聞いた印象は別物です。
動画生成AIでショート動画広告の人物と映像を作る
編集部は、映像の素材をMiniMax H3で作りました。動画生成AIの種類と選び方は、動画生成AIのおすすめで比較しています。素材づくりで押さえたい点は、以下の4つです。
- MiniMax H3で作れる動画の長さと形
- プロンプトは世の中にある動作だけで書く
- 動画生成AIが作れなかった映像
- 生成した素材は全コマを並べて検品する
MiniMax H3で作れる動画の長さと形
MiniMax H3は、MiniMaxが提供する動画生成AIのモデルです。MiniMaxの動画生成サービス「Hailuo AI」でも、H3が使われています。Hailuo AI
MiniMax H3のAPIで作れる動画の仕様は、以下の表のとおりです。
| 項目 | MiniMax H3の仕様 |
|---|---|
| 動画の長さ | 4〜15秒(1秒単位) |
| 解像度 | 768P・2K |
| 縦横比 | 9:16を含む一般的な比率(幅と高さの比が2:5〜5:2の範囲) |
| 参照画像 | 最大9枚 |
| 参照音声 | 最大3本、1本2〜15秒、合計15秒以内 |
商品の写真を参照画像として渡すと、実物の商品を映像に登場させられます。ただし、商品の写真は商品が映るカットにだけ渡します。商品の写真を渡したカットでは、商品が映らないはずの場面にも商品が勝手に置かれたためです。
プロンプトは世の中にある動作だけで書く
動画生成AIへの指示(プロンプト)には、実際に撮影された映像が世の中にある動作だけを書きます。編集部が効果を確かめたプロンプトの書き方は、以下のとおりです。
- 「傷んだ」などの状態ではなく、「押さえると跳ね返る」のような動作と輪郭で書く
- 動きを止めたいときは「持ち上げない」のように否定形で書く
- 服・場所・時間帯を変えたいときは明示する
- 手が映るカットは、参照写真と同じ肌の色・指・爪を指定する
- 腕が増えないよう、腕と手は2本ずつと指定する
- 末尾に、文字・字幕・透かしを入れない指示を付ける
動画生成AIが作れなかった映像
動画生成AIは、世の中にほとんど存在しない映像をうまく作れません。編集部が作れなかった映像は、以下の3つです。
- 髪に置いた櫛が、手を離すと落ちる実験
- 傷んでパサついた髪
- 顔と同じ肌の色の手
櫛の実験は、寄りと引きの2本で試して両方とも失敗しました。どちらも普通に髪をとかす動きになり、手が櫛から離れません。櫛が手から離れて落ちる映像は世の中にほとんどなく、モデルが学習していないと考えられます。
傷んだ髪は「パサついた毛先」と指定しても、健康な髪しか出てきませんでした。手の肌の色は顔とそろわず、後から色を補正しています。測ってみると手の色は濃いのではなく暗くて青いことが多く、明るくして暖色に寄せると顔とそろいました。
作れた映像は、寝起きの髪・濡れ髪・流水で泡が崩れるすすぎ・後ろ姿・夜の暗い部屋・売り場の棚・鏡越し・屋外の歩き・泡立て・髪を払って揺れる動きなどです。商品の良さを示す場面は、「その映像は世の中にあるか」を確かめてから選びます。
生成した素材は全コマを並べて検品する
生成した素材は、抜き取りではなく全コマを並べて目で確認します。編集部は、1秒あたり5コマを縮小して1枚の画像に並べ、腕の本数や手の色の崩れを確かめました。
数値が直感と食い違ったときは、先に測り方を確かめます。編集部も、カットの数を数える設定の誤りで、全部の動画を0カットと集計したまま結論を出したことがあります。
カット編集とテロップでショート動画広告に仕上げる
素材とAI音声がそろったら、編集で広告の長さとテンポに仕上げます。仕上げの工程で押さえたい点は、以下の4つです。
- 4秒の素材を1〜2秒台に詰めてつなぐ
- カットの切り替えは声の位置に合わせる
- テロップはキーワードだけ色を変える
- 型の違う広告を何本も作って比べる
4秒の素材を1〜2秒台に詰めてつなぐ
MiniMax H3で作れる最短の動画は4秒なので、4秒で作った素材から使う部分を切り出し、1〜2秒台に詰めてつなぎます。
同じ台本でも、選んだ声によって読み終わるまでの長さは12〜16秒とばらつきました。編集部は、音声の長さに合わせて各カットの長さを比例で配分しています。
切り出す開始位置と長さの合計が、素材の長さを超えていないかも確認します。超えると映像が音声より短くなり、最後の台詞が途中で切れるからです。
口の動きと声を合わせる作業(リップシンク)は、ほとんどのカットで不要です。売れている広告の高速モンタージュ型も、口の動きは声と合っていませんでした。顔が大きく映って明らかに話しているカットだけ、参照音声を渡して合わせる価値があります。
カットの切り替えは声の位置に合わせる
カットを切り替える位置は、勘ではなくAI音声の実際の区切りに合わせます。編集部は、ffmpegの無音検出(silencedetect)で声が途切れる位置を測り、その位置でカットを切り替えました。FFmpegのフィルター一覧
テロップはキーワードだけ色を変える
テロップは文全体を色付けせず、キーワードだけ色を変えます。売れている広告では、「200円台」「左下」のような価格とボタンの位置の言葉だけが黄色でした。
テロップの書式は、広告の型ごとに変えます。すべての型に同じ書式を貼ると、型を分けて作った意味が薄れるためです。幅720ピクセルの縦動画では、標準のテロップを1行15字までに収めました。
TikTokの縦型広告は、9:16の比率なら540×960ピクセル以上で入稿できます。画面の端はボタンや広告文と重なるため、文字の位置はTikTokが配布するセーフゾーンのテンプレートで確かめるのが確実です。TikTokのインフィード広告の仕様
化粧品の広告では、注意書きのテロップも入れます。売れていた化粧品の広告は、使用前後や効果を示す場面の直下に、本文の3分の1ほどの大きさで注意書きを入れていました。
型の違う広告を何本も作って比べる
1本の完成度を上げるより、型の違う2本目を作る方が、配信して得られる情報は増えます。ただし、台詞と順番を入れ替えただけの動画は別の型になりません。
編集部は最初、12カットの順番と台詞を変えて5つの型を作ったつもりでいました。実際には場所が3つ・服が1着・時間帯はほぼ昼だけで、5本とも同じ素材の並べ替えでした。
別のパターンと呼べるかは、以下の要素のうちいくつが実際に変わったかで判断します。
- 場所
- 服
- 時間帯
- 人物や商品の状態
素材を足せば必ず良くなるわけでもありません。新しい素材を作って4つの型を組み直そうとしたとき、直す意味があったのは2つだけでした。台本に隙がなければ新しい素材を入れる場所はなく、型によっては訴求が薄まります。
AI生成の人物・音声を広告に使うときの注意点
AIで作った人物や声を広告に使うと、広告媒体のルールと日本の法律の両方が関わります。2026年10月1日時点で公式に確認できた注意点は、以下の4つです。
- TikTok広告はAI生成コンテンツの開示が必要
- YouTube・Google広告とMetaのAI表示のルール
- 景品表示法とステマ規制に触れる見せ方を避ける
- 化粧品の広告は表現できる効能の範囲が決まっている
TikTok広告はAI生成コンテンツの開示が必要
TikTok広告では、AIで完全に生成した画像・動画・音声や、AIで大きく加工した素材を含む広告に、AI生成コンテンツの開示が必要です。開示の方法は、広告マネージャーのAI生成コンテンツの表示設定を使うか、独自の注記・字幕・透かし・スタンプを入れるかのどちらかです。
TikTokの表示設定を使うと、インフィード広告の動画の下部に、AI生成コンテンツを含むことを示す文字のラベルが広告の再生中ずっと表示されます。開示していないAI生成コンテンツが見つかった広告は、却下されるか配信を制限されます。
照明・明るさ・色の調整、背景の除去、ノイズの除去のような軽い編集は、開示の対象外です。公人の顔や声を本人の許可なく使うことは、AIかどうかにかかわらず禁止されています。TikTokの誤解を招く虚偽のコンテンツに関するポリシー、TikTok広告マネージャーの免責事項
YouTube・Google広告とMetaのAI表示のルール
Google広告では、2026年7月から、AIで生成・編集した画像や動画の広告に、広告の中へ表示を入れるか「AIラベル」の設定を使えるようになりました。EU・インド・米国ニューヨーク州などで、AIで生成・編集した広告に表示を求める規制があることへの対応です。選挙広告は、合成・改変したコンテンツを含む場合の開示が引き続き必要です。日本の一般の商品広告に表示を義務付ける記載は、確認した公式ページにはありません。Google広告のAIラベルの更新
広告ではなく通常の動画としてYouTubeに投稿する場合は、現実と見分けにくい人物や場面をAIで作ったときに投稿者の開示が必要です。実在の人が言っていないことを言うように見せる映像や、実際には起きていない場面をリアルに作った映像が該当します。YouTubeの改変・合成コンテンツの開示
Metaの広告では、Metaの生成AI機能で作成・大きく編集した画像や動画に「AI情報」のラベルが付きます。AIで生成した写真のようにリアルな人物が含まれる場合、ラベルの位置は「広告」の表示の横です。社会問題・選挙・政治に関する広告では、画像・動画・音声をデジタルで作成・改変したかどうかの開示が義務です。Metaの広告のAI表示、Metaの生成AIの透明性に関する発表
媒体ごとに基準が違うため、AIで生成した人物や声を使う広告は、どの媒体でもAI生成と分かる表示を入れる運用にすると判断を誤りにくくなります。
景品表示法とステマ規制に触れる見せ方を避ける
AIで作った人物に商品の感想を話させる広告は、見せ方によって景品表示法の問題になります。
2023年10月1日から、広告であるのに広告であることを隠す表示(ステルスマーケティング)は景品表示法違反になりました。規制の対象は広告主で、企業が第三者に依頼・指示した投稿も広告主の広告として扱われます。AIの人物の感想動画を、広告主の投稿だと分からない形で流すと、消費者が第三者の感想と誤認する表示にあたるおそれがあります。消費者庁のステルスマーケティング規制
優良誤認表示は、商品の品質などを実際のものより著しく優良と示す表示です。AIの人物に商品で実際には得られない効果を話させると、優良誤認表示にあたるおそれがあります。消費者庁は表示の裏付けとなる合理的な根拠を示す資料の提出を求めることができ、資料を出せない場合、その表示は措置命令との関係で不当表示とみなされます。消費者庁の優良誤認表示の解説
化粧品の広告は表現できる効能の範囲が決まっている
シャンプーのような化粧品の広告で表現できる効能は、厚生労働省の通知で56項目に定められています。頭皮と毛髪に関する項目の例は、「頭皮、毛髪を清浄にする」「毛髪にはり、こしを与える」などです。化粧品の効能の範囲の改正について(厚生労働省)
AIの人物は、指示すれば範囲を超えた効果も話してしまいます。台詞の表現は成分の事実と使った感想の範囲にとどめ、公開前に法務や専門家の確認を受けます。
本人の信用で売る商品はAIの人物で広告を作らない
AIだけで作る方法が向いているのは、出演者の顔や声が商品の信用に関わらない商品です。Touch AIが2026年8月に作った講座の告知広告では、あえて人物をAIで生成しませんでした。
Touch AIは講師本人の信用で講座を販売しています。実在しない受講者の体験談をAIで作ると、実績の捏造になると判断しました。
完成した広告は、講師がYouTube動画で実際に話した4つの発言をつなぎ、最後に講座名と日時を載せた無音のカードを置いた22.8秒の縦動画(1080×1920)です。台詞は1文字も作文していません。
広告の型には、実績広告の分析で最も強かった対象者の名指しを選びました。冒頭の発言が「間違った使い方をしている人が多い」だったため、テロップは「その使い方 間違ってます」に寄せています。
作る途中では、テロップを焼き込んだ完成版の動画から発言を切り出したため、新しいテロップと古いテロップが二重に重なりました。テロップを入れる前の元の動画から切り出し直して、テロップの二重表示を解消しています。元の動画の文字起こしは表記が整っていたため、誤りの修正もほとんど要りませんでした。元になるYouTube動画を台本から投稿まで作る工程は、AIでYouTube動画を作る方法で解説しています。
AIだけで作るショート動画広告は安い工程から固めて何本も試す
AIだけで作るショート動画広告は、撮影や録音が要らず、場所や人物を変えた広告を少ない費用で何本も作れます。編集部の実績では、AI音声1本が約1.5円、動画の素材1本が約120円でした。
失敗を減らす進め方は、以下の順番です。
- 売れている広告を分析して型を選び、商品の事実と合うか確かめる
- 台詞は分析で見つけた言い回しから引き、手元の映像だけで台本を書く
- AI音声で読み方を比べ、台本と声を先に固める
- 動画生成AIで世の中にある動作だけを素材にし、全コマを検品する
- 声の区切りに合わせてカットを詰め、キーワードだけ色を変えたテロップを入れる
- AI生成と分かる表示を入れ、効果の表現が法律の範囲に収まっているか確かめる
本人の信用で売る商品や、実在の利用者の声が必要な場面では、人物をAIで作らない判断も必要です。まずは1つの商品で型の違う広告を2本作り、配信して反応を比べてみましょう。



