AIショート動画の作り方

ロボット猫の
おつかい動画を作ろう

このページでは、GPTsと動画生成ツールを使ってショート動画を作る手順を解説します。音声入力で企画を出し、画像を作り、シーンごとに動画を生成し、動画編集ソフトで仕上げるまでの流れを紹介します。実際のGPTとのやり取りも確認できます。

クリックで音あり再生できます

チュートリアル動画

Seedance 2.0 MiniでAI動画を作る流れを、ロボット猫のおつかい動画を題材に実演解説しています。

実際のGPTとのやり取り

この先の手順を始める前に、まずは実際のGPTとのやり取りを確認してください。
何をどう作り、どう直したかを先に見ておくと、手順をスムーズに進めやすくなります。

動画を作る流れ

音声入力で作りたい動画を伝える

「小さくて可愛いロボット猫が、はじめてのおつかいに行く動画を作成したい」などから始め、最初の段階でできるだけ作りたいものの概要を伝えきりましょう。概要を伝えると、GPTsが動画の構成シートを作成します。中身を確認し、意図と違うものがあれば変更依頼を出します。

企画構成GPTsを開く

動画の構成シートを保存する

構成シートをダウンロードし、今回のプロジェクトフォルダに保存します。動画の素材は同じフォルダに分かりやすく管理していきましょう。

画像をまとめて作るプロンプトを用意する

企画構成GPTsに、「画像のバッチプロンプトをください」などと伝え、必要な画像をまとめて作るためのプロンプトをコピーします。

GPT Image 2で画像を作る

新しいChatGPTのチャットを開き、画像生成をオンにします。03でコピーしたプロンプトを使用し、画像を生成します。

作った画像をZIPにまとめる

画像が生成されたら、そのまま続けて「作った画像をアセット名でリネームして、ZIPにまとめて」と送ります。できたZIPをダウンロードして、プロジェクトフォルダに保存します。

シーンごとに動画プロンプトを作る

企画構成GPTsに戻り、「シーン01の動画プロンプトを作って。Litvideoを使用」などと伝えます。ツールによって選べる秒数が違うため、使う動画生成ツール名をセットで伝えます。

動画を作る前にプロンプトを見る

企画構成GPTsから英語プロンプトと日本語訳の2つが出ます。日本語訳を読んで、動きの指定や秒数に問題がないか確認します。

動画生成ツールで動画を生成する

英語プロンプトと参照画像を使用し、動画を生成します。各プラットフォームのUIで、秒数やアスペクト比、画質等の設定をします。クレジットを消費するので、間違いがないかダブルチェックを心がけましょう。練習用にはSeedance 2.0 Mini の480Pをおすすめします。

動画を作り、気になる部分を直す

できた動画が思ったものと違う時は、気になったところを企画構成GPTsに伝えてプロンプトを作り直します。動きが多すぎてうまくいかない場合は、「シーンを分割して」と伝え、短いクリップに分けましょう。

CapCutやDaVinciで仕上げる

シーンごとに生成したクリップを動画編集ソフトに読み込み、順番につないでいきます。うまくいかなかったクリップも、使える部分だけ切り出せば素材にできます。一通りつながったら、トランジション、フィルター、エフェクト、BGMで仕上げます。編集で迷ったら、編集質問GPTsに聞いてください。

CapCut編集動画

CapCutでAI動画クリップを1本に仕上げるための編集基礎を、実際の制作画面で解説しています。

動画生成前のチェックリスト

  • 日本語訳プロンプトを読んで、動きの指定に抜けがないか見る
  • 秒数が動画生成ツールで選べるか見る
  • 使う画像の順番を確認し、指定通りにアップロードする
  • キャラ固定が必要なシーンにキャラシートが入っているか見る

動画生成ツールごとの秒数

動画の秒数はシーンごとに決めます。
企画構成GPTsに使うツール名を伝えると、そのツールの秒数に合わせてプロンプトを作ります。

CapCut

5 / 10 / 12 / 15秒

CapCutは4つの選択肢から選択できます。

Dreamina / Litvideo / Higgsfield

1秒単位

3つとも4〜15秒の1秒単位で選べます。

Grok Imagine

6 / 10秒

Grok Imagineは、6秒と10秒の二択です。

この動画で使った画像

この動画で使った画像です。
キャラクター、背景、小物を分けて作っています。

ロボット猫の3面図
char_riko_3view.png
朝のロボット猫の部屋
space_riko_room_morning.png
おつかいメモ
prop_errand_note.png
メモに気づくロボット猫の開始フレーム
frame_riko_notice_note_start.png
明るい街の通り
space_bright_street.png
お店のカウンター
space_friendly_shop_counter.png
お店の商品パッケージ
prop_shop_package.png
ベッドで眠るロボット猫の開始フレーム
frame_riko_sleeping_bed_start.png

作った動画クリップ

Scene 01は動きを詰めすぎたため、起きる位置とメモの場所が安定しませんでした。
そのため、Scene 01Aと01Bに分けて、動きを別々に作りました。

Scene 01 初回起床とメモ確認を1本に入れた版
Scene 01A 初回体が崩れた版
Scene 01Aベッドで目を覚ます
Scene 01B机のメモに気づく
Scene 02街を歩いてお店へ
Scene 03商品を受け取る

うまくいかなかった点と直し方

1本に入れる動きが
多かった

シーン1の一度目の生成では、起床とメモ確認の二つの動きを行わせ、起きる位置がベッドの外になり、メモが動くというエラーが出ました。そのため、起床とメモのシーンを分割し、安定化を図りました。(動画一覧のScene 01 初回参照)

ロボ猫の体が変わった

寝ている画像だけを参照し動画を生成すると、起き上がったときの体は参照にありません。そのため、AIが勝手に体を創造してしまいました。対策として、動画生成時にキャラの三面図(体が写ったもの)を参照させ、キャラの容姿がぶれないようにしました。(動画一覧のScene 01A 初回参照)

秒数が合わなかった

AIに対し、こちらから3秒案を提案しましたが、Litvideoでは4秒より下の秒数を選べませんでした。実際のUIを確認し、プロンプトを4秒構成に修正しました。

プロンプト見本

実際に使用したScene 01A / 01Bのプロンプトです。

プロンプト内の @image1 @image2 は、動画生成ツールにアップロードした画像の順番を指します。1枚目にアップロードした画像が @image1、2枚目が @image2 です。企画構成GPTsが出力するアップロード順通りに画像をセットしてください。順番が違うと意図と異なる参照になります。

Scene 01A:ベッドで目を覚ます

使う画像 @image1: char_riko_3view.png  @image2: frame_riko_sleeping_bed_start.png

秒数 4秒(Litvideo想定・最低4秒)

English Video Prompt

[0-1s] Start from @image2 (Riko sleeping on the bed in the morning room), completely still and peaceful, with identity, proportions, colors, and robot cat design preserved from @image1 (Riko character sheet). Soft morning light fills the room. Camera fixed.
[1-2.5s] Riko’s eye lights slowly turn on, her ears make a tiny mechanical twitch, and her body gently shifts on the bed.
[2.5-4s] Riko lifts her head slightly while still on the bed, looking sleepy but curious. Camera adds a very subtle slow push-in. Preserve @image1 identity and @image2 composition, bed position, and room layout. Do not move Riko off the bed. Avoid jitter, bent limbs, identity drift, temporal flicker, chaotic composition. No background music, no BGM. Sound effects and ambient sound are kept. No dialogue.
Scene 01B:机の上のメモに気づく

使う画像 @image1: frame_riko_notice_note_start.png  @image2: prop_errand_note.png

秒数 4秒(Litvideo想定・最低4秒)

English Video Prompt

[0-1s] Start from @image1 (Riko in the room noticing the note on the low table), with @image2 (the small errand note) staying flat and still on the table. Camera fixed.
[1-2.5s] Riko tilts her head gently, her eye lights brighten with curiosity, and she leans slightly toward the table without touching the note.
[2.5-4s] Riko steps or leans a little closer and looks carefully at the note, but the note remains in the exact same place on the tabletop. Preserve @image1 spatial relationship and @image2 paper shape. Do not let the note slide, jump, float, rotate, or change size. Avoid jitter, bent limbs, identity drift, temporal flicker, chaotic composition. No background music, no BGM. Sound effects and ambient sound are kept. No dialogue.

迷ったら2つのGPTsに聞きましょう

総合ナレッジGPTs

制作途中の迷いや判断をその場で確認できます。企画・画像・動画プロンプト・編集まで工程別に対応します。

総合ナレッジGPTsを開く

編集質問GPTs

CapCut / DaVinci Resolveの編集手順を確認できます。
カット・音量・書き出しまで対応します。

編集質問GPTsを開く
こちらのノウハウは読み込ませていますが、AIのため100%正しい回答をするとは限りません。
あらかじめご了承ください。
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる
画像の外側をクリックで閉じる