
AIと二人三脚でYouTube解説動画を作った
キャラクターが黒板の前で授業をするYouTubeの解説動画を、AI(Claude Code)と一緒に作りました。完成したのは15分18秒の動画です。Claude Codeの利用料とは別に、追加でかかった費用は0円で、声も絵も手元のMacだけで作っています。
この記事では、作った物の説明よりも、AIと一緒に作る中で何を決め、どこでつまずき、どう直したかを中心に書きます。その過程に、AIと物を作るときのコツが詰まっていると感じたからです。途中で何度も「思っていたのと違う」となり、そのたびに作り直しました。

何を作ったか
語り手は、このブログを書いている私、ルニ(フルネームはルニ・ランニブル)を絵と声にしたキャラクターです。黒板の前に立ち、スライドを1枚ずつ解説します。板書は話の進みに合わせて増え、節ごとに手描き風の図が描き足されます。
| 項目 | 中身 |
|---|---|
| 尺 | 15分18秒(最終版のv3) |
| スライド | 黒板風。要点を積み上げる板書と、節ごとの図 |
| 声 | ルニの声を複製し、全編を同じ声で読む |
| 動き | 口パク・瞬き・驚いた顔と嬉しい顔・お辞儀 |
| そのほか | 字幕(画面への焼き込みと、SRTという字幕ファイル)・BGM |
| 追加の費用 | 0円(有料のAPIは1回も使っていない) |
役割分担ははっきりしていました。私は、キャラクターの設定、声の選択、完成した動画を見ての指摘、そしてv3からは企画の確認を担当しました。Claude Codeは、仕組みの実装と、時間や音量などの測定、テストを担当しました。
出発点は、2分の試作
もともと私は、Obsidian(メモアプリ)に溜めたメモを「音声で聴ける台本」にまとめていました。これを動画にしたい、というのが始まりです。
最初の試作は、スライド5枚・2分6秒の動画でした。声はmacOSに最初から入っている読み上げ機能で、生成にかかった時間は22.5秒です。新しく入れた道具はffmpeg(動画を扱う無料の道具)だけでした。
品質は低いものの、「台本を渡せば1コマンドで動画になる」という通しの流れが、ここでできました。あとは、この流れの1つ1つを良くしていくだけです。
ルニを作る
次に、語り手のキャラクターを作りました。私が出した条件は「20代の女性・ランニングが好きで活発・アイスブルーの瞳・シルバーのロングポニーテール・細身のスーツ」です。絵は手元の画像生成(ComfyUI)で作りました。
ここでつまずきました。1回目の案はアニメ寄りすぎ、2回目に10案を作ると、10案すべてがスポーツウェアになったのです。指示文の先頭に「ランナーの体つき」という指定があり、それが服装の指定を打ち消していました。服装の指定を先頭に移し、スポーツウェアを除外してもう一度10案を作ると、今度は全員がスーツになりました。その中から8番を選んだのが、今のルニです。
声も同じように、10種類の候補を作って聞き比べ、4番の「やさしい先生」に決めました。ただ、声を毎回ゼロから作ると、呼ぶたびに少しずつ声が揺れることがあります。そこで、選んだ声を手本にして「同じ声で読ませる」声の複製を使い、115段落すべてを同じ声にそろえました。
測ってから速くし、動かす
最初の全編(18分28秒・v1)ができたところで、私は「作るのに時間がかかりすぎる」と伝えました。最初から作ると約44分かかり、直しを試すたびに待たされていたからです。
Claude Codeは、いきなり直さずに、まず工程ごとの時間を測りました。一番重いのは音声の生成(約32分)でした。そこで、音声を12段落ずつまとめて作るように変えました。12段落で試すと、音声の生成は約11.9倍速くなりました。ただ、全編を最初から作る時間は、約44分から25分14秒への短縮にとどまっています。測っている間、同じGPUを別のプログラムが使っていたためで、条件をそろえて測り直す予定です。一方、直した所だけを作り直す仕組みも入れたので、先頭2枚の試写なら約18秒で見られるようになりました。
また、立ち絵(キャラクターの止まった1枚絵)のままでは動きが乏しいので、他のYouTube動画を参考に、口パクと瞬きというシンプルな動作を取り込みました。
字幕・表情・画質
次の版(v2)では、字幕と表情、BGMを足しました。字幕は画面に焼き込み、YouTubeの字幕機能用のファイルも書き出します。表情は、台本の文の頭に「驚き」「嬉しい」の印を書くと、その文の間だけルニの表情が変わる仕組みです。ただ、完成版(v3)でも表情の切り替わりにはまだ違和感が残っているので、もう少し滑らかにしたいと考えています。
画質については、私が「時間がかかってもいいので、しっかり上げて」と頼みました。Claude Codeは、切り抜き・縮小・縁取り・圧縮・色のそれぞれで、どれだけ画質が落ちているかを1つずつ測ってから直しました。縮めたときにスーツに出ていた縞模様(モアレ)は96〜97%減り、黒板の色のずれ(ΔE2000という色の差の指標)も2.15から0.83になりました。

通しで見て、企画から作り直す
v2を通しで見て、私は3つの指摘をしました。
- BGMが聞こえない
- 専門用語(モノリスとマイクロサービス)の前置きが足りない
- 作り始める前に、企画を確認したかった
3つ目が一番大きな学びでした。台本を先に作り込んでしまうと、あとから「誰に向けた動画か」を変えるのが大変です。そこでv3は、企画書から作り直しました。対象者を「開発に関わり始めた人」と決め、全体像から入って細部へ進む3章の構成にし、用語は初めて出たところで説明することにしました。
あわせて、冒頭の「ルニ・ランニブルの授業」という題と決まった挨拶、お辞儀、最後の「いいねとチャンネル登録」とお辞儀を、毎回の決まりにしました。BGMは、声より23.4 LU(LUは耳の感じ方に合わせた音の大きさの単位)小さかったのを、3.2 LU小さいところまで上げて、聞こえるようにしました。
つまずいたこと3つ
ここで、印象に残ったつまずきを3つ挙げます。
- 動画が音声より11秒長くなった。 ffmpegの定番の書き方(
-shortest)で静止画と音声をつなぐと、区間ごとに約2秒ずつ映像が伸びていました。音声の長さを測って明示する形に変え、ずれは0.05秒になりました - 日本語が語の途中で折り返された。 スライドの文字が、単語の途中で改行されていました。ブラウザに「文節で折り返す」指定(
word-break: auto-phrase)を足して直りました - 瞬きが下から上だった。 私が見て「瞬きは上から下」と指摘しました。画像生成で作った部品は、下まぶたが上がって閉じる形になっていました。v3では、開いた目から上まぶたを下ろす形に作り直しています
どれも、作った側が「動いている」と思っていた所です。つまり、実際に見る・測るまで、問題は見えませんでした。
AIと一緒に作って分かったこと
振り返ると、AIと一緒に作るときに大事だと感じたことが3つあります。
- 企画を先に決める。 これは失敗から学びました。v2までは台本から作り始め、見終わってから企画を直すことになりました。AIは作るのが速い分、方向を間違えたまま遠くまで進みやすいと感じます。何を作るかは、人が先に決めて確認したほうが、結果的に速いと思います。人が決めることの意味は、次の節でもう少し掘り下げます
- 測ってから決める。 「遅い」「画質が悪い」を感覚のまま直すのではなく、どこがどれだけ悪いかを測ってから手を付けました。速さでは、一番時間のかかっていた音声から手を付けられました
- 指摘を言葉で残す。 私の指摘は、次の動画でも同じことを言わずに済むよう、手順の決まりとして残しています
さらに、私の指摘の言葉と、それで何を直したかを、1回の見直しごとに記録として残す仕組みを、動画づくりの手順に組み込みました。動画が3本たまるごとに記録を読み返し、繰り返し出た指摘だけを決まりにしていく予定です。
それでも自分でやる意味
多くのことには、すでに先駆者がいます。AIで動画を作る方法も、ソフトウェア設計の解説も、探せば情報は世の中にあふれています。だから正直に書くと、「これを本当に自分がやる意味はあるのだろうか」という思いは、いつも頭のどこかにあります。
それでも、自分が成長していくためには、得た知識を自分なりに咀嚼し、自分の置かれた状況に合わせて試して、経験を積むことが必要だと思っています。さらに、それを公開すれば、ほかの人の参考になる知識として届けられます。そう考えると、「自分がやる意味はあるのか」という思いは、打ち消せるはずです。
そこで大事になるのが、「自分は何をしたいのか」という部分だと思っています。人としての意思や発想、好みといった、いわば生き物らしさの部分です。企画を先に決めるのは、この「何をしたいのか」を最初に言葉にすることでもあると感じています。
この部分を磨くには、自分との対話を続けていく必要があると考えています。
これは人それぞれなので、1つの参考として見ていただければと思います。
動画の公開について
完成した動画は、これからYouTubeに投稿します。投稿したら、この記事にも動画を載せる予定です。