当サイトではアフィリエイトプログラムを利用して商品を紹介しています。掲載リンクからご購入いただいた場合、当サイトに報酬が発生することがあります。

AIショート動画で副業する手順|台本→音声→字幕を無料ツールで自動化する【2026年9月時点】

スマートフォンを縦に構えて短い動画を確認している手元

「ショート動画をAIで作って副業にしたい」と調べると、台本も音声も映像もAIに任せて量産する、という手順がたくさん出てきます。実際、道具はそろっています。台本の読み上げも、シーンごとの画像も、字幕の焼き込みも、お金をかけずに自動化できます。

ただ、そこで作ったものがそのまま収入になるかというと、話は別です。YouTubeは2025年7月15日に収益化ポリシーを更新して、量産型のコンテンツを収益化の対象外だとあらためて明示しました。テンプレートに流し込んだだけのAI生成動画は、何本作っても広告収入にはつながりません。

この記事では、実際に動いている自動化の手順をそのまま書きます。そのうえで、自動化していいのは「作業」であって「量産」ではないという線引きを最初に置きます。1本あたりの手作業を減らして、空いた時間を台本に戻す。そこまでがセットです。

うまくいく部分だけでなく、画像が1枚も取れずに待ち時間だけが過ぎる形や、同じ場所で何度も止まる原因も書きます。

※本記事の各サービスの仕様・料金・規約は公式ページで確認したものです。特に生成AI関連は改定が速いため、実際に使う前にご自身で最新の内容をご確認ください。


最初に確認しておきたい、YouTubeの収益化ポリシー

手順に入る前に、ここだけは先に押さえておいたほうがいい話があります。作り方を決めてしまってから知ると、作り直しになるからです。

「量産型」は収益化の対象外だと明記されている

YouTubeのチャンネル収益化ポリシーには、収益化が認められないコンテンツとして次のように書かれています。

教育的価値、解説、ナレーションが不十分な、類似した内容や繰り返しの多いコンテンツ

クリエイターならではの、率直な洞察や視点が追加されておらず、汎用的または独創性のないテンプレートを使用して作成され、大量生産されたような印象を与えるAI生成コンテンツ

出典: YouTube のチャンネル収益化ポリシー(2025年7月15日に「量産型のコンテンツ」に関するポリシーを更新)

読み飛ばしそうになりますが、後半がこの記事の前提です。「汎用的なテンプレートで作った」「大量生産された印象を与える」の2つが揃うと、AI生成であることそのものより先に、そこで落ちます。

同じページには、認められる例も書かれています。

自分で考案したユニークなキャラクターや物語を、AIを使用して視覚化するなど、独自のクリエイティブな表現がなされているコンテンツ

つまり、AIを使うこと自体は問題にされていません。企画と語りを自分で書いて、視覚化と読み上げをAIに任せる。この形なら土俵には乗ります。逆に、ニュースやまとめを機械的に流し込んで1日10本出す、という作り方は、自動化の完成度をどれだけ上げても行き止まりです。

作り方の分かれ目

工程 収益化の対象外になりやすい作り方 土俵に乗る作り方
台本 他所の記事やニュースをAIに要約させてそのまま使う 自分で調べて、自分の見方を入れて書く
ナレーション 台本を読み上げただけ 読み上げでも、内容に解説や視点がある
映像 汎用の素材やテンプレートを毎回そのまま流用 台本の内容に合わせて場面を組む
本数 同じ型で最小限の変更を加えて大量に出す 本数より1本の中身。出せる範囲で続ける

自動化の目的は、右側の列を維持したまま作業時間を削ることです。台本を書く時間は減らさない。減らすのは、音声の書き出し、字幕の位置合わせ、書き出しの待ち時間といった、誰がやっても同じになる部分です。

広告収入までの距離は、正直に見ておく

YouTubeパートナープログラム(YPP)に参加するには、次の条件を満たす必要があります。

  • チャンネル登録者数 1,000人以上
  • 直近12か月の総再生時間 4,000時間以上、または 直近90日のショート動画の視聴回数 1,000万回以上
  • YouTubeチャンネル収益化ポリシーへの準拠、有効なコミュニティガイドライン違反の警告がないこと
  • Googleアカウントの2段階認証がオン、YouTube向けAdSenseアカウントのリンク

出典: YouTube パートナー プログラムの概要と参加資格

ショート単独で見ると、90日で1,000万回です。1本が数万回で回っても、まだ遠い数字だとわかります。自動化で1本35秒の動画が短時間で作れるようになっても、この数字が近づく速度はそれほど変わりません。伸びるかどうかを決めているのは本数ではなく中身だからです。

そのため、ショート動画を副業に組み込むなら、当面の位置づけは広告収入そのものより「自分の発信を知ってもらう入口」と考えたほうが現実に合います。ブログやnote、メルマガなど、すでに持っている場所への導線として使う。広告収入は、続けた結果あとから乗るもの、くらいの距離感です。

この記事で扱わないこと

「動画編集の副業」には、大きく分けて2つの道があります。

  1. 案件を受けて、人の動画を編集する(クラウドソーシングなどで受注する)
  2. 自分のチャンネルで、自分の動画を出す

この記事は2つめだけを扱います。単価の相場、手数料、案件の取り方、必要なPCのスペック、編集ソフトの指定といった受託側の話は入れていません。そちらは姉妹サイトの動画編集副業に必要なもの|PCのスペック・無料で足りるソフト・最初の案件の取り方にまとめてあります。受注で稼ぎたい方はそちらが近道です。

ここで書くのは、自分の台本を、人手をできるだけ挟まずに1本の縦動画にするまでの手順です。使う道具はすべて無料のものに寄せています。

全体像:4つの工程に分ける

台本から完成までを、4つに分けます。分ける理由は、それぞれ止まる場所が違うからです。まとめて1つのボタンにすると、どこで失敗したのかわからなくなります。

ショート動画1本ができるまで 人が書くのは①だけ。②〜④は同じ手順の繰り返しなので自動化できる ① 台本を書く 35秒なら200〜250字。自分の調べたこと・自分の見方を入れる 人がやる 30〜60分 ② 読み上げ音声を作る 字幕1枚ごとに音声を分けて作り、実際の長さを測っておく 自動 1〜2分 ③ 場面の画像を用意する 台本を8〜10場面に分け、縦長の画像をそろえる 自動 3分〜30分 ④ 1本に組んで書き出す 画像をゆっくり動かし、字幕を焼き込み、音を合わせて縦型で出力 自動 1〜3分

時間のかかり方に偏りがあるのがわかると思います。③だけ幅が広いのは、無料の画像生成が混雑の影響を受けるからです。ここは後半で詳しく書きます。

手順1:台本を書く(ここは自動化しない)

最初の工程は自動化しません。先ほどのポリシーで「独自の洞察や視点」が求められているのは、まさにここだからです。ここをAIに丸投げすると、あとの工程をどれだけ磨いても収益化の入口で止まります。

35秒に入る文字数は200〜250字

ショート動画は尺が短いぶん、書ける量が決まっています。実際に作った2本は、完成尺が35.1秒と34.3秒でした。この長さに入る日本語のナレーションは、読み上げの速度にもよりますがおおむね200〜250字です。原稿用紙半分と少し、と考えるとイメージしやすいと思います。

この字数で伝えられることは1つだけです。話題を2つ入れようとすると、どちらも説明不足になります。書くときは次の並びが扱いやすいはずです。

  • 最初の1〜2文:意外な事実や、引っかかる問いを置く(ここで止まるかどうかが決まる)
  • 真ん中:その事実の中身。数字や固有名詞を1つ入れると急に具体的になる
  • 最後の1〜2文:見た人が持ち帰れる一言。次に見たくなる引っかかりを残す

読み上げ用に「ひらがな版」を用意する

台本ができたら、そのまま音声にせず、読み上げ専用のひらがな版をもう1つ作ります。手間が増えるようですが、これをやらないと後で全部やり直しになります。

理由は、日本語の読み上げソフトが漢字の読みを取り違えるからです。実際に出た例を挙げます。

原文 読み上げられた音 直した読み
彼の名は かのめいは かれのなは
月に何分 がつになんぷん つきになんぷん
未処理分 みしょりふん みしょりぶん
直下 ちょくか ちょっか
チャット型 ちゃっとかた ちゃっとがた

「分」が「ふん」と「ぶん」で入れ替わる、「月」が「つき」と「がつ」で入れ替わる、といった具合です。人名は特に外します。

実務としては、変換ミスを見つけるたびに「この語はこう読む」という対応表をファイルに1行ずつ足していくのが確実です。1本目は10か所くらい直すことになりますが、5本も作ると新しく足す行はほとんどなくなります。

ここで1つ注意があります。対応表は長い語から先に当てるようにしてください。短い語から当てると、別の語の途中に食い込みます。読みを直すつもりで入れた置換が人名の途中に入り込み、まったく別の音になることがあります。修正が新しい事故を作る、という典型です。置換したあとの文は、必ず一度目で読んでから音声にします。

手順2:読み上げ音声を作る(無料)

日本語の読み上げは、無料で使える合成音声ソフトで作れます。ここではVOICEVOXを使った前提で書きます。パソコンに入れて動かす形なので、回数の制限がなく、何度作り直しても料金はかかりません。

規約の確認は先に済ませる

無料だからといって、そのまま何にでも使えるわけではありません。利用規約には次のように書かれています。

  • 「商用・非商用問わず利用することができます」
  • 「ご利用の際は VOICEVOX を利用したことがわかるクレジット表記が必要です」
  • 「作成された音声を利用する際は、各音声ライブラリの規約に従ってください」

押さえるべきは3つです。商用利用はできる。ただしクレジット表記は必須。そして、声のキャラクターごとに別の規約がある。

3つめが見落とされがちです。VOICEVOX本体の規約とは別に、使う声ごとに条件が定められています。クレジットの書き方も声によって指定が違うことがあるので、使う声の配布ページを必ず開いて、そこに書かれた形式のとおりに表記してください。動画の概要欄に1行入れるだけで済む話ですが、入れ忘れると規約違反になります。

字幕1枚につき、音声を1回作る

ここがこの手順のいちばんの要点です。台本全体を一度に読み上げさせるのではなく、字幕1枚ぶんずつ、別々に音声を作ります。

手順にすると次のとおりです。

  1. 台本を、段落 → 文(。) → 読点(、)の順に分割する
  2. 短すぎる断片は次の断片とくっつけて、1枚あたり2〜4秒程度の長さに整える
  3. その1枚ぶんだけを読み上げさせて、音声ファイルとして保存する
  4. 保存した音声ファイルの実際の長さを測って記録する
  5. 1枚ごとの音声を、あいだに0.18秒ほどの無音を挟んでつなぐ

分割の位置は、読点で機械的に切らないほうがいい場面があります。「2つとも」「12月24日」のような、途中で切ると意味が壊れる語があるためです。読点があっても、意味のかたまりとして2.0〜4.5秒に収まるように調整します。

この作り方だと、字幕がずれない

字幕1枚ぶんの音声の長さを測ってあるので、その長さをそのまま字幕の表示時間にできます。計算で出した時間ではなく、実際に鳴っている音の長さを使うので、原理的にずれません。音声ファイルそのものの長さを基準にするため、字幕と音がずれる余地がありません。

多くの解説記事は、ここで音声の文字起こしを使う手順を紹介しています。できあがった音声をAIに聞かせて、どの言葉が何秒に出てくるかを推定させ、その結果から字幕を作るという流れです。

この手順はいりません。台本という「正解の文章」を最初から持っているからです。持っている答えをわざわざ捨てて、音から推測し直していることになります。

そのうえ、文字起こしは重い処理です。長い動画で試したときは、パソコンのCPUだけで動かすと動画の長さの10倍の時間がかかり、実用にならないと判断して取りやめました。推測なので誤変換も混ざり、直す手間も増えます。

覚えておきたい考え方
すでに答えを持っている工程に、推測する道具を入れない。台本があるなら、音から文字を起こす必要はありません。工程を1つ減らすだけで、処理時間も、ずれも、直す手間も同時に消えます。

読み上げの速度は少しだけ上げる

合成音声は、標準の速度だと間延びして聞こえがちです。1.05倍程度に上げると、短い尺のなかでも言葉が詰まらず、聞き取りやすさも保てます。1.2倍まで上げると早口に聞こえ始めるので、上げすぎないほうが無難です。

手順3:場面の画像を用意する

音声ができたら、映像側です。台本の流れを8〜10の場面に分け、それぞれに合う縦長の画像を用意します。

無料で使える画像生成を選ぶ

画像生成は有料のものが多いなか、無料で使える選択肢があります。有志が提供したパソコンの計算資源を共同で使う仕組みのもので、アカウント登録なしで試せるものもあります。この形のサービスを使い、縦向き(768×1344)で生成します。

選ぶときに実際に確認したことを書いておきます。

  • 無料枠が本当に無料かを公式の料金ページで確認する。ある大手サービスは画像モデルの無料枠が「上限0」で、実際には課金しないと1枚も生成できませんでした(2026年8月時点)
  • 解像度が足りるか。縦型ショートは1080×1920で書き出すので、横幅が576程度しかないサービスだと引き伸ばしたときに粗さが出ます
  • 指定した解像度で返ってくるか。混雑時に512×512のような別サイズが返ってくることがあります。受け取った画像のサイズを毎回確認して、違っていたら作り直す仕組みを入れておくと安全です

無料の生成は、時間帯で結果が変わる

これがいちばん実感した点です。無料の画像生成は、混んでいる時間帯だと1枚も取れないことがあります。

同じ台本の11場面ぶんを生成しようとすると、こうなることがあります。

  • 夜(順番待ちが多い時間帯):2回試していずれも0枚
  • 朝(順番待ちが少ない時間帯):11枚すべてが数秒ずつで取れた

1枚あたりの所要時間も、空いていれば3秒、混んでいれば111秒と、40倍近い開きがありました。有料サービスなら数秒で終わる工程が、無料だと時間帯次第で止まる。ここが「無料でやる」ことの実際のコストです。

対処としては、混雑の度合いを先に見て、空くまで待つのが結局いちばん速い方法でした。混んでいるときに何度も投げ直すと、待ち行列がさらに伸びて悪循環になります。待ち人数と処理能力の比を見て、一定の水準を下回るまで5分おきに様子を見てから投げる形にすると、無駄な投げ直しが減ります。

逆に言えば、制作を夜に固めないだけでも体感は変わります。台本は夜に書いて、画像の生成は朝に回す。それだけで待ち時間が大幅に減ります。

実在の人物の顔は作らない

これは自主的なルールですが、書いておきます。実在の人物の顔をAIで生成しないようにしています。似せたものを出せば、それは事実ではない映像を事実のように見せることになります。歴史上の人物や経営者を扱う動画では特に、情景・象徴的なもの・匿名のシルエットだけで構成しています。

後述するYouTubeのAI開示ルールとも関わる部分で、実在の人物が実際にはしていないことをしているように見せる映像は、開示が必要な類型に明確に含まれています。そもそも作らないほうが早いという判断です。

手順4:1本に組んで書き出す

音声と画像がそろったら、動画に組みます。ここは無料の動画処理ソフト(ffmpeg)で完結します。コマンドで動かす道具なので最初は取っつきにくいのですが、一度設定を決めてしまえば、あとは同じ処理を繰り返すだけです。

設定の目安

項目 設定 理由
解像度 1080×1920(縦) ショート・リールの標準。横型を切り抜くより最初から縦で作る
フレームレート 30fps 静止画を動かす作りなら60fpsは不要。書き出しも軽い
画像の動き ゆっくり拡大・移動 静止画のままだと数秒で見飽きる。わずかに動かすだけで持つ
場面の切り替え 0.45秒のクロスフェード 切り替えが硬いと視聴が切れる。長すぎると尺を食う
1場面の上限 11秒 これを超えると静止画では持たない。超えるなら場面を足す

最後の「1場面の上限」は、実際に運用していて効いているルールです。画像が足りないまま無理に完成させると、1枚を11秒以上映すことになります。そうなった回は完成させずに保留して、画像がそろってから作り直すようにしています。枚数が足りないのを我慢して出すと、見た人がそこで離れます。

字幕は動画に焼き込む

字幕ファイルを別に添える形ではなく、映像に直接焼き込みます。ショートは音を出さずに見られることが多いので、字幕が出ないと内容が伝わりません。

焼き込むときに1つ注意があります。行の折り返しです。字数で機械的に折り返すと「2つとも」が「2つ」と「とも」に割れたり、「12月24日」が日付の途中で割れたりします。読めなくはないのですが、そこで一瞬つまずきます。

ここは地味に厄介で、行数も1行の長さも決めた範囲に収まっているのに、質だけが落ちるという変化が起きます。数字の上では正常なので気づけません。対策として、全部の字幕の折り返し結果をいったん保存しておき、設定を変えたら前回との差分だけを目で見るという確認の仕方に変えました。全部を毎回見るのは続かないので、変わったところだけを見る形にしています。

フォントは「使っていいか」で選ぶ

見た目の好みで選びたくなるところですが、先に確認すべきはライセンスです。パソコンに最初から入っているフォントは、画面で使うぶんには自由でも、動画に埋め込んで配布してよいかは別の話です。macOSに同梱されている定番フォントは、商用動画への埋め込みの可否が明確でないため避けました。

使っているのは、オープンなライセンス(SIL Open Font License)で配布されている日本語フォントです。無料で入手でき、商用利用も埋め込みも明示的に許可されています。太めのゴシック体を選ぶと、縦型の小さい画面でも読めます。

音量は「合わせる」のではなく「差をつける」

ナレーションとBGMを重ねるとき、そのまま混ぜると声が埋もれます。それぞれの音量を測ってから調整します。

市販のBGMは、音声合成のナレーションより大きく作られていることが多く、そのまま重ねると声が聞き取れません。それぞれの音量を測って、BGMを下げ、声がはっきり前に出る差をつけます。BGMは尺より短いことが多いので繰り返し流し、頭を1.5秒かけて上げ、終わりを2秒かけて下げると自然に収まります。

BGMについてもう1つ。曲は固定して、回ごとに変えないほうがいいです。同じ曲が流れることでチャンネルの手触りが一定になります。毎回選び直すと、選ぶ時間が積み上がるうえに、統一感も出ません。もちろん、商用利用が明示的に許可されている曲を選ぶのが前提です。

1本あたり、実際に何分かかるか

ここまでの手順を通したときの時間の内訳です。台本が手元にある状態からの数字です。

工程 人の作業 待ち時間
台本を書く 30〜60分 —
ひらがな版を作る 3〜5分(2本目以降はほぼ自動) —
音声を作る 0分 1〜2分
画像を用意する 0分 3分〜30分(時間帯で変動)
動画に組む 0分 1〜3分
完成品を目で確認する 5〜10分 —

人が手を動かすのは台本と最終確認だけで、合わせて40〜75分ほどです。残りは待っているあいだに別のことができます。待ち時間の合計が読めないのは画像の工程だけなので、そこを朝に寄せると全体が安定します。

最後の「目で確認する」は省かないでください。字幕の位置、読み間違い、文字の重なりは、自動処理では気づけません。「たぶん大丈夫」で出した回に限って、読み間違いがそのまま残っていました。

詰まりやすいところ

手順だけ並べると簡単そうに見えるので、詰まったところも書いておきます。ここを知らずに始めると、たいてい同じ場所で止まります。

20分待って、画像が0枚

ある回で、20分待って0枚、次に約10分待って0枚、その次は3枚取れたところで15分止まる、ということが起きました。同じ壁に3回ぶつかっています。

表面的な原因は混雑ですが、繰り返した理由は別のところにありました。「どれくらい待ったら諦めるか」を決めていなかったことです。決めていないと、待っているのか止まっているのか区別がつかず、ただ画面を見ている時間が過ぎます。

いまは、1枚も取れないまま7分経ったら明示的に処理を止めるという上限を入れてあります。止まったとわかれば、時間帯を変えるという判断ができます。自動化するときは、うまくいく流れだけでなく「止まったことを自分に知らせる仕組み」を必ず入れてください。

「進んでいます」と言いながら、実は空回りしていた

上の件で最も反省しているのはここです。20分間1枚も生成できていないのに、状況としては「生成中」と扱われ続けていました。処理が動いていることと、前に進んでいることは別です。

対策として、途中経過を出すときは「11枚中3枚取得」「経過12分」のように実数を必ず入れるようにしました。「処理中」だけの表示は、何もわからないのと同じです。

直したつもりが、別の場所を壊していた

読み間違いを直すために入れた文字の置換が、人名の途中に食い込んで、まったく別の読みになることがあります。「〜のなか」のような短い語を置換の対象にすると、人名の一部にも当たってしまうためです。

置換で直すときは、長い語から順に当てる、そして置換後の文を一度は目で読む。この2つで防げます。

AIを使ったことの開示について

YouTubeには、生成AIを使ったコンテンツの開示ルールがあります。アップロード時の「属性」の「AIの使用」という項目で申告する形です。

開示が必要なもの・不要なもの

区分 具体例
必要 実在の人物が、実際にはしていない発言や行動をしているように見せる/実際の出来事や場所の映像を改変する/実際には起きていない場面を現実のように見せる
不要 非現実的な内容(ユニコーンに乗る人物など)/色調整や照明のフィルタ/美顔フィルタ/字幕の作成/アイデアの生成/自分の声を複製したナレーション

出典: 生成 AI コンテンツの使用に関する開示

ここは誤解されやすいところです。字幕をAIで作ったこと、アイデア出しにAIを使ったことは、開示の対象ではありません。問題になるのは「現実にはなかったことを、現実のように見せる」場合です。この記事の手順でいえば、実在の人物の顔を生成しないというルールを守っていれば、多くの場合は開示の対象外に収まります。

判断に迷ったら開示しておけば済みます。開示しても視聴者への表示が制限されることはなく、収益化の資格にも影響しません。逆に、繰り返し意図的に開示を怠った場合は、動画の削除やYouTubeパートナープログラムからの参加停止といったペナルティが起こりうると明記されています。迷ったら申告する、で問題ありません。

ここで使った素材と音声の扱いは、別の記事で詳しく書いています。画像を売る形にしたときの条件はAI画像生成で副業は成立するか、音声の文字起こし側の話はAI文字起こしを副業にするです。そして、この作業が続くかどうかは生成AI副業が「稼げない」と言われる理由で扱っています。

素材の扱いでは、配布元の条件を読む作業が先に来ます。見るところはAI画像の「使ってよい素材」を見分けるにまとめました。使える時間が少ない場合の入れどころは副業に使える時間が週5時間しかない人の、AIの入れどころで扱っています。

まとめ

ショート動画の制作は、台本以外のほとんどを無料の道具で自動化できます。読み上げ音声も、場面の画像も、字幕の焼き込みも、一度手順を作れば人が触る必要はありません。1本あたり人が手を動かす時間は、台本と最終確認を合わせて40〜75分ほどに収まります。

ただし、そこで浮いた時間を「本数を増やすこと」に使うと、収益化の入口で止まります。YouTubeは汎用的なテンプレートで大量生産された印象のAI生成コンテンツを収益化の対象外だと明記しています。浮いた時間は台本に戻す。それが、この自動化がいちばん効く使い方です。

今日から始めるなら、この順番で進めるのが手戻りが少ないはずです。

  1. 使う声のキャラクターを決めて、その配布ページの規約とクレジット表記の形式を確認する
  2. 200〜250字の台本を1本、自分の見方を入れて書く
  3. 字幕1枚ぶんずつ音声を作り、それぞれの長さを測る(文字起こしは使わない)
  4. 朝の時間帯に、8〜10場面の画像をそろえる
  5. 1080×1920で組んで、必ず自分の目で通して見る

1本目は半日かかると思います。2本目からは、対応表もフォントも設定も残っているので、台本を書く時間だけになります。

よくある質問

スマートフォンだけでできますか?

この記事の手順は、パソコンで動かす前提です。読み上げソフトも動画処理ソフトも、パソコンに入れて使うものだからです。スマートフォンのアプリだけで同じことをしようとすると、字幕の表示時間を1枚ずつ手で合わせる作業が残るため、自動化のうまみがほとんどなくなります。1本作ってみるだけならアプリでもできますが、続けるならパソコンをおすすめします。

台本もAIに書かせてはいけないのですか?

下書きの相談相手として使うのは問題ありません。構成の案を出させる、書いた文章を短くしてもらう、といった使い方は普通に有効です。避けたいのは、調べもせずに出力をそのまま台本にすることです。YouTubeが求めているのは「クリエイターならではの、率直な洞察や視点」なので、自分が調べたことや自分の見方が入っていないと、収益化の判断で不利になります。AIには整えてもらい、中身は自分で持つ、という分担が現実的です。

合成音声だと「AIっぽい」と嫌われませんか?

合成音声そのものを理由に伸びないということは、いまのところ実感していません。それより効いているのは、字幕がずれないこと、読み間違いがないこと、話の中身が具体的であることです。逆に、読み間違いが1か所あるだけで一気に安っぽく聞こえます。この記事でひらがな版の作成と対応表にこだわって書いたのは、そこが分かれ目だからです。

本当に1円もかからないのですか?

この手順で使う道具(読み上げソフト・画像生成・動画処理・フォント)はいずれも無料で使えるものです。ただし、無料の画像生成は混雑の影響を受けるため、時間帯によっては待ち時間が長くなります。時間をお金で買うなら、画像生成だけ有料サービスに替えるのが費用対効果が高い部分です。まずは無料で1本通してみて、待ち時間が我慢できないと感じたときに検討すれば十分だと思います。

編集の案件を受けるのとどちらが早く収入になりますか?

収入までの距離だけで言えば、案件を受けるほうが圧倒的に早いです。自分のチャンネルは、YouTubeパートナープログラムの条件(登録者1,000人、ショートなら90日で1,000万回)に届くまで広告収入がありません。一方、受注は納品すればその分の報酬が出ます。単価や案件の取り方は動画編集副業に必要なものにまとめてあります。自分のチャンネルは、収入というより「自分の発信の入口」として、並行して育てるものと考えるのが現実的です。

AIで作った動画だと、そもそも収益化されないのでは?

AIを使ったこと自体が理由で収益化されないわけではありません。YouTubeは許可される例として「自分で考案したユニークなキャラクターや物語を、AIを使用して視覚化する」ケースを明示しています。対象外になるのは、独自の洞察や視点がなく、汎用的なテンプレートで大量生産された印象を与えるものです。判断されているのはAIを使ったかどうかではなく、中身に自分のものが入っているかどうかです。

まずは、声を1つ選んで規約を読むところから

この手順で最初に決めるのは、使う声です。公式サイトからソフトを入手し、選んだ声の配布ページでクレジット表記の形式を確認しておくと、あとの工程が止まりません。

VOICEVOX公式サイトを見る

上部へスクロール