Style Bert VITS2で15分位の自分の音読音声を自動で分割して学習させたんだけど、なんかあまり流暢じゃなくてロボットっぽさがある
サンプルの声優の声くらい自然な感じにするにはもっと長い尺のサンプル音声がいるのかな?

ちなみにSBV2の学習の際のパラメータはデフォルトのままでやった