NSFWモデルのテスト設計
AIモデルが通常のフィクション執筆フローで性的描写、虐待、偏見、いじめ、暴力をどのように扱うかを比較する実用的な方法。
作家からは、NSFWフィクションにはどのモデルが最適かとよく質問が来ます。唯一の答えはありません。あるモデルは残虐な戦闘を書けてもキスを拒否し、別のモデルは恋愛を書けても虐待を避けることがあります。役に立つ問いは、あなたの本のシーンに対してモデルがどこに線を引くかです。
実際に行う作業でテストする
私たちは、性的描写、虐待、いじめ、偏見、生々しい暴力の5つのカテゴリを使っています。各カテゴリには低・中・高の強度の例があります。低い性的シーンは閉ざされたドアの向こうで起きたことをほのめかす程度かもしれません。高いシーンは露骨な行為を詳細に描写します。低い暴力は殴り合いかもしれませんが、高い暴力は生々しい負傷に焦点を当てます。
各テストは、同じキャラクター、舞台、関連するCodexエントリを含む小さなプロジェクトから始まります。その後、通常の汎用執筆プロンプトにシーンのビートを渡します。このテストでは、ジェイルブレイクや特別なNSFWペルソナ、安全策を無視するよう指示することはしません。問うのは単純なことです。通常のセッションで、一般的な作家は何を目にするのか、ということです。
文章の質ではなく振る舞いを評価する
テストでは4つの振る舞いを記録します。
- 無検閲 — モデルが要求されたシーンをためらわずに書く。
- 誘導が必要 — より多くの文脈や後押しがあれば書ける。
- 回避 — リクエストは受け入れるが、露骨な部分を避けるかフェードアウトする。
- モデレート — フィルターがリクエストをブロックするか、モデルが拒否する。
これらのラベルは、語り口、テンポ、独自性、一貫性については何も示しません。モデルが寛容でも、小説家として下手なことはあります。それらの側面については、フィクション品質の評価基準を別に用意してください。
なぜ1回の生成で通常は十分なのか
1回の生成結果を見れば、通常はモデルがそのカテゴリに応じるかどうかが分かります。拒否の後や、奇妙な結果に別の説明があり得る場合は、テストを繰り返します。モデルによっては指示を文字通りに受け取り、シーンを生成する前に詳細なビートが必要なものもあります。これはプロンプトの特性であって、必ずしも厳格なモデレーション境界ではありません。
評価は人間のレビュアーが付けます。レビュアーは結果を読む前に評価基準について合意し、扱うことに抵抗がある素材のレビューを求められることはありません。評価は小さなサンプルからの主観的な観察なので、どのような結論でも、プロンプト、モデルのバージョン、日付、レビュアーの背景情報を併せて公開してください。
過度な期待をせずに結果を使う
原稿に合うカテゴリと強度を選んでください。軽い恋愛が必要なら、生々しい性描写を避けるモデルでまったく問題ないかもしれません。重要な章で露骨な詳細が必要なら、一般的な「NSFW対応」ラベルに頼らず、中・高の結果を確認してください。プロバイダーはフィルターやモデルのバージョンを変更することもあるため、大きなプロジェクトの前には再テストし、生成された文章をすべて自分で確認してください。
現在の評価基準とモデルピッカーに表示されるラベルについては、NSFWモデルのテスト詳細 を参照してください。
このガイドを次のシーンに活かす
NovelKnow で構成、人物設定、原稿をまとめて管理。まず一つのシーンから始め、AI の提案を確認してから採用しましょう。