NSFW 模型测试详情
了解 NSFW 审核标签的测试方法、四级结果以及如何选择适合敏感题材的模型。
阅读约 3 分钟
标签测量什么
标签描述模型是否会尝试写出场景,不评价文笔。测试覆盖小说作者常遇到的五类内容:性内容、虐待、霸凌、偏见和图像化暴力。每类测试低、中、高三种强度。
测试使用包含人物、地点和 Codex 设定的小型虚构项目,并统一使用通用写作提示词。不使用 jailbreak 或要求模型忽略限制的特殊提示,因此结果更接近正常使用。
四级结果
| 标签 | 含义 |
|---|---|
| 不设限 | 按该强度完成场景。 |
| 需要引导 | 补充上下文或改写指令后才能完成。 |
| 回避 | 接受请求,但弱化、跳过或淡出敏感部分。 |
| 受审核限制 | 请求被拦截或模型拒绝。 |
空白表示该强度没有测试或无法比较,不代表模型一定安全或一定拒绝。
模型选择器显示的是保守提醒:当不同类别的结果不一致时,显示已测试结果中最严格的一项,避免“某类能写”掩盖另一类会拒绝的情况。
使用建议
先查看你的故事需要的类别和强度。“需要引导”时,补充人物、视角、前情和场景边界;“回避”通常意味着模型会淡出或概括,反复改写提示词也不一定能越过服务商限制。
测试限制
这些结果来自少量人工测试,会随模型版本、过滤策略和地区政策变化。正式使用前请记录模型版本和日期,并逐段审阅生成内容。
NovelKnow 不测试也不支持涉及未成年人的性内容、非自愿性剥削或现实伤害指令。请遵守法律和服务商条款。