如何评估用于小说创作的 AI 模型
一个可复用的小说模型评估模板:测试场景连续性、对话、文风、修改和长上下文信息检索,而不假装某个模型对每项任务都是最好的。
最适合小说创作的 AI 模型取决于任务、上下文、语言和修改标准。 用同一套提示词包、同一份评估量表和带日期的模型版本记录来比较模型,而不是依赖某一个令人印象深刻的示例。
1. 在测试前明确要做的决定
不要从“哪个模型最好?”开始。从一项具体工作开始:
- 起草一个边界清晰的场景;
- 在长上下文中保持事实一致;
- 生成不同的情节转折;
- 修改对话但不改变事件;
- 用特定语言或固定文风写作。
一个模型可能擅长某项工作,却不擅长另一项。在看到输出之前,先记录任务和成功标准。
2. 建立一个小而稳定的任务集
使用 5–10 条能代表你实际工作流程的提示词。一个有用的起步任务集包括:
| 测试项 | 衡量内容 |
|---|---|
| 场景续写 | 因果关系、视角和结尾控制 |
| 对话修改 | 潜台词、事件保留和节奏 |
| 情节替代方案 | 决策质量和后果意识 |
| 连续性检查 | 基于证据发现前后矛盾 |
| 长上下文信息检索 | 检索刻意埋入的事实 |
保持故事材料固定。使用你有权测试的虚构素材。如果某个模型获得了额外上下文或不同指令,就不要比较输出结果。
3. 记录测试条件
每次运行都保存:
Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:
模型名称和行为会变化。没有日期和版本的结果只是一个快照,不是永恒结论。价格和可用性变化更快;请链接到当前服务商或价格页面,而不要把数字复制进永久文章。
4. 为可观察的行为打分
使用简单的 1–5 分量表并附上笔记:
| 维度 | 问题 |
|---|---|
| 连续性 | 既定事实和归属是否得到保留? |
| 因果关系 | 行动是否源于目标、认知和压力? |
| 视角 | 输出是否停留在所要求的知识边界内? |
| 文风 | 是否贴合所提供的文风,且模仿没有沦为拙劣的夸张? |
| 修改控制 | 所要求的修改是否发生,而没有无关重写? |
| 人工编辑成本 | 接受之前需要多少修正? |
每一项分数都要写出一条具体证据。“感觉更好”可以是有效的偏好,但不足以复现判断。
5. 测试失败模式,而不只是亮点
加入一些对抗性但符合现实的情况:一个不该知道某个秘密的角色、两个相似的名字、一件主人发生变化的道具、一个只修改一段的请求,以及带无关笔记的长上下文。重点不是让模型失败,而是了解哪里需要人工审校。
永远不要用一次运行得出普遍结论。要说“在这个标注日期的任务集中、在这些条件下”,并在评审者意见不一致时报告不确定性。
6. 发布诚实的对比
一篇有用的模型评测应包括测试日期、任务集、上下文、设置、优势、失败示例,以及模型适合谁。把个人偏好与可衡量的行为分开。没有证据,不要声称某个模型能保证质量、一致性、隐私或更低成本。
常见问题
我应该比较多少个模型?
从你实际能访问和评测的模型开始。仔细测试三个模型,比从无关基准复制来的排行榜更有用。
测试中应该使用温度参数吗?
如果服务商暴露了这个参数,就记录它,但不要假设不同服务商的设置效果相同。比较时保持设置不变;当方差影响较大时,重复创意测试。
AI 模型能给输出打分吗?
它可以提供额外信号,但文风、故事意图和是否采纳仍需人工判断。如果使用 AI 评审,请在记录中保留它的评分标准和模型版本。
把这篇指南用到你的下一场戏
在 NovelKnow 中一起管理大纲、人物设定和正文。从一个场景开始,审阅每次 AI 建议后再决定是否保留。