返回博客

如何评估用于小说创作的 AI 模型

一个可复用的小说模型评估模板:测试场景连续性、对话、文风、修改和长上下文信息检索,而不假装某个模型对每项任务都是最好的。

NTNovelKnow Team
阅读约 6 分钟

最适合小说创作的 AI 模型取决于任务、上下文、语言和修改标准。 用同一套提示词包、同一份评估量表和带日期的模型版本记录来比较模型,而不是依赖某一个令人印象深刻的示例。

1. 在测试前明确要做的决定

不要从“哪个模型最好?”开始。从一项具体工作开始:

  • 起草一个边界清晰的场景;
  • 在长上下文中保持事实一致;
  • 生成不同的情节转折;
  • 修改对话但不改变事件;
  • 用特定语言或固定文风写作。

一个模型可能擅长某项工作,却不擅长另一项。在看到输出之前,先记录任务和成功标准。

2. 建立一个小而稳定的任务集

使用 5–10 条能代表你实际工作流程的提示词。一个有用的起步任务集包括:

测试项衡量内容
场景续写因果关系、视角和结尾控制
对话修改潜台词、事件保留和节奏
情节替代方案决策质量和后果意识
连续性检查基于证据发现前后矛盾
长上下文信息检索检索刻意埋入的事实

保持故事材料固定。使用你有权测试的虚构素材。如果某个模型获得了额外上下文或不同指令,就不要比较输出结果。

3. 记录测试条件

每次运行都保存:

Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:

模型名称和行为会变化。没有日期和版本的结果只是一个快照,不是永恒结论。价格和可用性变化更快;请链接到当前服务商或价格页面,而不要把数字复制进永久文章。

4. 为可观察的行为打分

使用简单的 1–5 分量表并附上笔记:

维度问题
连续性既定事实和归属是否得到保留?
因果关系行动是否源于目标、认知和压力?
视角输出是否停留在所要求的知识边界内?
文风是否贴合所提供的文风,且模仿没有沦为拙劣的夸张?
修改控制所要求的修改是否发生,而没有无关重写?
人工编辑成本接受之前需要多少修正?

每一项分数都要写出一条具体证据。“感觉更好”可以是有效的偏好,但不足以复现判断。

5. 测试失败模式,而不只是亮点

加入一些对抗性但符合现实的情况:一个不该知道某个秘密的角色、两个相似的名字、一件主人发生变化的道具、一个只修改一段的请求,以及带无关笔记的长上下文。重点不是让模型失败,而是了解哪里需要人工审校。

永远不要用一次运行得出普遍结论。要说“在这个标注日期的任务集中、在这些条件下”,并在评审者意见不一致时报告不确定性。

6. 发布诚实的对比

一篇有用的模型评测应包括测试日期、任务集、上下文、设置、优势、失败示例,以及模型适合谁。把个人偏好与可衡量的行为分开。没有证据,不要声称某个模型能保证质量、一致性、隐私或更低成本。

常见问题

我应该比较多少个模型?

从你实际能访问和评测的模型开始。仔细测试三个模型,比从无关基准复制来的排行榜更有用。

测试中应该使用温度参数吗?

如果服务商暴露了这个参数,就记录它,但不要假设不同服务商的设置效果相同。比较时保持设置不变;当方差影响较大时,重复创意测试。

AI 模型能给输出打分吗?

它可以提供额外信号,但文风、故事意图和是否采纳仍需人工判断。如果使用 AI 评审,请在记录中保留它的评分标准和模型版本。

把这篇指南用到你的下一场戏

在 NovelKnow 中一起管理大纲、人物设定和正文。从一个场景开始,审阅每次 AI 建议后再决定是否保留。

我们用分析 cookie 了解哪些页面在帮写作者找到我们。

绝不涉及你的稿件 —— 写作工作区内的页面不做任何统计。 隐私政策