如何評估用於小說寫作的 AI 模型
一套可重複用於小說創作的模型評估範本:測試場景連續性、對話、聲音、修訂與長脈絡回想,不假裝某一個模型適合所有任務。
最適合寫小說的 AI 模型,取決於任務、脈絡、語言與修訂標準。 比較模型時,請使用同一組提示包、同一套評分標準,並記錄模型版本與日期,而不是只靠一個令人驚豔的範例來判斷。
1. 在測試前先定義決策
不要從「哪個模型最好?」開始。先從一項工作開始:
- 撰寫一個範圍明確的場景;
- 在長篇脈絡中維持事實;
- 產生替代的情節轉折;
- 在不改變事件的前提下修訂對話;
- 用特定語言或內部風格寫作。
一個模型可能在某項工作很強,在另一項很弱。在看到輸出之前,先記錄任務與成功標準。
2. 建立一組小而穩定的任務集
使用 5 到 10 個能代表你實際工作流程的提示。一組實用的入門任務集包含:
| 測試 | 測量重點 |
|---|---|
| 場景續寫 | 因果關係、視角與結尾控制 |
| 對話修訂 | 潛臺詞、事件保留與節奏 |
| 情節替代方案 | 決策品質與後果意識 |
| 連續性檢查 | 以證據為基礎找出矛盾 |
| 長脈絡回想 | 擷取刻意埋藏的事實 |
故事資料包要保持固定。使用你有權測試的虛構素材。如果某個模型拿到額外脈絡或不同指令,就不要拿輸出互相比較。
3. 記錄測試條件
每次執行都請保存:
Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:
模型名稱與行為會改變。沒有日期與版本的結果只是快照,而不是永恆的宣稱。價格與可用性變動更快;請連結到目前的供應商或定價頁面,而不要把數字複製進一篇永久文章中。
4. 為可觀察的行為評分
使用簡單的 1 到 5 分評分表,並附上筆記:
| 面向 | 問題 |
|---|---|
| 連續性 | 已建立的事實與所有權是否被保留下來? |
| 因果關係 | 行動是否根據目標、知識與壓力而發生? |
| 視角 | 輸出是否停留在要求的知識邊界內? |
| 聲音 | 是否吻合所提供的風格,且模仿沒有變成誇張的諧仿? |
| 修訂控制 | 要求的修改是否發生,且沒有不相干的重寫? |
| 人工編輯成本 | 接受之前需要多少修正? |
每個分數都要寫下一項具體證據。「感覺比較好」可以是有效的偏好,但不足以重現這個判斷。
5. 測試失敗模式,而不是只測亮點
納入帶有對抗性但貼近現實的案例:一個不能知道某個祕密的角色、兩個相似的名字、一個所有權易主的道具、只修訂一段的請求,以及帶有不相關筆記的長脈絡。重點不是要讓模型失敗,而是要了解哪些地方需要人工檢閱。
絕對不要把一次執行變成普遍性的宣稱。請說「在這個註明日期的任務集、在這些條件下」,並在審查者意見不一時回報不確定性。
6. 發表誠實的比較
一篇有用的模型評測會包含測試日期、任務集、脈絡、設定、優勢、失敗範例,以及這個模型適合誰。要區分個人偏好與可測量的行為。不要在缺乏證據的情況下,宣稱某個模型能保證品質、一致性、隱私或較低成本。
常見問題
我應該比較幾個模型?
從你實際能使用與檢視的模型開始。仔細測試三個模型,比從不相關的基準測試複製來的排行榜更有用。
測試時應該使用溫度(temperature)嗎?
如果供應商有揭露這項設定就記錄下來,但不要假設不同供應商的設定效果相同。比較時保持設定不變,並在變異性很重要的創意測試中重複執行。
AI 模型可以為輸出評分嗎?
它可以提供額外的訊號,但聲音、故事意圖與是否接受,仍須由人類審查。如果使用 AI 評審,請把它的評分標準與模型版本保留在記錄中。
把這篇指南用到你的下一場戲
在 NovelKnow 中一起管理大綱、人物設定與正文。從一個場景開始,審閱每次 AI 建議後再決定是否保留。