返回部落格

如何評估用於小說寫作的 AI 模型

一套可重複用於小說創作的模型評估範本:測試場景連續性、對話、聲音、修訂與長脈絡回想,不假裝某一個模型適合所有任務。

NTNovelKnow Team
閱讀約 6 分鐘

最適合寫小說的 AI 模型,取決於任務、脈絡、語言與修訂標準。 比較模型時,請使用同一組提示包、同一套評分標準,並記錄模型版本與日期,而不是只靠一個令人驚豔的範例來判斷。

1. 在測試前先定義決策

不要從「哪個模型最好?」開始。先從一項工作開始:

  • 撰寫一個範圍明確的場景;
  • 在長篇脈絡中維持事實;
  • 產生替代的情節轉折;
  • 在不改變事件的前提下修訂對話;
  • 用特定語言或內部風格寫作。

一個模型可能在某項工作很強,在另一項很弱。在看到輸出之前,先記錄任務與成功標準。

2. 建立一組小而穩定的任務集

使用 5 到 10 個能代表你實際工作流程的提示。一組實用的入門任務集包含:

測試測量重點
場景續寫因果關係、視角與結尾控制
對話修訂潛臺詞、事件保留與節奏
情節替代方案決策品質與後果意識
連續性檢查以證據為基礎找出矛盾
長脈絡回想擷取刻意埋藏的事實

故事資料包要保持固定。使用你有權測試的虛構素材。如果某個模型拿到額外脈絡或不同指令,就不要拿輸出互相比較。

3. 記錄測試條件

每次執行都請保存:

Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:

模型名稱與行為會改變。沒有日期與版本的結果只是快照,而不是永恆的宣稱。價格與可用性變動更快;請連結到目前的供應商或定價頁面,而不要把數字複製進一篇永久文章中。

4. 為可觀察的行為評分

使用簡單的 1 到 5 分評分表,並附上筆記:

面向問題
連續性已建立的事實與所有權是否被保留下來?
因果關係行動是否根據目標、知識與壓力而發生?
視角輸出是否停留在要求的知識邊界內?
聲音是否吻合所提供的風格,且模仿沒有變成誇張的諧仿?
修訂控制要求的修改是否發生,且沒有不相干的重寫?
人工編輯成本接受之前需要多少修正?

每個分數都要寫下一項具體證據。「感覺比較好」可以是有效的偏好,但不足以重現這個判斷。

5. 測試失敗模式,而不是只測亮點

納入帶有對抗性但貼近現實的案例:一個不能知道某個祕密的角色、兩個相似的名字、一個所有權易主的道具、只修訂一段的請求,以及帶有不相關筆記的長脈絡。重點不是要讓模型失敗,而是要了解哪些地方需要人工檢閱。

絕對不要把一次執行變成普遍性的宣稱。請說「在這個註明日期的任務集、在這些條件下」,並在審查者意見不一時回報不確定性。

6. 發表誠實的比較

一篇有用的模型評測會包含測試日期、任務集、脈絡、設定、優勢、失敗範例,以及這個模型適合誰。要區分個人偏好與可測量的行為。不要在缺乏證據的情況下,宣稱某個模型能保證品質、一致性、隱私或較低成本。

常見問題

我應該比較幾個模型?

從你實際能使用與檢視的模型開始。仔細測試三個模型,比從不相關的基準測試複製來的排行榜更有用。

測試時應該使用溫度(temperature)嗎?

如果供應商有揭露這項設定就記錄下來,但不要假設不同供應商的設定效果相同。比較時保持設定不變,並在變異性很重要的創意測試中重複執行。

AI 模型可以為輸出評分嗎?

它可以提供額外的訊號,但聲音、故事意圖與是否接受,仍須由人類審查。如果使用 AI 評審,請把它的評分標準與模型版本保留在記錄中。

把這篇指南用到你的下一場戲

在 NovelKnow 中一起管理大綱、人物設定與正文。從一個場景開始,審閱每次 AI 建議後再決定是否保留。

我們用分析 cookie 了解哪些頁面在幫寫作者找到我們。

絕不涉及你的稿件 —— 寫作工作區內的頁面不做任何統計。 隱私政策