Comment évaluer les modèles d’IA pour l’écriture de fiction
Un modèle d’évaluation reproductible pour la fiction : testez la continuité des scènes, les dialogues, la voix, la révision et la récupération en contexte long sans prétendre qu’un seul modèle est le meilleur pour toutes les tâches.
Le meilleur modèle d’IA pour la fiction dépend de la tâche, du contexte, de la langue et du niveau d’exigence de révision. Comparez les modèles avec le même jeu de prompts, la même grille d’évaluation et un journal daté des versions de modèles au lieu de vous fier à un seul exemple impressionnant.
1. Définissez la décision avant de tester
Ne commencez pas par « Quel est le meilleur modèle ? ». Commencez par une tâche :
- rédiger une scène délimitée ;
- préserver des faits dans un contexte long ;
- générer des rebondissements alternatifs ;
- réviser un dialogue sans modifier les événements ;
- écrire dans une langue précise ou selon une voix de la maison.
Un modèle peut être excellent pour une tâche et médiocre pour une autre. Notez la tâche et les critères de réussite avant de regarder les résultats.
2. Constituez un petit ensemble de tâches stable
Utilisez 5 à 10 consignes qui représentent votre flux de travail réel. Un ensemble de départ utile contient :
| Test | Ce qu’il mesure |
|---|---|
| Continuation de scène | Causalité, point de vue et maîtrise de la fin |
| Révision de dialogue | Sous-texte, préservation des événements et rythme |
| Alternative d’intrigue | Qualité de la décision et conscience des conséquences |
| Vérification de la continuité | Détection des contradictions fondée sur des preuves |
| Rappel en contexte long | Récupération d’un fait délibérément inséré |
Gardez le dossier narratif fixe. Utilisez un matériau fictif pour lequel vous avez l’autorisation de faire des tests. Ne comparez pas les résultats si un modèle a reçu un contexte supplémentaire ou une consigne différente.
3. Notez les conditions du test
Pour chaque essai, enregistrez :
Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:
Les noms de modèles et leur comportement changent. Un résultat sans date ni version est un instantané, pas une affirmation intemporelle. Les prix et les disponibilités évoluent encore plus vite ; faites un lien vers la page actuelle du fournisseur ou de tarification au lieu de recopier des chiffres dans un article permanent.
4. Notez le comportement observable
Utilisez une grille simple de 1 à 5 avec des notes :
| Dimension | Question |
|---|---|
| Continuité | Les faits établis et la propriété sont-ils préservés ? |
| Causalité | Les actions découlent-elles des objectifs, des connaissances et des pressions ? |
| Point de vue | Le résultat reste-t-il dans la limite de connaissance demandée ? |
| Voix | Correspond-il au style fourni sans que l’imitation devienne une parodie ? |
| Contrôle de la révision | La modification demandée a-t-elle eu lieu sans réécritures sans rapport ? |
| Coût de correction humaine | Quelle quantité de correction est nécessaire avant acceptation ? |
Rédigez une preuve concrète pour chaque note. « Ça sonne mieux » peut être une préférence valable, mais cela ne suffit pas pour reproduire le jugement.
5. Testez les modes d’échec, pas seulement les points forts
Incluez des cas difficiles mais réalistes : un personnage qui ne doit pas connaître un secret, deux noms similaires, un objet dont le propriétaire change, une demande de révision portant uniquement sur un paragraphe, et un contexte long avec des notes hors sujet. Le but n’est pas de faire échouer un modèle ; c’est d’apprendre où l’évaluation humaine est nécessaire.
Ne transformez jamais un seul essai en affirmation universelle. Dites « dans cet ensemble de tâches daté, dans ces conditions » et signalez l’incertitude lorsque les évaluateurs ne sont pas d’accord.
6. Publiez une comparaison honnête
Un comparatif de modèles utile indique la date du test, l’ensemble de tâches, le contexte, les réglages, les points forts, des exemples d’échec et à qui le modèle convient. Séparez les préférences personnelles du comportement mesurable. N’affirmez pas qu’un modèle garantit la qualité, la cohérence, la confidentialité ou un coût inférieur sans preuve.
FAQ
Combien de modèles dois-je comparer ?
Commencez par les modèles auxquels vous avez réellement accès et que vous pouvez évaluer. Trois modèles testés avec soin sont plus utiles qu’un classement copié depuis des benchmarks sans rapport.
Dois-je utiliser la température dans le test ?
Notez-la si le fournisseur l’expose, mais ne supposez pas que les réglages ont le même effet d’un fournisseur à l’autre. Gardez le réglage constant pour une comparaison et répétez les tests créatifs lorsque la variance compte.
Un modèle d’IA peut-il noter les résultats ?
Il peut fournir un signal supplémentaire, mais utilisez une évaluation humaine pour la voix, l’intention narrative et l’acceptation. Si un juge IA est utilisé, conservez sa grille d’évaluation et la version du modèle dans le journal.
Passez de ce guide à votre prochaine scène
Rassemblez votre plan, vos fiches de personnages et votre manuscrit dans NovelKnow. Commencez par une scène et examinez chaque proposition de l’IA avant de la conserver.