Cómo evaluar modelos de IA para la escritura de ficción
Una plantilla repetible de evaluación de modelos para ficción: prueba la continuidad de escena, el diálogo, la voz, la revisión y la recuperación en contexto largo sin dar por hecho que un modelo sea el mejor para cada tarea.
El mejor modelo de IA para ficción depende de la tarea, del contexto, del idioma y del estándar de revisión. Compara modelos con el mismo paquete de prompts, la misma rúbrica de evaluación y un registro fechado de versiones de modelo en lugar de fiarte de una única muestra impresionante.
1. Define la decisión antes de probar
No empieces con «¿Qué modelo es el mejor?». Empieza por una tarea:
- redactar una escena delimitada;
- preservar los hechos a lo largo de un contexto extenso;
- generar giros argumentales alternativos;
- revisar diálogos sin cambiar los acontecimientos;
- escribir en un idioma concreto o con una voz editorial propia.
Un modelo puede ser bueno en una tarea y flojo en otra. Registra la tarea y los criterios de éxito antes de ver los resultados.
2. Crea un conjunto de tareas pequeño y estable
Utiliza entre 5 y 10 prompts que representen tu flujo de trabajo real. Un conjunto inicial útil incluye:
| Prueba | Qué mide |
|---|---|
| Continuación de escena | Causalidad, punto de vista y control del final |
| Revisión de diálogo | Subtexto, preservación de los acontecimientos y ritmo |
| Alternativa de trama | Calidad de las decisiones y conciencia de las consecuencias |
| Revisión de continuidad | Detección de contradicciones basada en evidencias |
| Recuerdo en contexto largo | Recuperación de un dato plantado a propósito |
Mantén fijo el material narrativo. Utiliza material de ficción que tengas permiso para probar. No compares resultados si un modelo recibió contexto adicional o una instrucción distinta.
3. Registra las condiciones de la prueba
En cada ejecución, guarda:
Date and time:
Model name and exact version:
Provider or endpoint:
Language:
Prompt identifier:
Context length and included notes:
Generation settings:
Output length:
Human reviewer:
Los nombres de los modelos y su comportamiento cambian. Un resultado sin fecha y versión es una instantánea, no una afirmación atemporal. Los precios y la disponibilidad cambian aún más rápido; enlaza a la página actual del proveedor o de precios en lugar de copiar cifras en un artículo permanente.
4. Puntúa el comportamiento observable
Utiliza una rúbrica sencilla de 1 a 5 con anotaciones:
| Dimensión | Pregunta |
|---|---|
| Continuidad | ¿Se conservan los hechos establecidos y la propiedad de cada elemento? |
| Causalidad | ¿Las acciones se derivan de objetivos, conocimiento y presión? |
| Punto de vista | ¿El resultado se mantiene dentro del límite de conocimiento solicitado? |
| Voz | ¿Encaja con el estilo proporcionado sin que la imitación se convierta en parodia? |
| Control de revisión | ¿Se produjo el cambio solicitado sin reescrituras no relacionadas? |
| Coste de edición humana | ¿Cuánta corrección necesita antes de darlo por bueno? |
Escribe una evidencia concreta para cada puntuación. «Me gusta más» puede ser una preferencia válida, pero no basta para reproducir el criterio.
5. Prueba los modos de fallo, no solo los casos favorables
Incluye casos adversos pero realistas: un personaje que no debe conocer un secreto, dos nombres parecidos, un objeto cuyo dueño cambia, una petición de revisar solo un párrafo y un contexto largo con notas irrelevantes. El objetivo no es hacer fallar al modelo, sino aprender dónde es necesaria la revisión humana.
Nunca conviertas una ejecución en una afirmación universal. Di «en este conjunto de tareas fechado, bajo estas condiciones» e informa de la incertidumbre cuando los revisores no estén de acuerdo.
6. Publica una comparación honesta
Una reseña útil de un modelo incluye la fecha de la prueba, el conjunto de tareas, el contexto, los ajustes, los puntos fuertes, ejemplos de fallos y para quién es adecuado el modelo. Separa la preferencia personal del comportamiento medible. No afirmes que un modelo garantiza calidad, coherencia, privacidad o un coste menor sin evidencias.
Preguntas frecuentes
¿Cuántos modelos debería comparar?
Empieza por los modelos a los que realmente puedas acceder y revisar. Tres modelos probados con cuidado son más útiles que una clasificación copiada de benchmarks no relacionados.
¿Debería usar el parámetro de temperatura en la prueba?
Regístralo si el proveedor lo expone, pero no des por hecho que los ajustes tengan el mismo efecto en todos los proveedores. Mantén el ajuste constante para una comparación y repite las pruebas creativas cuando la variabilidad importe.
¿Puede un modelo de IA puntuar los resultados?
Puede aportar una señal adicional, pero utiliza una revisión humana para la voz, la intención de la historia y la aceptación final. Si se utiliza un juez de IA, guarda su rúbrica y la versión del modelo en el registro.
Lleva esta guía a tu próxima escena
Reúne el esquema, las fichas de personajes y el borrador en NovelKnow. Empieza con una escena y revisa cada propuesta de la IA antes de conservarla.