¿Puedes salir de la media ajustando parámetros?
Temperature y top-p ajustan la varianza del muestreo, no el estilo. Los parámetros LLM no pueden alejarte de la media IA.
By Emmanuel
Un estudiante de doctorado en física nos escribió con una pregunta precisa. Había leído nuestro análisis de cómo funcionan los Perfiles de Estilo de Escritura y quería saber: ¿no se podría lograr el mismo resultado ajustando temperature, top-p y frequency penalty? Preguntaba, en esencia, si los controles ya disponibles en la API hacían lo mismo que nosotros, solo que de forma menos explícita.
Es una buena pregunta. Merece una respuesta seria.
Crédito donde corresponde: la pregunta original vino de Yuqi Qing, estudiante de doctorado en la Universidad Jiao Tong de Shanghái, quien amablemente nos dio permiso para mencionarlo aquí.
Qué hacen realmente los parámetros
Temperature, top-p y frequency penalty operan en la misma capa: el muestreo de tokens. Después de que el modelo calcula una distribución de probabilidad sobre todo su vocabulario, estos parámetros remodelan esa distribución antes de extraer un token.
Temperature escala los logits. Una temperature alta aplana la distribución. Más tokens se vuelven plausibles, los resultados se sienten más sueltos, más sorprendentes. Una temperature baja la agudiza. El modelo se aferra más a su siguiente token más probable, los resultados se sienten más ceñidos, más predecibles.
Top-p trunca la distribución. Solo se muestrean los tokens dentro de la masa de probabilidad acumulada más alta. Es otra manera de acotar el campo.
Frequency penalty penaliza los tokens que ya han aparecido. Empuja al modelo a alejarse de la repetición.
Los tres son controles de varianza. Ninguno mueve el centro de la distribución. Ajustan la dispersión alrededor de lo que el modelo ya considera el resultado más probable. No cambian qué significa "más probable".
La línea base de la IA
Analizamos 320 muestras de cinco modelos principales (Claude, GPT, Gemini) puntuando cada una en seis dimensiones de estilo. La línea base de IA que emerge:
| Dimensión | Línea base IA (prom.) |
|---|---|
| Complejidad de oraciones | 65 |
| Riqueza de vocabulario | 48 |
| Expresividad | 76 |
| Formalidad | 58 |
| Consistencia | 53 |
| Concisión | 42 |
Estas cifras describen un tipo de escritura específico. Oraciones razonablemente complejas. Un vocabulario más limitado de lo que cabría esperar. Alta expresividad. Formalidad media. Concisión mediocre.
Ahora comparemos dos perfiles de autores famosos en los mismos ejes:
| Dimensión | Kafka | Hemingway | Línea base IA |
|---|---|---|---|
| Formalidad | 80 | 66 | 58 |
| Complejidad de oraciones | 77 | 42 | 65 |
| Expresividad | 27 | 25 | 76 |
| Consistencia | 60 | 58 | 53 |
| Concisión | 32 | 59 | 42 |
La línea base de IA se ubica en una banda intermedia estrecha. Entre los cinco modelos, la variación en cualquier eje ronda los 12 puntos. Kafka y Hemingway se diferencian de la línea base de IA entre 30 y 50 puntos solo en Expresividad. Y se diferencian entre sí por 35 puntos en Concisión.
Los escritores humanos abarcan más de 60 puntos en estas dimensiones. Los modelos de IA se agrupan dentro de 12.
Por qué existe el agrupamiento
Esto no es un fallo técnico. Es el resultado buscado de cómo se entrenaron estos modelos.
El RLHF (aprendizaje por refuerzo con retroalimentación humana) recompensa sistemáticamente ciertas cualidades de escritura: claridad, utilidad, exhaustividad, capacidad de enganchar. Esas recompensas atraen a todos los modelos hacia la misma cuenca de atracción. La alta expresividad (76) se premia porque las respuestas comprometidas y expansivas reciben retroalimentación positiva. La baja concisión (42) se premia porque las respuestas exhaustivas suelen puntuar mejor que las escuetas.
No son fluctuaciones aleatorias de las que se pueda salir ajustando parámetros. Son el resultado estructural de la señal de entrenamiento. La línea base de IA no es un punto de partida. Es un centro gravitacional.
Cuando bajas la temperature, los resultados del modelo se vuelven más consistentes. Más centrados de forma fiable en el siguiente token más probable. Eso significa que quedan más firmemente dentro de la cuenca de atracción, no más lejos de ella. Bajar la temperature hace que la IA sea más promedio, no menos.
Cuando subes el frequency penalty, el modelo evita repetir tokens que ya usó. Suena como si eso pudiera ampliar el vocabulario. Pero aleja al modelo de cualquier vocabulario especializado que haya aprendido a asociar con un dominio particular. El vocabulario que usa un físico. El vocabulario que usa un analista jurídico. El vocabulario que Hemingway usa para no usar adjetivos. El frequency penalty no sabe que esos vocabularios son significativos. Trata toda repetición por igual.
La física del asunto
La intuición de nuestro lector era correcta en un sentido: los parámetros hacen algo real. Pero ajustan la varianza, no la media.
Imagina el resultado de un modelo como una muestra de una distribución multidimensional. Un eje para Formalidad, otro para Concisión, otro para Expresividad, y así sucesivamente. El centro de esa distribución queda fijado por el entrenamiento. Los parámetros ajustan con qué amplitud muestreas alrededor de ese centro.
Un Perfil de Estilo de Escritura hace algo estructuralmente distinto. Desplaza el centro. Redefine qué significa "más probable" en cada eje, de forma independiente, a partir de ejemplos reales de cómo escribe una persona concreta. La distribución se mueve. La media cambia.
No puedes replicar eso ajustando la varianza alrededor de la media original. Necesitarías una temperature infinita para alcanzar la puntuación de Concisión de Hemingway partiendo de una línea base de IA. Y con temperature infinita obtienes un resultado aleatorio, no a Hemingway.
Qué significa esto en la práctica
Si usas una herramienta de escritura con IA y sientes que el resultado siempre es, de algún modo, correcto — claro, completo, un poco inflado, no del todo como tú lo dirías — estás experimentando la cuenca de atracción. La herramienta funciona como fue diseñada. Produce texto que probablemente sea mejor que el promedio en varios aspectos. Simplemente no es tu texto.
Los parámetros a tu disposición (temperature, top-p, presence penalty, frequency penalty) pueden hacer que los resultados sean más creativos o menos, más extensos o menos, más repetitivos o menos. No pueden hacer que la IA escriba como escribes tú, o como escribía Kafka, o como escribía cualquier persona concreta con su propia historia y sus propias restricciones.
Eso requiere un tipo de intervención distinto. Uno que opere al nivel equivalente al entrenamiento, no al nivel del muestreo. Uno que le muestre al modelo cómo es tu media en cada dimensión, y la mantenga ahí.
Ajustar los controles es útil. Simplemente no es lo mismo que enseñarle al modelo a sonar como tú.
Este artículo se inspiró en la pregunta de un lector sobre si los parámetros de la API podían lograr lo que logra un Perfil de Estilo de Escritura. La respuesta corta fue no. Esta es la larga.
Haga que la IA escriba como usted, no como un robot
Acaba de leer cómo ajustar la IA a mano. MyWritingTwin lo hace a partir de sus textos reales: pegue algunas muestras y obtenga un perfil de voz que funciona en ChatGPT, Claude y Gemini.
Cree su perfil de escritura gratis¿Aún no? Reciba en su lugar nuestra guía de perfiles de voz IA por correo.