Saltar al contenido
Modelos Mentales

Estrategias Evolutivamente Estables

Cooperación, despilfarro y dónde miente el modelo

La ESS se enfrenta al dilema del prisionero repetido: por qué Tit-for-Tat solo es casi estable, por qué Desertar Siempre también es estable — un mundo con dos cuencas — y la dinámica del replicador como motor que lleva a una población a su equilibrio. Después, el catálogo honesto: estabilidad no es optimalidad, no todo juego tiene una ESS y los supuestos que las poblaciones reales rompen.

14 min Actualizado 10 jul 2026

Habéis pasado cuatro lecciones aprendiendo a desconfiar de una historia reconfortante. Un comportamiento no es estable porque parezca ingenioso, ni porque “ayude a la especie”, ni porque un narrador de documentales lo dijera con voz solemne. Solo es estable si supera la prueba de invasión: una estrategia II es una estrategia evolutivamente estable (evolutionarily stable strategy, ESS) cuando, para todo mutante JJ, o bien E(I,I)>E(J,I)E(I,I) > E(J,I), o bien E(I,I)=E(J,I)E(I,I) = E(J,I) con E(I,J)>E(J,J)E(I,J) > E(J,J).

Esta última lección didáctica dirige esa lente hacia la pregunta más cargada emocionalmente de toda la teoría de juegos evolutiva — ¿puede ser estable la cooperación? — y, tras habernos ganado el derecho, cataloga con honestidad todos los lugares donde el modelo os miente en voz baja.

Before you read — take a guess

Antes de empezar: en el dilema del prisionero de una sola ronda, la cooperación no es una ESS porque un mutante desertor siempre gana más que un cooperador frente a una población cooperativa. ¿Qué rasgo único del juego creéis que podría darle la vuelta a eso, haciendo defendible la cooperación?

La repetición cambia el juego: el dilema del prisionero iterado

En el dilema del prisionero de una sola ronda, la deserción domina. Haga lo que haga tu compañero, ganas más desertando, así que una población de cooperadores es invadida trivialmente: la cooperación no es una ESS, y punto.

Ahora juégalo repetidamente. Tras cada ronda, los mismos dos jugadores se reencuentran con probabilidad ww — la probabilidad de continuación, o como les encanta llamarla a los biólogos, la sombra del futuro (shadow of the future). Si ww es alta, “el mismo compañero otra vez” es probable, y una estrategia puede recordar: puede premiar la cooperación de ayer y castigar la deserción de ayer.

La famosa estrategia condicional es Tit-for-Tat (toma y daca, TFT): coopera en la primera jugada y después copia lo que hiciera el oponente la ronda anterior. Amable (nunca deserta primero), vengativa (castiga la deserción de inmediato) e indulgente (vuelve a cooperar en cuanto el oponente lo hace).

Piénsalo como un termostato de la confianza: arranca cálido, se enfría al instante cuando lo enfrían y se recalienta en cuanto vuelve el calor. La pregunta que hizo famoso a Robert Axelrod es si ese termostato es evolutivamente estable — no solo una buena idea, sino ininvadible.

Info:

Los pagos que reutilizaremos

Usamos el dilema estándar por ronda: la cooperación mutua paga 3 a cada uno, la deserción mutua 1 a cada uno, y el desertor tentado obtiene 5 mientras que el cooperador explotado (el “primo”) obtiene 0. Así que el orden es Tentación (5) > Recompensa (3) > Castigo (1) > Primo (0). A lo largo de un juego repetido estos pagos por ronda se acumulan, ponderados por cuánto dura la relación.

¿Qué le compra realmente a una estrategia condicional como Tit-for-Tat una probabilidad de continuación w alta?

Tit-for-Tat solo es casi una ESS

Aquí llega el resultado que separa a quien de verdad ha hecho el álgebra de quien ha leído un resumen de divulgación. Cuando la sombra del futuro es suficientemente larga, TFT resiste a Desertar Siempre (Always Defect, AllD) — pero no es una ESS estricta. Solo es neutralmente estable, y ese “solo” importa enormemente.

Paso 1 — TFT vence al invasor AllD. Mete un mutante AllD en un mundo de jugadores TFT. En la ronda uno AllD deserta contra un TFT que coopera: saca 5, el primo saca 0. Estupendo, durante exactamente una ronda. De la ronda dos en adelante, TFT toma represalias y ambos desertan para siempre, sacando 1 cada uno. Mientras tanto dos jugadores TFT cooperan todas las rondas, sacando 3 cada uno. Sumemos a lo largo de, digamos, una relación larga de muchas rondas:

EnfrentamientoRonda 1Cada ronda posteriorMedia por ronda a largo plazo
TFT vs TFT33, 3, 3, …≈ 3
AllD vs TFT51, 1, 1, …≈ 1 (el 5 se diluye)

Así que E(TFT,TFT)3E(\text{TFT},\text{TFT}) \approx 3 mientras que E(AllD,TFT)1E(\text{AllD},\text{TFT}) \approx 1. Como E(TFT,TFT)>E(AllD,TFT)E(\text{TFT},\text{TFT}) > E(\text{AllD},\text{TFT}), TFT es una mejor respuesta estricta a sí misma frente a AllD — AllD no puede invadir. El robo de una ronda queda ahogado por una vida de castigo. Hasta aquí, todo heroico.

Paso 2 — el saboteador silencioso: Cooperar Siempre (Always Cooperate, AllC). Ahora prueba con un mutante amable, AllC, que coopera incondicionalmente. Frente a una población TFT, AllC coopera cada ronda y TFT — nunca provocado — también coopera cada ronda. Ambos ganan 3 por ronda, para siempre. Eso significa:

E(TFT,TFT)=E(AllC,TFT)=3.E(\text{TFT},\text{TFT}) = E(\text{AllC},\text{TFT}) = 3.

Un empate. La primera línea de defensa de TFT (E(I,I)>E(J,I)E(I,I) > E(J,I)) no se cumple frente a AllC. Así que pasamos al desempate: ¿es E(TFT,AllC)>E(AllC,AllC)E(\text{TFT},\text{AllC}) > E(\text{AllC},\text{AllC})? Frente a un oponente AllC, TFT coopera todo el camino (AllC nunca deserta, así que TFT nunca toma represalias) y gana 3 por ronda; dos jugadores AllC también cooperan todo el camino y ganan 3 por ronda. Empate otra vez: E(TFT,AllC)=E(AllC,AllC)=3E(\text{TFT},\text{AllC}) = E(\text{AllC},\text{AllC}) = 3. El desempate también falla.

Ambas condiciones ESS fallan frente a AllC. Por tanto TFT no es una ESS estricta — AllC es selectivamente neutral frente a TFT. En un mundo finito, los mutantes neutrales derivan: sin penalización de aptitud que los frene, las copias de AllC se acumulan por azar.

Paso 3 — la población ablandada es asaltada. Y aquí está el aguijón. Una vez que AllC ha derivado hacia dentro y la población es una mezcla blanda de TFT y AllC, un mutante AllD reaparece — y ahora prospera, porque puede explotar gratis a todos esos cooperadores incondicionales (AllC nunca castiga) mientras que solo la menguante minoría TFT toma represalias. La cooperación, sin la defensa de la memoria, es asaltada.

Warning:

Neutral no es lo mismo que seguro

La lección que la gente pasa por alto: a TFT no la derriba una estrategia mejor. La socava una igual de buena. AllC nunca gana más que TFT — solo empata, deriva hacia dentro sobre ese empate y pudre las represalias que mantenían fuera a AllD. “Ininvadible por cualquier cosa que lo haga estrictamente peor” es un escudo más débil que “ininvadible, sin más”. Ese hueco entre ESS estricta y meramente neutralmente estable es toda la historia aquí.

¿Por qué exactamente falla Tit-for-Tat la prueba ESS, aunque Desertar Siempre no pueda invadirla?

Desertar Siempre también es una ESS — así que el mundo es biestable

Los defensores de la cooperación a menudo se quedan en “la reciprocidad puede ser estable” y se dan una vuelta de la victoria. No lo hagáis. Aplica la prueba de invasión al otro equilibrio y cae algo que da que pensar.

Considera una población de AllD puro. Todos desertan cada ronda; todos ganan el pago de castigo de 1 por ronda. Ahora suelta cualquier mutante amable — TFT o AllC. En la ronda uno coopera (eso es lo que significa “amable”), los nativos AllD desertan y el mutante se come el pago del primo de 0. A partir de ahí:

  • AllC sigue cooperando contra un muro de desertores — 0 cada ronda. Catastrófico.
  • TFT coopera una vez (0), se quema, luego toma represalias y deserta el resto — 1 por ronda a partir de entonces, igualando exactamente a los nativos, pero nunca recupera esa primera ronda perdida.

De cualquier modo, E(AllD,AllD)=1>E(mutante,AllD)E(\text{AllD},\text{AllD}) = 1 > E(\text{mutante},\text{AllD}) (que es como mucho 1, y estrictamente menos una vez que se cuenta la pérdida del primo de la ronda uno). Ningún mutante amable consigue un punto de apoyo. AllD es una ESS estricta.

Así que el dilema del prisionero repetido es biestable (bistability): tiene dos equilibrios evolutivamente estables. “Todos reciprocan” (un régimen cooperativo tipo TFT) y “todos desertan” son ambos ininvadibles. En cuál acaba una población no lo decide cuál es mejor — la cooperación mutua paga 3, la deserción mutua paga un mísero 1 — sino la historia, las condiciones iniciales y la cuenca de atracción en la que resultó empezar.

Info:

Dos valles, una bola

Imagina el paisaje de aptitud como un terreno con dos valles — uno profundo y rico (cooperación) y otro llano y pobre (deserción) — separados por una cresta. Una bola (la población) rueda hacia el valle en el que empezó más cerca. No se teletransporta al valle mejor solo porque ese valle sea mejor. Esto es dependencia del camino en su forma más pura: el resultado queda fijado por dónde empezaste, no por dónde sería mejor acabar.

Por eso la cooperación es difícil de reiniciar una vez perdida (una población desertora se asienta en su propio valle estable y castiga al primer mutante amable) y sin embargo se autodefiende una vez establecida (una población recíproca repele a los desertores). La confianza es cara de construir y barata de quemar — y ahora podéis ver por qué en la aritmética, no solo en el aforismo.

Elige la opción correcta para cada hueco y comprueba.

Como tanto todos-reciprocan como todos-desertan superan la prueba de invasión, el dilema repetido es : tiene más de una ESS. Qué equilibrio alcanza una población lo fija su , no cuál resultado paga más — un caso de manual de .

Ordena cada juego según cuántas estrategias evolutivamente estables tiene.

Place each item in the right group.

  • Piedra–papel–tijera de los lagartos de manchas laterales — naranja/azul/amarillo se persiguen
  • Halcón–Paloma con V < C — una ESS mixta en p* = V/C
  • El dilema del prisionero repetido — todos-reciprocan y todos-desertan son ambos estables
  • Un juego de coordinación donde tanto "todos conducen por la izquierda" como "todos conducen por la derecha" resisten la invasión
  • El juego de la proporción de sexos — una ESS en un reparto 50:50
  • Un juego de frecuencias de tres morfos donde cada tipo vence a uno y pierde con otro

Dinámica del replicador: el motor que hace el movimiento

No dejamos de decir que la selección “lleva” a una población hacia una ESS. Hora de nombrar el motor. La ecuación del replicador es el modelo honesto más simple de ese movimiento, y su idea de una línea lo es todo:

La cuota de una estrategia crece en proporción a cuánto por encima de la media poblacional está su aptitud. Lo más apto que la media se expande; lo que está por debajo de la media encoge; lo exactamente medio se mantiene.

Para dos estrategias con cuotas pp y 1p1-p y aptitudes WAW_A y WBW_B:

dpdt=p(1p)(WAWB).\frac{dp}{dt} = p\,(1-p)\,(W_A - W_B).

Léela de izquierda a derecha y casi se narra sola. El término p(1p)p(1-p) es solo “solo puedes cambiar si ambos tipos están de verdad presentes” (nada que seleccionar si todos son ya A o ya B). El término (WAWB)(W_A - W_B) es el volante: positivo donde A vence a B, así que la cuota de A sube; negativo donde A pierde, así que baja; cero donde empatan, que es un punto de reposo. Es interés compuesto para el comportamiento — los ganadores obtienen proporcionalmente más del “capital” de la siguiente generación.

Tres conexiones enlazan esto con todo lo que habéis construido:

  1. Ya la usasteis. El botón “deja correr la selección” del laboratorio de Halcón–Paloma de la Lección 2 es esta ecuación. Con la fracción de halcones que empezaras, llevó a la población a p=V/Cp^* = V/C — porque en cualquier otra mezcla, una estrategia está por encima de la media y crece hasta que el hueco se cierra.
  2. Una ESS es un atractor. En lenguaje dinámico, una ESS es un punto de reposo asintóticamente estable de la dinámica del replicador (replicator dynamics): una mezcla en reposo que, si la empujas, se recupera sola. Ese es el significado preciso de “estable” — no una metáfora, una propiedad matemática.
  3. Pero no todo sistema reposa. Piedra–papel–tijera — los lagartos de manchas laterales — no tiene punto de reposo que atraiga; la dinámica del replicador lo manda a orbitar el centro para siempre, naranja persiguiendo a azul persiguiendo a amarillo persiguiendo a naranja. Sin atractor, sin ESS. Los ciclos son un comportamiento legítimo a largo plazo, no un fallo.
Tip:

La frase que hay que conservar

Dinámica del replicador = “lo más apto que la media crece, lo que está por debajo de la media encoge”. Una ESS es donde ese proceso llega al reposo y se queda ahí cuando lo perturban. Algunos juegos reposan en un punto, algunos en varios, y algunos nunca reposan.

Empareja cada comportamiento dinámico con lo que significa para la existencia de una ESS.

Pick a term, then click its definition.

Dónde miente el modelo: el catálogo honesto

Ahora tenéis una herramienta poderosa. Las herramientas poderosas se ganan el respeto precisamente porque sus dueños saben dónde se rompen. Aquí está la lista poco halagüeña y de carga de lo que la ESS no os dice.

1. Estabilidad no es optimalidad

Esta es la gorda, y la que hace tropezar a la gente lista. Una ESS es aquello en lo que la selección se asienta — no lo que sería mejor para el grupo. El juego de Halcón–Paloma lo demuestra con números.

Recuerda de la Lección 2, con valor V=6V = 6 y coste C=10C = 10, la ESS mixta es p=V/C=6/10=0.6p^* = V/C = 6/10 = 0.6 halcones. En ese equilibrio, cada individuo — halcón o paloma — gana el mismo pago esperado, y ese pago resulta ser V(CV)/(2C)V(C - V) / (2C):

V(CV)2C=6×(106)2×10=6×420=2420=1.2.\frac{V(C-V)}{2C} = \frac{6 \times (10 - 6)}{2 \times 10} = \frac{6 \times 4}{20} = \frac{24}{20} = 1.2.

Ahora imagina una población de todo Palomas. Comparten recursos pacíficamente, y cada una gana V/2=6/2=3V/2 = 6/2 = 3. Eso es más del doble que el pago ESS de 1.2. Todos serían más ricos en el mundo de todo Palomas.

MundoComposiciónPago por individuo
Utopía de todo Palomas0% halcones3.0
La ESS60% halcones1.2

Entonces, ¿por qué la población no va sin más al encantador mundo de todo Palomas? Porque todo Palomas es invadible: suelta un Halcón en una sala de Palomas y gana todos los enfrentamientos sin oposición, ganando el V=6V = 6 completo mientras las palomas se reparten 3. Los halcones inundan hasta llegar a pp^*. El óptimo pacífico no es estable, así que la selección no puede mantener ahí a la población. La selección optimiza la propagación del gen individual, no el bienestar del grupo — y son objetivos distintos. La ESS predice el despilfarrador 1.2, y la realidad obedece.

Una población se sitúa en la ESS de Halcón–Paloma ganando 1.2 cada uno, cuando todos ganarían 3.0 en un mundo de todo Palomas. ¿Por qué la selección natural no puede simplemente mover la población al mejor resultado?

2. No todo juego tiene una ESS — y algunos tienen varias

“Encuentra la ESS” da por sentado en voz baja que hay una que encontrar. No tiene por qué haberla. Piedra–papel–tijera (los lagartos) no tiene ninguna — la dinámica cicla. Algunos juegos tienen solo una ESS mixta (Halcón–Paloma). Algunos tienen múltiples ESS (el dilema biestable; cualquier juego de coordinación). La respuesta honesta a “¿cuál es la ESS aquí?” puede ser cero, una o varias — y no lo sabes hasta que has aplicado de verdad la prueba.

3. El modelo clásico supone una población infinita, bien mezclada, de desconocidos no emparentados

El álgebra pulcra de E(I,I)>E(J,I)E(I,I) > E(J,I) cabalga sobre tres supuestos que las poblaciones reales rompen rutinariamente:

  • Población infinita. La matemática supone que los mutantes son infinitesimalmente raros y las medias, exactas. Las poblaciones reales son finitas, así que la deriva aleatoria puede expulsar a una estrategia incluso cuando la selección la favorece (exactamente la deriva que dejó colarse a AllC en TFT), o fijar una peor por suerte.
  • Jugadores no emparentados. Los pagos ESS suponen que te encuentras con desconocidos. Añade estructura de parentesco y los pagos efectivos cambian: ayudar a un pariente propaga genes compartidos, así que la cooperación puede compensar cuando se cumple la regla de Hamilton (Hamilton’s rule) rB>CrB > C (la relación de parentesco rr por el beneficio BB para el receptor supera al coste CC para el actor) — incluso donde la ESS de solo-desconocidos dice desertar.
  • Encuentros bien mezclados. La ESS supone que todos tienen la misma probabilidad de encontrarse con todos. Las interacciones reales tienen estructura espacial o de red — quién se encuentra con quién es grumoso. En una retícula, los cooperadores pueden agruparse y protegerse mutuamente, sobreviviendo donde un modelo bien mezclado dice que serían explotados hasta la extinción.

Cada uno de estos no es una nota al pie; cada uno reescribe la matriz de pagos.

4. Es una instantánea estática de un mundo en movimiento

La ESS es un concepto de equilibrio. Pregunta “¿qué mezcla, una vez alcanzada, se queda quieta?” — y por construcción ignora que el propio juego se está moviendo. VV y CC derivan a medida que cambian los entornos. Los oponentes coevolucionan, así que una estrategia que persigue la mejor respuesta de hoy apunta a un blanco móvil — una ESS móvil. Hay desfases temporales, estaciones, invasiones. La evolución real es una persecución, no un pulcro punto de reposo; la ESS fotografía un fotograma y finge que la película se ha parado.

5. La narración descuidada es la mayor trampa práctica

El abuso más común de todo este campo no es un error matemático — es contar historias. “Ese comportamiento es evolutivamente estable” es trivialmente fácil de afirmar y genuinamente difícil de ganar. Las historias ad hoc se reproducen como conejos: cualquier rasgo puede vestirse de adaptativo a posteriori. La disciplina que separa la ciencia de la narración es mecánica — nombra el conjunto de estrategias, escribe los pagos E(,)E(\cdot,\cdot) y aplica de verdad la prueba de invasión. Si no has hecho esas tres cosas, estás contando una historia de campamento, no haciendo una afirmación.

6. La falacia naturalista

Por último, la barrera ética heredada del curso de cooperación: una ESS describe lo que evoluciona, no lo que es bueno, justo o correcto. La pelea estable (Halcón–Paloma), el engaño estable y la deserción estable (el mundo de todo-AllD) son todos ESS. Ser evolutivamente estable no confiere exactamente ningún respaldo moral. “Es natural” y “es estable” son descripciones; “es bueno” es una afirmación aparte que tienes que argumentar por sus propios méritos. Esta es la falacia naturalista (naturalistic fallacy).

Tip:

Lista de comprobación del profesional — antes de afirmar una ESS

Para ganarte la frase “esto es una ESS”, especifícalo todo:

  • (a) el conjunto de estrategias — qué alternativas están sobre la mesa;
  • (b) la función de pagos E(A,B) — los números, no un ambiente;
  • (c) mejor-respuesta-a-sí-misma — comprueba E(I,I) >= E(J,I) para todo mutante J;
  • (d) el desempate donde E(I,I) = E(J,I) — comprueba E(I,J) > E(J,J);
  • (e) confirma que es un atractor a prueba de mutantes raros de la dinámica.

Y ten presente el recuento: pueden existir cero, una o muchas ESS. Si te saltaste (a)–(b), nunca tuviste una afirmación — solo una historia.

¿Cuáles de las siguientes son limitaciones genuinas del modelo clásico de ESS? (Selecciona todas las que apliquen.)

Empareja cada limitación del modelo ESS con un ejemplo concreto de cómo muerde.

Pick a term, then click its definition.

Recuerdo espaciado: no pierdas la maquinaria central

Habéis añadido mucho hoy. Asegurémonos de que los cimientos de lecciones anteriores siguen siendo de carga.

Autotest rápido — tapa la respuesta. Un colega dice: “La cooperación obviamente evolucionó porque es mejor para todos — mira cuánto más rico es un mundo cooperativo”. Usando solo lo que sabes sobre la prueba de invasión, nombra las dos cosas que esa afirmación tiene mal.

Respuesta. (1) “Mejor para todos” es un argumento de bienestar del grupo, pero la prueba de invasión trata de la ventaja individual frente a la población actual — una estrategia solo es estable si ningún mutante gana más que ella, sin importar el bienestar del grupo (estabilidad ≠ optimalidad; ve el mundo de todo Palomas pagando 3 y aun así invadible). (2) La afirmación se salta el mecanismo por completo: nunca nombra el conjunto de estrategias ni comprueba E(I,I)E(J,I)E(I,I) \ge E(J,I) — es una historia ad hoc. La cooperación puede ser estable, pero solo vía repetición/parentesco/estructura que de verdad supere la prueba, e incluso entonces el equilibrio de deserción también es estable (biestabilidad).

Vuelta a lo básico: Halcón–Paloma con V = 6, C = 10. ¿Cuál es la fracción ESS mixta de Halcones, y qué dice la prueba de invasión sobre una población situada ahí?

Resumen

Ahora habéis visto el modelo en su punto más poderoso — fijando cuándo la cooperación puede y no puede ser estable — y en su punto más honesto, catalogando dónde deja de ser fiable. Las dos mitades son la misma destreza: aplica la prueba, y luego respeta sus límites.

Big picture

Cooperación, despilfarro y los límites de la ESS

  • ESS: cooperación y límites
    • Dilema del prisionero iterado
      • La sombra del futuro w hace que la memoria compense
      • TFT: amable, vengativa, indulgente
    • TFT solo es casi una ESS
      • Vence a AllD: E(TFT,TFT)≈3 > E(AllD,TFT)≈1
      • Empata con AllC en ambas cláusulas → neutral, deriva hacia dentro
      • Población ablandada, luego invadida por AllD
    • AllD es una ESS estricta → mundo biestable
      • El mutante amable se come el pago del primo, nunca se recupera
      • Dos cuencas; la historia/dependencia del camino decide
    • Dinámica del replicador = el motor
      • dp/dt = p(1−p)(W_A − W_B): lo más apto que la media crece
      • ESS = atractor (punto de reposo asintóticamente estable)
      • Los lagartos de PPT orbitan → sin atractor, sin ESS
    • Dónde miente el modelo
      • Estabilidad ≠ optimalidad (Halcón–Paloma 1.2 vs 3)
      • Cero, una o muchas ESS
      • Los supuestos infinita / bien mezclada / no emparentada se rompen
      • Instantánea estática de un juego que coevoluciona y deriva
      • Narración descuidada + falacia naturalista
Pregunta 1 de 60 correct

¿Por qué Tit-for-Tat NO es una ESS estricta, incluso cuando la sombra del futuro es alta?

Check your answer to continue.

Ese es el arco: de “¿es II ininvadible?” a un conocimiento práctico completo de cuándo la cooperación puede ser estable, qué motor lleva a las poblaciones allí, y cada lugar donde la pulcra historia del modelo se deshilacha. Úsalo como un buen mecánico usa una llave dinamométrica — con precisión, y sabiendo exactamente qué no puede medir.

Marcar lección como completada