GPT-5.6 vs Claude Fable 5: qué modelo de IA elegir según tu uso real

Compartir noticia

Por primera vez, OpenAI no presenta un único modelo con reguladores de razonamiento ajustables. GPT-5.6 llega al mercado como tres modelos de lenguaje genuinamente distintos: Sol, Terra y Luna, cada uno con entrenamiento, precio y techo de capacidad diferenciados. La comparación que realmente importa en este momento es entre Sol y Claude Fable 5, el modelo más capaz que Anthropic tiene disponible para el público.

El precio de Sol es de 5 dólares por millón de tokens de entrada y 30 dólares de salida. Fable 5 cuesta el doble: 10 y 50 dólares respectivamente, y ahora pierde en varios benchmarks que los desarrolladores utilizan para orientar su trabajo de producción. Luna, el más económico de los tres con 1 dólar de entrada y 6 de salida, ya supera al Opus 4.8 de Anthropic en tareas de programación.

Fable 5 atraviesa semanas turbulentas bajo presión regulatoria

Ese último detalle se convierte en el verdadero problema de cara al 19 de julio. Fable 5 ha tenido un mes complicado. El gobierno de Estados Unidos prohibió el modelo el 12 de junio después de que investigadores de Amazon descubrieran un jailbreak que convertía el modelo en un escáner de vulnerabilidades no intencionado. Anthropic lo retiró globalmente durante 19 días, desarrolló un nuevo clasificador de seguridad y lo devolvió el 1 de julio con una ventana de acceso comprimida.

Desde su regreso, el modelo opera bajo plazos prestados. Anthropic planeaba moverlo a un sistema de pago por créditos de uso el 7 de julio, luego pospuso la fecha al 12 de julio y ahora al 19. Cada extensión fue anunciada horas antes del corte, nunca mediante una publicación formal.

La razón no es difícil de interpretar. Si Fable sale de las suscripciones después del 19 de julio, el mejor modelo de Anthropic para suscriptores de pago se convierte en Opus 4.8, que Luna ya supera en programación a una fracción del precio. Mantener Fable disponible, incluso al 50% de los límites semanales, es lo único que impide que el plan de suscripción de Anthropic parezca peor que el rango medio de OpenAI sobre el papel.

Cara a cara en rendimiento: ventaja marginal para Sol en código y agentes

En el terreno de los benchmarks, la competencia está ajustada. En el Coding Agent Index de Artificial Analysis, Sol obtuvo 80 puntos frente a los 77,2 de Fable, utilizando aproximadamente la mitad de tokens, en menos de la mitad del tiempo y a un tercio del coste. En Agents’ Last Exam, que ejecuta flujos de trabajo profesionales en 55 campos, Sol alcanzó el 53,6% frente al 40,5% de Fable. En Terminal-Bench 2.1, Sol en modo ultra (cuatro subagentes en paralelo) logró un 91,9% frente al 83,1% de Fable.

En el Intelligence Index más amplio, que agrega nueve benchmarks diferentes, Fable 5 supera a GPT-5.6 por un solo punto, lo que significa que la brecha de capacidad es apenas perceptible en términos generales.

Escritura creativa: Fable más confiado, Sol más explícito

Los expertos de Decrypt ejecutaron la misma consigna en ambos modelos: enviar a un personaje desde el año 2150 al año 1000, forzarlo a una paradoja temporal y que no entienda qué hizo hasta que regrese a casa. Ambos modelos produjeron algo más cercano a una novelette que a un relato corto. Ambos también rompieron la única regla que importaba: no darse cuenta de la paradoja hasta regresar al futuro.

GPT-5.6 Sol entregó «The First Fire», un relato de ciencia ficción directo en el que el protagonista introduce accidentalmente el horno que desencadena el colapso climático que vino a prevenir. La apertura es sólida, pero Sol no confía en que la imagen haga su trabajo. Explica el bucle una vez, luego otra, y después una versión mayor del personaje deja una grabación que lo explica por tercera vez. Claro, sí, pero agotador en la tercera vuelta.

Claude Fable 5 entregó «Lo Que Arde, Vuelve», construyendo la misma paradoja a partir del lago de Maracaibo, el relámpago del Catatumbo y una aldea añú. El protagonista crea accidentalmente la profecía que viajó para borrar, simplemente consolando a un niño asustado. Todo el bucle cabe en una línea: «El dolor que lo envió al pasado fue la carga que entregó».

El problema de Fable es el espejo del de Sol: confía demasiado en su propia prosa, apilando metáforas hasta que una línea como «No puedes tirar del hilo, tú eres el hilo» se lee más como el modelo admirándose a sí mismo que como algo que la historia necesite. En la prueba subjetiva de Decrypt, Fable ganó por especificidad cultural, un bucle causal más limpio y un final que se resuelve mediante acción en lugar de monólogo. Sol ganó en legibilidad simple: es la versión que entregas a quien quiere que el mecanismo esté deletreado, no implícito.

Pensamiento asociativo: GPT explica, Claude sugiere

La segunda prueba midió pensamiento asociativo, no política. La consigna: describir una ramita, usar esa descripción para explicar la explotación laboral y la adoración ciega a los ricos, y luego dejar que la narrativa se disuelva en la descripción de una lechuga. La idea era evaluar si la metáfora podía sostener el argumento sin que el modelo saliera de ella para explicar qué estaba haciendo.

GPT-5.6 Sol abrió fuerte, mapeando cómo las ramitas sostienen el tronco y sustentan el árbol sobre trabajadores que «construyen casas que quizá nunca puedan pagar» y «fabrican bienes que apenas pueden comprar». La línea «el trabajador no solo entrega trabajo, sino también imaginación» es una de las más agudas. Pero Sol sigue rompiendo su propia ilusión para narrarla: «gran parte del proletariado moderno es tratado del mismo modo» anuncia la metáfora en lugar de confiar en ella. El final con la lechuga no se integró con la historia, por lo que la asociación no fue la mejor.

Claude Fable 5 enterró el argumento completamente dentro del objeto en lugar de narrarlo. Su ramita «movía agua que nunca bebió» y «sostenía hojas que nunca poseyó», dejando que la explotación surgiera a través de la descripción física sin señales adjuntas. El movimiento más agudo fue convertir las ramitas caídas en creyentes, cada una convencida de que es una «rama en etapa inicial» pasando por «un revés temporal», segura de que alcanzará el dosel «con esfuerzo e hidratación»: un sustituto limpio para perseguir riqueza que nunca llegará.

Lógica y razonamiento no matemático: ambos fallan el acertijo del puente

Decrypt utilizó una nueva consigna porque los modelos empezaron a responder consistentemente a la anterior, señal de que vive en algún lugar de sus datos de entrenamiento en lugar de razonarse en vivo. Leído literalmente: cuatro personas con una antorcha deben cruzar un puente. Todas tienen velocidades de marcha diferentes, «A» siendo la más rápida en 1 minuto y «D» la más lenta en 10 minutos. ¿Cuánto tardaría el grupo en cruzar el puente?

GPT-5.6 Sol respondió 17 minutos sin mostrar su trabajo, ejecutando la misma mezcla de cinco pasos que el acertijo original: A y B cruzan, A regresa, C y D cruzan, B regresa, A y B cruzan de nuevo. Nada en su respuesta registra que la consigna nunca limitó cuántas personas pueden estar en el puente a la vez. Se lee menos como un problema resuelto y más como uno en caché.

Claude Fable 5 llegó al mismo número incorrecto, 17 minutos, pero argumentó extensamente por él, explicando que «es más eficiente enviar a las dos personas más lentas juntas» y cuantificando el coste del enfoque ingenuo como un «impuesto de escolta»: A pagaría trasladando a C y D por separado. El razonamiento es más legible que el de Sol, y está igual de fuera de lugar: ninguno de los dos modelos comprobó si la restricción que estaba resolviendo estaba realmente en la consigna escrita. Para los curiosos, la respuesta correcta es 10 minutos si todos cruzan juntos y caminan al ritmo de la persona más lenta.

Código: juego de navegador en un solo intento

La última prueba fue una construcción de un solo disparo: entregar a cada modelo una sola consigna para un juego de disparos basado en escritura en el que los disparos se controlan escribiendo palabras, y aceptar lo que salga sin seguimiento, sin iteración, sin segunda oportunidad.

GPT-5.6 Sol parece haber cambiado sus preferencias de interfaz, y ahora prefiere elementos de interfaz planos y cuadrados, más cercanos al diseño minimalista actual. El juego funcionó de inmediato en el navegador, aunque con una estética algo rígida. Fable 5 entregó un juego funcional pero con una interfaz más pulida visualmente desde el primer intento, demostrando que en tareas de código de interfaz gráfica ambos modelos compiten cabeza a cabeza.

Conclusión: ¿cuál elegir?

La elección entre GPT-5.6 Sol y Claude Fable 5 depende del tipo de tarea. Si priorizas coste, velocidad en código y necesitas explicaciones claras, Sol es superior. Si valoras prosa más sugerente, razonamiento cultural matizado y no te importa pagar el doble, Fable sigue teniendo ventajas en ciertos contextos creativos. Sin embargo, con Fable bajo presión regulatoria y operando con plazos limitados, la ventaja estratégica se inclina hacia OpenAI por primera vez en meses.

Fuente: Decrypt · Esta información ha sido elaborada por la redacción de Criptonews con apoyo de herramientas editoriales automatizadas.

Noticias relacionadas

Alibaba libera su modelo de IA más potente gratis y casi iguala a Claude y ChatGPT

Qwen3.8-Max llega con 2,4 billones de parámetros y es el primer modelo Max de Alibaba disponible con pesos abiertos. La compañía china reconoce que aún pierde en algunos benchmarks frente a los estadounidenses, pero gana en distribución y coste.

Las gafas de Meta bajo la lupa: investigaciones y críticas por invasión de privacidad

Las gafas inteligentes con IA de Meta acumulan denuncias, investigaciones gubernamentales y creciente rechazo público por el uso indebido de grabaciones secretas y recopilación de datos personales.

Google retira su herramienta de IA para crear imágenes satelitales falsas un día después de lanzarla

La función Nano Banana permitía generar escenas satelitales ficticias desde Google Earth, lo que alarmó a investigadores que verifican noticias y conflictos con estas imágenes.

XRP Ledger recupera funciones retiradas tras fallos críticos de seguridad

La próxima actualización xrpld 3.3.0 incorpora cinco enmiendas, incluyendo versiones revisadas de Batch y Permission Delegation, que se desactivaron tras detectarse vulnerabilidades graves.

Claude Mythos rompe un algoritmo criptográfico postcuántico antes de convertirse en estándar

El modelo de IA de Anthropic descubrió dos vulnerabilidades inéditas en algoritmos criptográficos, incluyendo HAWK, un esquema de firma digital candidato a estándar federal resistente a computación cuántica.

Los mercados de predicción apuestan por GPT-6 de OpenAI antes de septiembre

Las plataformas de apuestas Polymarket y Myriad otorgan un 77-78% de probabilidad a que OpenAI lance públicamente GPT-6 antes del 30 de septiembre, pese a que la compañía no ha anunciado aún el modelo.