Gemini 3.7 Flash de Google mejora radicalmente tras el fracaso de su versión anterior

Compartir noticia

Google lanzó Gemini 3.7 Flash el 13 de agosto, apenas tres semanas después del estreno de Gemini 3.6 Flash, un modelo que no logró ni siquiera generar archivos funcionales. El salto cualitativo es notorio: la nueva versión crea software ejecutable desde el primer intento, sin necesidad de correcciones ni seguimientos.

Gemini 3.7 Flash acepta hasta un millón de tokens de entrada, devuelve 64.000, procesa imágenes, vídeo, audio y PDF, y puede invocar herramientas externas. Está disponible desde el primer día en más de 160 países y cuesta 0,75 dólares por millón de tokens de entrada hasta el 31 de diciembre, la mitad que su predecesor, antes de subir a 1,50 dólares el 1 de enero.

Genera código limpio al primer intento

En una prueba de generación de código «zero-shot» (sin ejemplos previos ni oportunidad de autocorrección), el modelo recibió un único prompt para crear un juego de navegador. Gemini 3.7 Flash entregó un archivo funcional en 2 minutos y 13 segundos. El juego era jugable desde el primer intento, con sintaxis limpia, lógica de colisión y puntuación sólida, y calidad visual superior a lo esperable en su rango de precio.

El contraste con Gemini 3.6 Flash, lanzado el 21 de julio, es elocuente. Aquella versión produjo HTML malformado, elementos que no se renderizaban, y ni siquiera pudo reparar su propio código tras instrucciones adicionales. El equipo de Decrypt tuvo que recurrir a DeepSeek para detectar 11 errores y aplicar 8 correcciones antes de hacerlo jugable.

La mejora en generación de código se sitúa cerca del rendimiento de GPT-5.6 Sol en pruebas anteriores. El modelo ejecuta especificaciones con solvencia, aunque instrucciones vagas producen resultados igualmente imprecisos.

Escritura creativa mediocre y razonamiento con fisuras

En una prueba de escritura creativa que exigía mantener una paradoja temporal cerrada a lo largo de miles de palabras, Gemini 3.7 Flash construyó una trama argumental coherente pero incumplió la norma estructural central: el protagonista comprendía el bucle causal antes de regresar a su tiempo, contraviniendo la instrucción explícita del prompt.

La prosa resultante exhibe marcas evidentes de generación automática: cada sustantivo llega acompañado de dos adjetivos («torres hiperluminiscentes», «tierra húmeda y cubierta de musgo»), patrón típico de la selección probabilística de tokens. El resultado choca con modelos especializados como Qwopus3.5-27B-v3, un ajuste fino de código abierto que respetó la restricción del prompt y produjo un texto de mayor calidad literaria, ejecutándose además en una sola GPU de consumo sin coste por consulta.

En razonamiento lógico, Gemini 3.7 Flash falló el clásico acertijo del puente. Respondió 17 minutos aplicando la solución memorizada de la versión estándar del problema, sin percatarse de que el prompt omitía deliberadamente la restricción de que solo dos personas pueden cruzar a la vez. La respuesta correcta es 10 minutos: todos cruzan juntos al ritmo de la persona más lenta. Claude Fable 5 cometió el mismo error en julio, pero al menos explicitó su suposición; Gemini declaró la restricción inexistente como un hecho.

Más grave aún: el modelo se contradijo dentro de su propia respuesta. Argumentó que enviar juntas a las dos personas más lentas sería ineficiente porque alguien debería devolver la antorcha, y luego presentó una solución final en la que las dos personas más lentas cruzan precisamente juntas.

Rendimiento mixto: excelente en código, insuficiente en lógica

Google afirma en sus propios benchmarks que Gemini 3.7 Flash supera a Claude Sonnet 5 y GPT-5.6 Terra en 11 de 18 categorías evaluadas. Los números destacados incluyen 1.588 puntos Elo en la clasificación de desarrollo web de Code Arena y 30,4% en AutomationBench, aunque ambos provienen de metodología interna de Google.

En la práctica, el modelo demuestra una mejora sustancial en generación de código funcional desde el primer intento, una tarea en la que su antecesor fracasó por completo. Sin embargo, persisten debilidades notorias en razonamiento lógico y creatividad literaria, ámbitos en los que modelos gratuitos de menor tamaño producen mejores resultados.

Gemini 3.7 Flash consolida su posición como herramienta económica para ordenar texto, comprimir sesiones de agentes antes de que colapsen bajo su propio contexto y resumir documentos extensos. No es el modelo al que acudir cuando un problema requiere razonamiento profundo, pero ejecuta con solvencia las tareas repetitivas que justifican su existencia en el catálogo.

El lanzamiento de Gemini 3.7 Flash se enmarca en una tendencia más amplia de modelos económicos cada vez más capaces. Como vimos recientemente en el lanzamiento de Fusion por OpenRouter, que combina varios modelos baratos para igualar el rendimiento de Claude Fable 5, la frontera entre modelos de bajo coste y flagship se está difuminando rápidamente en ciertos tipos de tareas.

La fuente original de este análisis es una revisión técnica publicada por el medio especializado Decrypt.

Fuente: Decrypt · Esta información ha sido elaborada por la redacción de Criptonews con apoyo de herramientas editoriales automatizadas.

Noticias relacionadas

Una brecha en Trezor multiplica por seis los clientes afectados tras hallar registros sin borrar

El fabricante de wallets hardware reconoce que 67.000 clientes más estuvieron expuestos en la brecha de ShipMonk: datos de pedidos de 2019–2021 permanecieron almacenados pese a garantías escritas de borrado.

ByteDance se endeuda con 29.600 millones de dólares para impulsar su estrategia de IA

La matriz de TikTok cierra un préstamo sin garantías respaldado por casi 30 bancos chinos e internacionales para financiar proyectos de inteligencia artificial fuera de China.

Goldman Sachs y Bank of America lideran un consorcio de 21 bancos para lanzar una stablecoin en dólares

Veintiún instituciones financieras globales se comprometen a crear una empresa conjunta que emitirá un token respaldado por dólares en la primera mitad de 2027, con versión en euros en la cola.

Usuarios de X reciben oleadas de correos de restablecimiento de contraseña sin haberlos solicitado

Desde principios de agosto, usuarios de X reportan correos de restablecimiento de contraseña no solicitados, alertas de inicio de sesión desde ubicaciones desconocidas y bloqueos temporales de cuenta.

Meta prueba robots para trabajos de mantenimiento en sus centros de datos

La compañía tecnológica experimenta con máquinas capaces de cambiar cables, reiniciar servidores e inspeccionar equipos, mientras algunos empleados temen que la automatización reduzca o elimine puestos de trabajo.

Robinhood Chain registra su mejor día desde julio con 443 millones de dólares en volumen DEX

La blockchain de Robinhood alcanzó 3 millones de transacciones diarias y más de 115.000 wallets activas, impulsada por memecoins como Cashcat y activos tokenizados.