Google lanzó Gemini 3.7 Flash el 13 de agosto, apenas tres semanas después del estreno de Gemini 3.6 Flash, un modelo que no logró ni siquiera generar archivos funcionales. El salto cualitativo es notorio: la nueva versión crea software ejecutable desde el primer intento, sin necesidad de correcciones ni seguimientos.
Gemini 3.7 Flash acepta hasta un millón de tokens de entrada, devuelve 64.000, procesa imágenes, vídeo, audio y PDF, y puede invocar herramientas externas. Está disponible desde el primer día en más de 160 países y cuesta 0,75 dólares por millón de tokens de entrada hasta el 31 de diciembre, la mitad que su predecesor, antes de subir a 1,50 dólares el 1 de enero.
Genera código limpio al primer intento
En una prueba de generación de código «zero-shot» (sin ejemplos previos ni oportunidad de autocorrección), el modelo recibió un único prompt para crear un juego de navegador. Gemini 3.7 Flash entregó un archivo funcional en 2 minutos y 13 segundos. El juego era jugable desde el primer intento, con sintaxis limpia, lógica de colisión y puntuación sólida, y calidad visual superior a lo esperable en su rango de precio.
El contraste con Gemini 3.6 Flash, lanzado el 21 de julio, es elocuente. Aquella versión produjo HTML malformado, elementos que no se renderizaban, y ni siquiera pudo reparar su propio código tras instrucciones adicionales. El equipo de Decrypt tuvo que recurrir a DeepSeek para detectar 11 errores y aplicar 8 correcciones antes de hacerlo jugable.
La mejora en generación de código se sitúa cerca del rendimiento de GPT-5.6 Sol en pruebas anteriores. El modelo ejecuta especificaciones con solvencia, aunque instrucciones vagas producen resultados igualmente imprecisos.
Escritura creativa mediocre y razonamiento con fisuras
En una prueba de escritura creativa que exigía mantener una paradoja temporal cerrada a lo largo de miles de palabras, Gemini 3.7 Flash construyó una trama argumental coherente pero incumplió la norma estructural central: el protagonista comprendía el bucle causal antes de regresar a su tiempo, contraviniendo la instrucción explícita del prompt.
La prosa resultante exhibe marcas evidentes de generación automática: cada sustantivo llega acompañado de dos adjetivos («torres hiperluminiscentes», «tierra húmeda y cubierta de musgo»), patrón típico de la selección probabilística de tokens. El resultado choca con modelos especializados como Qwopus3.5-27B-v3, un ajuste fino de código abierto que respetó la restricción del prompt y produjo un texto de mayor calidad literaria, ejecutándose además en una sola GPU de consumo sin coste por consulta.
En razonamiento lógico, Gemini 3.7 Flash falló el clásico acertijo del puente. Respondió 17 minutos aplicando la solución memorizada de la versión estándar del problema, sin percatarse de que el prompt omitía deliberadamente la restricción de que solo dos personas pueden cruzar a la vez. La respuesta correcta es 10 minutos: todos cruzan juntos al ritmo de la persona más lenta. Claude Fable 5 cometió el mismo error en julio, pero al menos explicitó su suposición; Gemini declaró la restricción inexistente como un hecho.
Más grave aún: el modelo se contradijo dentro de su propia respuesta. Argumentó que enviar juntas a las dos personas más lentas sería ineficiente porque alguien debería devolver la antorcha, y luego presentó una solución final en la que las dos personas más lentas cruzan precisamente juntas.
Rendimiento mixto: excelente en código, insuficiente en lógica
Google afirma en sus propios benchmarks que Gemini 3.7 Flash supera a Claude Sonnet 5 y GPT-5.6 Terra en 11 de 18 categorías evaluadas. Los números destacados incluyen 1.588 puntos Elo en la clasificación de desarrollo web de Code Arena y 30,4% en AutomationBench, aunque ambos provienen de metodología interna de Google.
En la práctica, el modelo demuestra una mejora sustancial en generación de código funcional desde el primer intento, una tarea en la que su antecesor fracasó por completo. Sin embargo, persisten debilidades notorias en razonamiento lógico y creatividad literaria, ámbitos en los que modelos gratuitos de menor tamaño producen mejores resultados.
Gemini 3.7 Flash consolida su posición como herramienta económica para ordenar texto, comprimir sesiones de agentes antes de que colapsen bajo su propio contexto y resumir documentos extensos. No es el modelo al que acudir cuando un problema requiere razonamiento profundo, pero ejecuta con solvencia las tareas repetitivas que justifican su existencia en el catálogo.
El lanzamiento de Gemini 3.7 Flash se enmarca en una tendencia más amplia de modelos económicos cada vez más capaces. Como vimos recientemente en el lanzamiento de Fusion por OpenRouter, que combina varios modelos baratos para igualar el rendimiento de Claude Fable 5, la frontera entre modelos de bajo coste y flagship se está difuminando rápidamente en ciertos tipos de tareas.
La fuente original de este análisis es una revisión técnica publicada por el medio especializado Decrypt.
Fuente: Decrypt · Esta información ha sido elaborada por la redacción de Criptonews con apoyo de herramientas editoriales automatizadas.