Gemini 3.7 Flash de Google mejora radicalmente tras el fracaso de su versión anterior

Compartir noticia

Google lanzó Gemini 3.7 Flash el 13 de agosto, apenas tres semanas después del estreno de Gemini 3.6 Flash, un modelo que no logró ni siquiera generar archivos funcionales. El salto cualitativo es notorio: la nueva versión crea software ejecutable desde el primer intento, sin necesidad de correcciones ni seguimientos.

Gemini 3.7 Flash acepta hasta un millón de tokens de entrada, devuelve 64.000, procesa imágenes, vídeo, audio y PDF, y puede invocar herramientas externas. Está disponible desde el primer día en más de 160 países y cuesta 0,75 dólares por millón de tokens de entrada hasta el 31 de diciembre, la mitad que su predecesor, antes de subir a 1,50 dólares el 1 de enero.

Genera código limpio al primer intento

En una prueba de generación de código «zero-shot» (sin ejemplos previos ni oportunidad de autocorrección), el modelo recibió un único prompt para crear un juego de navegador. Gemini 3.7 Flash entregó un archivo funcional en 2 minutos y 13 segundos. El juego era jugable desde el primer intento, con sintaxis limpia, lógica de colisión y puntuación sólida, y calidad visual superior a lo esperable en su rango de precio.

El contraste con Gemini 3.6 Flash, lanzado el 21 de julio, es elocuente. Aquella versión produjo HTML malformado, elementos que no se renderizaban, y ni siquiera pudo reparar su propio código tras instrucciones adicionales. El equipo de Decrypt tuvo que recurrir a DeepSeek para detectar 11 errores y aplicar 8 correcciones antes de hacerlo jugable.

La mejora en generación de código se sitúa cerca del rendimiento de GPT-5.6 Sol en pruebas anteriores. El modelo ejecuta especificaciones con solvencia, aunque instrucciones vagas producen resultados igualmente imprecisos.

Escritura creativa mediocre y razonamiento con fisuras

En una prueba de escritura creativa que exigía mantener una paradoja temporal cerrada a lo largo de miles de palabras, Gemini 3.7 Flash construyó una trama argumental coherente pero incumplió la norma estructural central: el protagonista comprendía el bucle causal antes de regresar a su tiempo, contraviniendo la instrucción explícita del prompt.

La prosa resultante exhibe marcas evidentes de generación automática: cada sustantivo llega acompañado de dos adjetivos («torres hiperluminiscentes», «tierra húmeda y cubierta de musgo»), patrón típico de la selección probabilística de tokens. El resultado choca con modelos especializados como Qwopus3.5-27B-v3, un ajuste fino de código abierto que respetó la restricción del prompt y produjo un texto de mayor calidad literaria, ejecutándose además en una sola GPU de consumo sin coste por consulta.

En razonamiento lógico, Gemini 3.7 Flash falló el clásico acertijo del puente. Respondió 17 minutos aplicando la solución memorizada de la versión estándar del problema, sin percatarse de que el prompt omitía deliberadamente la restricción de que solo dos personas pueden cruzar a la vez. La respuesta correcta es 10 minutos: todos cruzan juntos al ritmo de la persona más lenta. Claude Fable 5 cometió el mismo error en julio, pero al menos explicitó su suposición; Gemini declaró la restricción inexistente como un hecho.

Más grave aún: el modelo se contradijo dentro de su propia respuesta. Argumentó que enviar juntas a las dos personas más lentas sería ineficiente porque alguien debería devolver la antorcha, y luego presentó una solución final en la que las dos personas más lentas cruzan precisamente juntas.

Rendimiento mixto: excelente en código, insuficiente en lógica

Google afirma en sus propios benchmarks que Gemini 3.7 Flash supera a Claude Sonnet 5 y GPT-5.6 Terra en 11 de 18 categorías evaluadas. Los números destacados incluyen 1.588 puntos Elo en la clasificación de desarrollo web de Code Arena y 30,4% en AutomationBench, aunque ambos provienen de metodología interna de Google.

En la práctica, el modelo demuestra una mejora sustancial en generación de código funcional desde el primer intento, una tarea en la que su antecesor fracasó por completo. Sin embargo, persisten debilidades notorias en razonamiento lógico y creatividad literaria, ámbitos en los que modelos gratuitos de menor tamaño producen mejores resultados.

Gemini 3.7 Flash consolida su posición como herramienta económica para ordenar texto, comprimir sesiones de agentes antes de que colapsen bajo su propio contexto y resumir documentos extensos. No es el modelo al que acudir cuando un problema requiere razonamiento profundo, pero ejecuta con solvencia las tareas repetitivas que justifican su existencia en el catálogo.

El lanzamiento de Gemini 3.7 Flash se enmarca en una tendencia más amplia de modelos económicos cada vez más capaces. Como vimos recientemente en el lanzamiento de Fusion por OpenRouter, que combina varios modelos baratos para igualar el rendimiento de Claude Fable 5, la frontera entre modelos de bajo coste y flagship se está difuminando rápidamente en ciertos tipos de tareas.

La fuente original de este análisis es una revisión técnica publicada por el medio especializado Decrypt.

Fuente: Decrypt · Esta información ha sido elaborada por la redacción de Criptonews con apoyo de herramientas editoriales automatizadas.

Noticias relacionadas

Wall Street adoptó el staking como dividendo, pero Ethereum y Solana quieren reducirlo

Grayscale convierte las recompensas de staking en distribuciones en efectivo mientras Ethereum y Solana estudian rebajar el rendimiento a nivel de protocolo.

Apple recurre a Alibaba para construir su modelo de IA destinado al mercado chino

La compañía de Cupertino habría entrenado un modelo propio con ayuda de Alibaba para sortear las restricciones regulatorias y llevar Apple Intelligence a los iPhone en China.

Standard Chartered lanza su stablecoin en dólares de Hong Kong tras obtener licencia

Anchorpoint Financial inicia el despliegue limitado de HKDAP, su stablecoin respaldada por dólar de Hong Kong, con HashKey Exchange y OSL Group como distribuidores autorizados.

Alibaba libera su modelo de IA más potente gratis y casi iguala a Claude y ChatGPT

Qwen3.8-Max llega con 2,4 billones de parámetros y es el primer modelo Max de Alibaba disponible con pesos abiertos. La compañía china reconoce que aún pierde en algunos benchmarks frente a los estadounidenses, pero gana en distribución y coste.

Las gafas de Meta bajo la lupa: investigaciones y críticas por invasión de privacidad

Las gafas inteligentes con IA de Meta acumulan denuncias, investigaciones gubernamentales y creciente rechazo público por el uso indebido de grabaciones secretas y recopilación de datos personales.

Google retira su herramienta de IA para crear imágenes satelitales falsas un día después de lanzarla

La función Nano Banana permitía generar escenas satelitales ficticias desde Google Earth, lo que alarmó a investigadores que verifican noticias y conflictos con estas imágenes.