Mundo

Google integra Computer Use en Gemini 3.5 Flash y apunta a una nueva capa de agentes de IA

Google integra Computer Use en Gemini 3.5 Flash, permitiendo a los desarrolladores crear agentes que interactúan con interfaces gráficas. Esta actualización marca un avance significativo en la automatización y el razonamiento de IA.

Google integra Computer Use en Gemini 3.5 Flash y apunta a una nueva capa de agentes de IA
Seguir en Google

Google acaba de mover una de las piezas más importantes de su estrategia para desarrolladores: Computer Use ya viene integrado en Gemini 3.5 Flash, lo que permite construir agentes capaces de ver una interfaz, razonar sobre lo que aparece en pantalla y ejecutar acciones en entornos de navegador, móvil o escritorio. No es una simple mejora incremental de Gemini. Es un paso directo hacia una IA más agente, más útil para automatización y más cercana a tareas reales dentro de software y aplicaciones de trabajo.

El anuncio fue realizado el 24 de junio de 2026 por Google, que presentó a Computer Use integrado en Gemini 3.5 Flash como una herramienta ya incorporada dentro del modelo Flash. Hasta ahora, esta capacidad había aparecido como un modelo separado dentro del ecosistema Gemini 2.5. La diferencia no es menor: al quedar integrada en Gemini 3.5 Flash, Google está simplificando el acceso a una función clave para construir agentes capaces de interactuar con interfaces gráficas, un terreno donde la carrera por la automatización se está acelerando.

La actualización no convierte a Gemini en un operador autónomo sin límites, pero sí entrega a los desarrolladores una pieza concreta para construir agentes que puedan mirar una pantalla, decidir el siguiente paso y ejecutar acciones como clics, escritura o navegación dentro de un entorno controlado.

Qué cambia con Computer Use dentro de Gemini 3.5 Flash

La novedad de fondo es esta: Computer Use deja de ser una capacidad aparte y pasa a formar parte del modelo Flash, el modelo rápido y de menor costo de la familia Gemini que Google está empujando como opción principal para muchas cargas de trabajo de IA aplicada.

Eso importa porque Flash no está pensado solo para responder preguntas o resumir texto. Google lo está posicionando como una base para agentes de software, con buena capacidad de codificación, latencia más baja y un costo inferior al de modelos más pesados. Integrar Computer Use dentro de ese modelo significa que un desarrollador puede usar una sola base para combinar razonamiento, visión de pantalla y ejecución de acciones dentro de un flujo agente.

En la práctica, la función apunta a casos de uso concretos: automatización empresarial, pruebas continuas de software, asistentes operativos, workflows en aplicaciones internas y tareas donde una IA necesita interactuar con una interfaz en lugar de limitarse a devolver texto.

Cómo funciona: Gemini “ve” la pantalla y sugiere acciones

La documentación de Computer Use en Gemini API explica que esta función trabaja a partir de capturas de pantalla. El modelo recibe una imagen del entorno —por ejemplo, una ventana del navegador, una app móvil o una interfaz de escritorio— y a partir de eso genera acciones específicas de interfaz, como clics del mouse, movimientos del cursor o entradas de teclado.

Ese punto es clave porque corrige una exageración fácil: Gemini no toma control de un computador por sí solo. El modelo no “maneja” mágicamente el sistema operativo ni ejecuta directamente las acciones. Lo que hace es analizar la captura, proponer la acción y devolver una salida estructurada. Luego, del lado del cliente, el desarrollador debe construir el entorno que reciba esa instrucción y la ejecute realmente sobre la interfaz.

Dicho de otra forma: Google entrega el cerebro visual y la lógica de acción; el desarrollador tiene que montar las manos.

No es una función mágica: el entorno de ejecución lo construye el desarrollador

Ese matiz técnico es importante para no vender humo. Cuando Google dice que Gemini puede actuar sobre navegador, móvil y escritorio, no está diciendo que cualquier usuario podrá abrir el modelo y pedirle que use una app por sí solo sin ninguna infraestructura adicional. Lo que ofrece es un bloque de construcción para agentes.

Si una empresa quiere que Gemini haga pruebas automáticas en una aplicación, complete formularios internos o navegue por una interfaz corporativa, tiene que construir un sistema alrededor del modelo: enviar capturas, recibir las acciones sugeridas, ejecutarlas en un entorno seguro, devolver nuevos estados de pantalla y repetir el ciclo.

Por eso el anuncio importa sobre todo a desarrolladores y equipos de producto. No es una función de consumo masivo tipo chatbot. Es una capacidad orientada a quienes están construyendo software, automatización o agentes empresariales.

Qué puede hacer Gemini 3.5 Flash con Computer Use

Según Google, Gemini 3.5 Flash ahora puede usarse para crear agentes personalizados capaces de ver, razonar y actuar en varios tipos de entorno. Eso abre la puerta a tareas como:

  • navegar por interfaces web paso a paso;

  • interactuar con aplicaciones de escritorio;

  • automatizar flujos repetitivos dentro de sistemas empresariales;

  • ejecutar pruebas de software sobre interfaces gráficas;

  • completar formularios, validar pantallas o recorrer menús;

  • operar tareas guiadas en entornos móviles.

La idea detrás de Computer Use no es solo que la IA “vea” una imagen. Es que pueda entender qué parte de la interfaz importa, cuál es el siguiente paso lógico y qué acción concreta debería ejecutar para avanzar. En un escenario ideal, eso convierte a Gemini en un motor para agentes que ya no dependen exclusivamente de APIs o de texto, sino que también pueden trabajar sobre pantallas.

Gemini 3.5 Flash suma razonamiento visible y soporte multientorno

Google no solo integró Computer Use dentro de Flash. También agregó varias piezas para hacer más útil esa capacidad en flujos agente. Una de ellas es el campo “intent”, que permite explicar el razonamiento detrás de cada acción. Es decir, el modelo no solo puede devolver “haz clic aquí”, sino también una justificación estructurada sobre qué está intentando hacer.

Eso es relevante por dos razones. La primera es técnica: ayuda a depurar agentes y entender por qué fallan. La segunda es de seguridad y control: si una IA va a operar sobre interfaces, conviene saber qué cree que está haciendo antes de dejarla avanzar.

Además, Google plantea a Gemini 3.5 Flash como su modelo recomendado para Computer Use y destaca su capacidad multientorno, es decir, la posibilidad de aplicar esta lógica en navegador, móvil y escritorio con una misma base de modelo.

Seguridad: Google admite que la función está en preview y puede cometer errores

Acá conviene bajar el entusiasmo. Google presenta Computer Use como una capacidad Preview dentro de Gemini API. Eso significa, en términos prácticos, que no debe tratarse como una herramienta completamente madura para cualquier uso crítico.

La documentación advierte que el sistema puede contener errores y vulnerabilidades de seguridad, y recomienda supervisión estrecha. También sugiere evitar tareas con decisiones críticas, información sensible o acciones difíciles de revertir. Tiene sentido: una IA que interpreta pantallas y propone clics puede equivocarse en cosas tan básicas como identificar un botón, entender el contexto de una ventana o reaccionar ante contenido malicioso incrustado en la interfaz.

Google incluso incorpora opciones de seguridad configurables, incluida una detección opcional de prompt injection basada en el análisis de capturas de pantalla. La idea es identificar instrucciones maliciosas o engañosas embebidas dentro de la propia interfaz que el modelo está observando. No resuelve todos los riesgos, pero muestra que Google entiende que una IA con capacidad de actuar sobre pantallas necesita defensas adicionales.

El modelo detrás del anuncio: rápido, grande y diseñado para trabajo agente

En paralelo al anuncio de Computer Use, Google Cloud mantiene la ficha técnica de Gemini 3.5 Flash en Google Cloud, donde aparece como un modelo con el identificador gemini-3.5-flash, una ventana de contexto de 1.048.576 tokens y una salida máxima de 65.535 tokens.

La empresa lo describe como un modelo con inteligencia cercana a Pro, pero con velocidad y costo más próximos a la línea Flash. En otras palabras, quiere posicionarlo como un equilibrio entre rendimiento y eficiencia para desarrolladores que necesitan construir agentes, automatizaciones o herramientas de codificación sin pagar el costo completo de un modelo más pesado.

Ese posicionamiento ayuda a entender por qué Google eligió justamente Flash para integrar Computer Use. Si la apuesta es empujar agentes que interactúan con aplicaciones, el modelo necesita ser lo bastante capaz para razonar, pero también lo bastante rápido y barato para ejecutarse muchas veces en un mismo flujo.

La gran apuesta: que la IA deje de responder y empiece a operar

El movimiento de Google encaja con una tendencia mucho más grande que una simple actualización de producto. Los principales laboratorios de IA ya no están compitiendo solo por quién responde mejor una pregunta o escribe mejor un bloque de código. La carrera se está moviendo hacia agentes que operan software, toman contexto de una interfaz y ejecutan tareas concretas.

Ahí es donde entra Computer Use. La promesa es que un modelo ya no tenga que depender solo de APIs formales para hacer trabajo útil. También podría interactuar con aplicaciones del mismo modo en que lo hace una persona: mirando una pantalla, identificando un botón, navegando por un menú y ejecutando una acción.

Eso no significa que el problema esté resuelto. De hecho, todavía hay fricciones evidentes: confiabilidad, seguridad, supervisión, errores de interpretación y necesidad de montar entornos de ejecución bastante controlados. Pero sí marca una dirección clara: Google quiere que Gemini sea parte del stack de agentes que no solo conversan, sino que también operan herramientas.

Un paso importante, pero no un “piloto automático” universal

La tentación fácil sería titular que Gemini “ya controla computadoras” y dejarlo ahí. Sería una mala síntesis. Lo correcto es decir que Google integró en Gemini 3.5 Flash una capacidad para construir agentes que pueden interactuar con interfaces gráficas a partir de capturas de pantalla, siempre que el desarrollador implemente el entorno que ejecuta esas acciones.

Eso sigue siendo una noticia importante. Porque reduce la distancia entre el modelo y la tarea real, y convierte a Gemini 3.5 Flash en una plataforma más seria para automatización, testing y agentes empresariales. Pero también obliga a mantener la proporción: la función está en preview, requiere infraestructura adicional y no debería usarse a ciegas en escenarios sensibles.

En el fondo, lo que Google está haciendo no es vender una IA que reemplaza al usuario frente a cualquier pantalla. Está entregando un componente para construir la siguiente generación de agentes: sistemas que ya no solo entienden texto, sino que también pueden mirar una interfaz, decidir un paso y actuar sobre ella dentro de un entorno controlado.