ARTEMIS: el agente de Google que prueba apps Android solo
Google abrió el código de ARTEMIS, un agente que controla un teléfono Android con lenguaje natural y superó el 99% de tareas en el benchmark AndroidWorld. Qué significa para un equipo técnico.
Justo Torrente Olmos · · 5 min

En esta guía
Su equipo lanza una versión nueva de la app y, antes de publicarla, alguien tiene que tocar cada pantalla a mano para confirmar que nada se rompió. Esa revisión manual se repite en cada release, consume horas de alguien con criterio técnico y, aun así, algo se escapa.
Google acaba de abrir el código de ARTEMIS, un agente que hace ese trabajo de otra forma: en lugar de leer el código o llamar una API, controla el teléfono igual que lo haría una persona. Toca, desliza, espera a que cargue una pantalla y sigue. La instrucción que recibe es en lenguaje natural, no un script de pruebas.
ARTEMIS controla el teléfono como lo haría una persona
Qué es ARTEMIS y qué lo distingue de un asistente de IA genérico: controla la pantalla por lenguaje natural, no responde texto. La mayoría de las herramientas de automatización de pruebas en Android dependen de que la app expone ganchos técnicos: identificadores de elementos, una API de testing, hooks que el equipo de desarrollo tuvo que programar antes. ARTEMIS no necesita nada de eso. Interpreta la pantalla visualmente y actúa sobre ella, exactamente como lo haría alguien que nunca vio el código fuente.
Esa diferencia importa porque la mayoría de las apps reales, sobre todo las que ya están en producción desde hace años, no fueron construidas pensando en que un agente las iba a operar después. Un agente que necesita una interfaz preparada de antemano sirve para apps nuevas. Un agente que lee la pantalla como una persona sirve para cualquier app que ya existe.
Es el mismo principio que desarrollamos al explicar agentes de IA en lenguaje natural sin nodos: la diferencia real no está en el modelo de lenguaje detrás, está en si el agente depende de que alguien le prepare el camino o si puede actuar directamente sobre lo que ya existe.
AndroidWorld mide qué tan bien funciona un agente así
Qué es AndroidWorld y por qué una tasa de finalización de tareas superior al 99% es una señal relevante para quien evalúa agentes de IA. Un agente que promete controlar una interfaz necesita algo más que una demo convincente para que un equipo técnico lo tome en serio. AndroidWorld es el benchmark que Google Research diseñó para eso: un conjunto de tareas reales dentro de apps Android reales, donde se mide si el agente completa el flujo completo, no solo el primer paso.
ARTEMIS completó más del 99% de esas tareas. Es una cifra alta, pero conviene leerla con el contexto correcto: AndroidWorld evalúa tareas estandarizadas sobre apps conocidas. Una app propia, con una lógica de negocio particular o una pantalla poco común, puede comportarse distinto. El número sirve como punto de partida para evaluar al agente, no como garantía de que funcionará igual en cualquier app.
El repositorio y la documentación del benchmark están disponibles en github.com/google-research/android_world, para cualquier equipo que quiera revisar la metodología antes de confiar en el número.
Se conecta a las herramientas que su equipo ya usa
ARTEMIS no vive aislado de la forma en que los equipos de desarrollo ya trabajan: se conecta a Claude Code, Codex y Cursor, tres entornos que muchos equipos técnicos ya tienen instalados. Eso significa que no hace falta aprender una herramienta nueva desde cero para empezar a pedirle que verifique un flujo: se le pide desde el mismo lugar donde ya se escribe y revisa código.
Esa integración es parte de por qué el proyecto acumula más de 11.000 stars en GitHub en poco tiempo: no es una herramienta que compite con el flujo de trabajo existente, se suma a él.
Si su equipo ya usa Claude Code en el día a día, en Claude Code para equipos tech: tome el control de sus procesos explicamos qué tareas puede absorber la herramienta y, más importante, cuáles no: el criterio técnico y el conocimiento del negocio siguen siendo responsabilidad de la persona, no de la herramienta.
Qué criterio aplicar antes de sumar ARTEMIS a un proceso real
ARTEMIS es un proyecto de investigación de código abierto, no un servicio que Bprosys opere ni venda. Antes de sumar cualquier agente, incluido uno con un resultado de benchmark tan alto, a un proceso de control de calidad real, conviene aplicar el mismo criterio que ya usamos con nuestros clientes al evaluar agentes de IA:
- Que primero proponga, después opere supervisado. Un agente nuevo no entra directo a decidir qué release sale a producción. Primero corre en paralelo a la revisión manual, y solo después de probar consistencia se le da más autonomía.
- Que haya un registro de lo que hizo. Si un agente marcó una pantalla como correcta y no lo estaba, alguien tiene que poder revisar qué vio y por qué decidió eso. Sin ese registro, no hay manera de confiar en el resultado ni de corregirlo.
- Que el proceso que automatiza ya esté claro. Un agente que revisa pantallas más rápido no mejora un proceso de QA mal definido, solo lo ejecuta más rápido. Antes de sumar un agente de este tipo, vale la pena mapear qué se revisa hoy y por qué.
- Que alguien con criterio de negocio siga en el circuito. ARTEMIS puede confirmar que un botón responde. No sabe si esa respuesta es la correcta según una regla de negocio que nadie documentó. Esa parte sigue siendo de la persona.
ARTEMIS es, sobre todo, una señal clara de hacia dónde va el control de calidad de software: agentes que operan interfaces en lenguaje natural, sin necesitar que nadie les prepare el camino antes. Si su equipo ya evalúa sumar un agente a algún proceso, el criterio que importa no es qué tan buena es la demo, sino qué controles tiene detrás antes de confiarle una decisión real.
Si quiere evaluar con criterio qué agente conviene para su operación y bajo qué controles, hablemos 20 minutos sobre su caso. Ese mismo criterio de gobernanza es el que aplicamos en nuestro servicio de agentes de IA con gobernanza.
Preguntas frecuentes sobre ARTEMIS y los agentes de IA que prueban apps Android
¿Qué es ARTEMIS y en qué se diferencia de un asistente de IA que solo responde texto?
ARTEMIS es un agente de código abierto que no se queda en el chat: controla directamente la pantalla de un teléfono Android, tocando y deslizando como lo haría una persona, a partir de una instrucción en lenguaje natural. Ese mismo principio, un agente que actúa sobre una interfaz sin depender de una API expuesta, es el que desarrollamos en agentes de IA en lenguaje natural sin nodos.
¿Qué es AndroidWorld y qué mide exactamente?
AndroidWorld es el benchmark de Google Research que evalúa a agentes de IA ejecutando tareas reales dentro de apps Android: abrir una app, encontrar una pantalla, completar un flujo de varios pasos. El repositorio del proyecto está documentado en github.com/google-research/android_world.
¿ARTEMIS es un producto o un servicio que opera Bprosys?
No. ARTEMIS es un proyecto de investigación de código abierto de Google, no algo que Bprosys venda, opere o soporte. Lo que sí aplica Bprosys es el mismo criterio de autonomía progresiva antes de sumar cualquier agente a un proceso real, explicado más abajo en qué criterio aplicar antes de sumar ARTEMIS a un proceso real.
¿ARTEMIS reemplaza a un equipo humano de control de calidad?
No reemplaza el criterio del equipo, pero sí puede absorber la parte repetitiva de revisar manualmente que una app siga funcionando después de cada cambio. Es el mismo matiz que ya vale para otras herramientas de desarrollo: en Claude Code para equipos tech explicamos por qué una herramienta que ejecuta más rápido no sustituye el criterio técnico ni el conocimiento del negocio.
¿Cómo se conecta ARTEMIS a herramientas como Claude Code, Codex o Cursor?
ARTEMIS se integra con estos entornos de desarrollo para que un equipo pueda pedirle, desde el mismo lugar donde ya trabaja, que verifique un flujo completo en un dispositivo Android real o emulado. Si su equipo ya usa alguna de estas herramientas, en Claude Code para equipos tech detallamos cómo se adopta sin amplificar procesos que ya están mal definidos.
¿Qué tan confiable es un agente que completa el 99% de las tareas de un benchmark?
Una tasa de finalización alta en un benchmark público es una señal fuerte, no una garantía para cualquier app propia. AndroidWorld evalúa tareas estandarizadas; una app con flujos particulares, pantallas poco comunes o reglas de negocio específicas puede comportarse distinto. Por eso conviene tratarlo como punto de partida y no como veredicto final, siguiendo el mismo criterio de agentes de IA en lenguaje natural sin nodos.
Cómo lo resolvemos en Bprosys
Si este tema ya frena a su equipo, en estas páginas le contamos cómo lo trabajamos y qué incluye.
- ServicioHiper-Automatización