
Un conocido desarrollador le planteó a la red neuronal una tarea difícil en un popular juego. Uyan Zhou le encargó al modelo GPT Astra extraer un valioso diamante. El programador activó la grabación de pantalla y se fue a dormir tranquilamente esa noche. Por la mañana, la piedra preciosa ya estaba en el inventario del personaje del juego. Los autores del experimento publicaron un toolkit especial en acceso abierto completo. El detalle clave del experimento radica en el método de control del ordenador. El agente prescinde por completo de mods especiales y de interfaces de programación. El modelo simplemente observa la pantalla y mueve un ratón convencional. La inteligencia artificial pulsa de forma autónoma las teclas necesarias del teclado. El kit para el sistema operativo Windows solo sabe hacer tres cosas. Transmite capturas de pantalla ordinarias al agente y envía eventos de entrada. El toolkit permite verificar opcionalmente el resultado obtenido de forma visual. El propio modelo y el cliente del popular juego no están incluidos en el paquete. El guardado del mundo y la interfaz de memoria interna también están completamente ausentes.
La configuración del proyecto lleva solo unos pocos pasos sencillos para el usuario. La carpeta debe abrirse como proyecto local en un ordenador con Windows. El usuario debe entrar al mundo y dejar la ventana del juego visible. Luego hay que pasarle al agente el repositorio junto con el objetivo del juego. Uyan Zhou aclaró por separado la total ausencia de conocimientos previos sobre el juego. Todas las habilidades necesarias el agente las fue construyendo sobre la marcha tras recibir la tarea. El código fuente se publicó precisamente para facilitar futuras ejecuciones complejas. El desarrollador no dio instrucciones concretas como excavar túneles largos. El modelo eligió de forma autónoma la estrategia de excavar túneles largos en paralelo. En otra ejecución, el agente encontró una solución al problema mucho más ingeniosa. Tras dos caídas mortales, el modelo colocó un simple bote de madera. Este truco permitió absorber por completo el daño de una caída fuerte. El personaje llegó con éxito hasta el fondo de una cueva profunda con vida.
El escepticismo en los comentarios fue tan abundante como el entusiasmo genuino. La ejecución transcurrió en un modo pacífico especial sin aparición de mobs. La tarea se redujo en la práctica a la simple búsqueda del recurso necesario. En el tercer minuto de la grabación, el agente pasó junto a un mineral de diamante. El modelo simplemente no notó el valioso recurso durante la búsqueda. Un humano también puede pasarlo por alto, pero la probabilidad es significativamente menor. El modelo activó y desactivó la pantalla de depuración repetidamente sin motivo aparente. El agente rompía un banco de trabajo ordinario con un pico en lugar de usar el hacha correcta. Las antorchas se colocaban donde la iluminación no era necesaria en absoluto. El desarrollador no indicó públicamente el gasto exacto de tokens en ningún momento. Zhou le pidió a un empleado de OpenAI que le restableciera el límite. Este paso era necesario para poder llevar a cabo sesiones de juego más largas. El equipo planea destilar las acciones obtenidas en el modelo local Qwen. El nuevo modelo cuenta con veintisiete mil millones de parámetros útiles.
El toolkit fue desarrollado por Zhou junto a su colega Tianyu Wei. El repositorio se distribuye bajo la licencia especial Apache 2.0. El propio escenario del diamante lleva tiempo siendo una prueba de calidad estándar. El entorno Minecraft Diamond se estructura en torno a doce etapas secuenciales. El camino hacia la extracción del diamante requiere avanzar por el árbol tecnológico. El jugador necesita dominar más de trescientas setenta y nueve recetas de crafteo. El control del ordenador se convirtió en la dirección principal del nuevo modelo Astra. Esta red neuronal se lanzó oficialmente el tres de septiembre del año en curso. En las simulaciones del benchmark OSWorld, el modelo muestra excelentes resultados. El nuevo indicador alcanza el setenta y dos por ciento frente al sesenta y cinco. La versión anterior Sol tardaba setenta y cinco minutos en completar la tarea. El nuevo modelo resuelve una tarea equivalente en cuarenta minutos.
