"No hay lenguaje ahí fuera”: Atlas quiere hacer con el mundo físico lo que los LLM hicieron con internet

Uno se pasa por el anuncio oficial de Atlas y la cosa no parece para tanto. Hace ya tiempo que los modelos de IA generativa de vídeo son capaces de crear todo tipo de escenas con un realismo fantástico. Sin embargo este nuevo modelo quiere ir más allá de la IA generativa para dar el salto a los prometedores «modelos del mundo». Atlas es el resultado de ese esfuerzo, y lo cierto es que la propuesta es llamativa por dos cosas: la primera, por cómo logra reconstruir nuestro mundo a partir de información limitada. La segunda, porque quien está detrás es Fei-Fei Li, considerada como la «madrina de la IA».

Atlas no es otro generador de vídeos más. World Labs lo describe como un modelo multimodal entrenado desde cero para operar con texto, imágenes, posiciones de cámara, mapas de profundidad y secuencias de vídeo. Todos esos tipos de entrada se combinan para crear un contexto espacial común que luego permite generar nuevas observaciones que son coherentes con el espacio 3D que percibe el modelo. Técnicamente se denomina un multimodal autoregressive diffusion transformer, pero aquí lo que se predice no es el siguiente token de una palabra o frase, sino lo que debería verse a continuación desde una determinada posición del espacio.

Leer noticia completa →