En los últimos meses, Epoch AI ha convertido una actividad doméstica rutinaria en una prueba de fuego para la inteligencia artificial. El proyecto, llamado Furniture Assembly Benchmark (FAB) consiste en montar tres artículos de IKEA introducir fallos a propósito y documentar cada etapa con fotografías. Estas imágenes, acompañadas del manual oficial y de herramientas de ampliación, se presentan a diversos modelos de IA con la consigna de determinar si el mueble está correctamente ensamblado y, de no ser así, localizar el error.
Método del benchmark FAB
Para que la tarea no se reduzca a una simple inspección visual, a cada modelo se le entrega un conjunto completo: la foto del mueble en construcción, el manual de instrucciones de IKEA, una herramienta de zoom para examinar áreas específicas y un intérprete de Python que permite ejecutar código auxiliar. El desafío radica en correlacionar los diagramas del manual con las piezas reales capturadas desde ángulos concretos, recrear mentalmente los pasos seguidos por la persona y detectar incongruencias como una pieza al revés o mal alineada. Incluso se continuó el montaje después de introducir el fallo, de modo que el error no fuese siempre el último paso visible, aumentando la complejidad del análisis para la IA.
Evolución del rendimiento: de 28 % a 80 %
Los resultados obtenidos en menos de un año son sorprendentes. En noviembre de 2025 el modelo Claude 4,5 lideraba la prueba con una tasa de aciertos del 28 %. Diez meses después, en septiembre de 2026GPT-6 Astra alcanzó un 80 % de precisión, multiplicando por casi tres la capacidad de detección de errores. Además, el tiempo medio necesario para procesar cada fotografía se situó en tres minutos lo que representa entre dos y diez veces menos tiempo que los modelos que ocupaban los primeros puestos en la edición anterior.
¿Qué mide realmente este benchmark?
Más allá de la mera identificación de piezas mal colocadas, FAB busca evaluar la capacidad de razonamiento abstracto de los sistemas de IA. Se trata de comprobar si una máquina puede interpretar instrucciones simbólicas —en este caso, los diagramas de IKEA— y relacionarlas con objetos físicos del mundo real. Este tipo de habilidad es esencial para aplicaciones futuras, como asistir en la reparación de electrodomésticos o vehículos siguiendo documentación técnica, áreas en las que la evaluación mediante cálculos matemáticos o programación tradicional resulta insuficiente.
Sin embargo, el benchmark no implica que la IA sea capaz de ejecutar físicamente el proceso de montaje. La prueba se limita a la observación y verificación: reconocer que una pieza está invertida a partir de una foto y un manual es muy distinto a manipular físicamente los componentes, resolver imprevistos y completar el ensamblaje sin intervención humana. Por ello, el FAB se posiciona como un indicador de razonamiento visual y espacial no como una medida de destrezas robóticas.



