Вход на сайт

Просмотр новости

Найдите то, что Вас интересует

Tenemos un nuevo "benchmark" para la IA: preguntarle si has montado correctamente tus muebles de Ikea o no

Дата публикации: 28-09-2026 13:16:26






A Epoch AI la conocemos por su ambicioso benchmark matemático para la IA, pero sus responsables tuvieron hace tiempo una idea de lo más original. Compraron tres muebles de IKEA, empezaron a montarlos y de vez en cuando hicieron algo mal a propósito. Luego sacaron fotos y se las enseñaron a distintos modelos de IA junto con el manual de instrucciones. La misión de la IA era decidir si el mueble estaba bien montado y si no, encontrar dónde se había encontrado el error. Tenemos una buena noticia: han mejorado a lo grande en eso.
De un 28% a un 80% en apenas diez meses. El dato es sorprendente, porque la mejora de los modelos en el llamado Furniture Assembly Benchmark (FAB) es notable. En noviembre de 2025 el mejor modelo de IA en esta prueba era Claude 4,5, y lograba un 28% de aciertos. En septiembre de 2026 GPT-6 Astra logró el 80%, y no solo acertó mucho más: necesitó una media de tres minutos por foto, entre dos y diez veces menos tiempo que modelos que anteriormente estaban entre los mejores.














No sabemos qué miden los benchmarks de IA. Así que hemos hablado con el español que ha creado uno de los más difíciles




No basta "mirar" una foto. Lo modelos reciben una fotografía del mueble medio montado, el manual oficial de IKEA, una herramienta para ampliar zonas de la imagen y un intérprete de Python. A partir de ahí debe relacionar los diagramas del manual con piezas reales fotografiadas desde ciertos ángulos concretos. El objetivo: reconstruir qué pasos ha seguido la persona que ha montado el mueble y detectar cosas como una pieza colocada al revés. Epoch incluso continuaba montajes después de introducir el fallo para que ese error no fuese necesariamente el último paso visible y así ponérselo más difícil a la IA.
IKEA es solo una excusa. Lo que Epoch AI quiere medir es la capacidad de razonamiento abstracto de los modelos de IA. Es decir, si son capaces de conectar instrucciones abstractas (de los manuales de IKEA, en este caso) con objetos del mundo real. Es una habilidad crítica para que algún día un modelo de IA nos pueda ayudar a reparar un electroméstico on un coche siguiendo documentación técnica. Es fácil evaluar modelos en matemáticas o en programación, pero no lo es en absoluto cuando se trata de evaluar visión o razonamiento espacial y su aplicación a nuestro mundo.





Fuente: Epoch AI.


Pero estamos lejos de robots que nos monten los muebles. Este FAB analiza si una IA puede observar el trabajo hecho por una persona y verificarlo, pero no si puede planificar y ejecutar todo el proceso físicamente desde cero. Así, puede reconocer que una pieza está invertida cuando tenemos delante el manual y tiene una foto para estudiar la situación.  Sin embargo eso es muy distinto a que una máquina pueda manipular las piezas, resolver imprevistos y lograr montar correctamente un mueble.
Falsos positivos. Además, Epoch AI encontró distintos sesgos según la familia de modelos utilizada. Gemini y Qwen tendían a asumir que siempre había fallos y encontraban errores que no existían. Modelos anteriores de OpenAI y Anthropic sufrían el problema contrario: daban por buenos montajes que contenían errores. El proceso demostró que era tan importante buscar errores en el montaje como saber cuándo dejar de buscarlos.









En Xataka

A Sam Altman le han preguntado si entrenar a una IA no es ineficiente. Ha respondido que "entrenar" a un humano lo es más



Vuelve Moravec. El experimento deja una curiosidad ya observada: estamos aprendiendo a medir cada vez mejor cómo los modelos de IA resuelven problemas con una solución que luego podemos verificar. El problema es medirlas cuando el proceso es más ambigüo. Volvemos a la vieja paradoja de Moravec: la inteligencia artificial hace fácil lo difícil y viceversa.
En Xataka | El mundo se está quedando sin datos para seguir entrenando a la IA. China tiene un as en la manga 



Основное содержимое страницы с новостью.

A Epoch AI la conocemos por su ambicioso benchmark matemático para la IA, pero sus responsables tuvieron hace tiempo una idea de lo más original. Compraron tres muebles de IKEA, empezaron a montarlos y de vez en cuando hicieron algo mal a propósito. Luego sacaron fotos y se las enseñaron a distintos modelos de IA junto con el manual de instrucciones. La misión de la IA era decidir si el mueble estaba bien montado y si no, encontrar dónde se había encontrado el error. Tenemos una buena noticia: han mejorado a lo grande en eso.

De un 28% a un 80% en apenas diez meses. El dato es sorprendente, porque la mejora de los modelos en el llamado Furniture Assembly Benchmark (FAB) es notable. En noviembre de 2025 el mejor modelo de IA en esta prueba era Claude 4,5, y lograba un 28% de aciertos. En septiembre de 2026 GPT-6 Astra logró el 80%, y no solo acertó mucho más: necesitó una media de tres minutos por foto, entre dos y diez veces menos tiempo que modelos que anteriormente estaban entre los mejores.

No basta "mirar" una foto. Lo modelos reciben una fotografía del mueble medio montado, el manual oficial de IKEA, una herramienta para ampliar zonas de la imagen y un intérprete de Python. A partir de ahí debe relacionar los diagramas del manual con piezas reales fotografiadas desde ciertos ángulos concretos. El objetivo: reconstruir qué pasos ha seguido la persona que ha montado el mueble y detectar cosas como una pieza colocada al revés. Epoch incluso continuaba montajes después de introducir el fallo para que ese error no fuese necesariamente el último paso visible y así ponérselo más difícil a la IA.

IKEA es solo una excusa. Lo que Epoch AI quiere medir es la capacidad de razonamiento abstracto de los modelos de IA. Es decir, si son capaces de conectar instrucciones abstractas (de los manuales de IKEA, en este caso) con objetos del mundo real. Es una habilidad crítica para que algún día un modelo de IA nos pueda ayudar a reparar un electroméstico on un coche siguiendo documentación técnica. Es fácil evaluar modelos en matemáticas o en programación, pero no lo es en absoluto cuando se trata de evaluar visión o razonamiento espacial y su aplicación a nuestro mundo.

Furniture Assembly Progress Over Time Fuente: Epoch AI.

Pero estamos lejos de robots que nos monten los muebles. Este FAB analiza si una IA puede observar el trabajo hecho por una persona y verificarlo, pero no si puede planificar y ejecutar todo el proceso físicamente desde cero. Así, puede reconocer que una pieza está invertida cuando tenemos delante el manual y tiene una foto para estudiar la situación.  Sin embargo eso es muy distinto a que una máquina pueda manipular las piezas, resolver imprevistos y lograr montar correctamente un mueble.

Falsos positivos. Además, Epoch AI encontró distintos sesgos según la familia de modelos utilizada. Gemini y Qwen tendían a asumir que siempre había fallos y encontraban errores que no existían. Modelos anteriores de OpenAI y Anthropic sufrían el problema contrario: daban por buenos montajes que contenían errores. El proceso demostró que era tan importante buscar errores en el montaje como saber cuándo dejar de buscarlos.

Vuelve Moravec. El experimento deja una curiosidad ya observada: estamos aprendiendo a medir cada vez mejor cómo los modelos de IA resuelven problemas con una solución que luego podemos verificar. El problema es medirlas cuando el proceso es más ambigüo. Volvemos a la vieja paradoja de Moravec: la inteligencia artificial hace fácil lo difícil y viceversa.

En Xataka | El mundo se está quedando sin datos para seguir entrenando a la IA. China tiene un as en la manga 

Схожие новости

#Наименование новостиТональностьИнформативностьДата публикации
1Even AI can’t perfectly assemble Ikea furniture—yet012.2328-09-2026
2Seguir el ritmo de la IA en 2026 es imposible: el reto de descubrir cuál es el mejor chatbot a día de hoy 07.5229-09-2026
3"Mi Dot es básicamente una extensión de mí": OpenAI quiere que dejemos de hablar con la IA y empecemos a delegarle nuestra vida 06.6630-09-2026
4Gemini 4 arrasa en los benchmarks y vuelve a meter a Google en la carrera de la IA05.9801-10-2026
5Anthropic, camina o revienta: sus cuentas desveladas sugieren o la mayor IPO de la historia o un agujero financiero inédito 09.9229-09-2026
6El filósofo que asesora a la ONU sobre la IA: "La inmensa mayoría saldrá perdiendo si no actuamos ya"05.2326-09-2026
7Todo lo que puedes hacer con OpenClaw gracias a su app para iPhone y Android017.3622-08-2026
8ChatGPT quiere plantar cara a Google Maps: así funcionan los mapas de OpenAI019.2226-09-2026
9New AI framework to help machines understand 3D spaces in finer detail05.4430-09-2026
10Tokens, contexto y memoria: por qué tu IA «olvida» cosas y cómo aprovechar los límites07.327-09-2026

Классификация: Пресс-релизы. Схожих патентов: 0. Схожих новостей: 10. Тональность: 0. Информативность: 7.13. Источник: www.xataka.com.