GPT-6 Astra распознаёт ошибки сборки мебели IKEA с точностью 80%

OpenAI GPT-6 Astra достигла 80% точности в Furniture Assembly Benchmark от Epoch AI, определяя ошибки сборки мебели IKEA по фотографиям. В ноябре 2025 года лучший результат составлял 28%.

Главное
  • GPT-6 Astra набрала 80% в бенчмарке FAB, анализируя фотографии сборки мебели IKEA с ошибками
  • Claude Fable 5.1 заняла второе место с 70%, Claude Opus 5 — третье с 61%
  • В ноябре 2025 года лучшая модель Claude Opus 4.5 показывала лишь 28% точности
Фотография сборки мебели IKEA с отмеченными ошибками, которые распознаёт ИИ-модель
Фото: The Decoder

OpenAI GPT-6 Astra научилась определять ошибки при сборке мебели IKEA по фотографиям с точностью 80%. Об этом сообщает The Decoder со ссылкой на результаты бенчмарка Furniture Assembly Benchmark (FAB) от Epoch AI.

В тесте используются фотографии трёх предметов мебели IKEA, снятые в процессе сборки с намеренно внесёнными ошибками. Модели сравнивают снимки с инструкцией, находят несоответствия и описывают, что пошло не так.

Динамика результатов

В ноябре 2025 года лучший результат в бенчмарке показывала Claude Opus 4.5 — 28%. Спустя десять месяцев GPT-6 Astra достигла 80%, обрабатывая каждую фотографию за три минуты.

Следом идут Claude Fable 5.1 с 70% и Claude Opus 5 с 61%. Китайские модели с открытыми весами, такие как Kimi K3, отстают от лидеров минимум на семь месяцев.

Ограничения и перспективы

Несмотря на прогресс, технология пока слишком медленная для помощи в реальном времени во время сборки. Исследователи предполагают, что в будущем подобные модели смогут помогать с ремонтом автомобилей или бытовой техники.

По данным The Decoder, GPT-6 Astra также показывает высокие результаты в визуальных роботизированных задачах.

Для профиТехнические детали: архитектура, цифры, ссылки

Бенчмарк Furniture Assembly Benchmark (FAB) разработан Epoch AI. В тесте модели анализируют фотографии трёх предметов мебели IKEA, собранных с намеренными ошибками, и сопоставляют их с инструкцией.

  • GPT-6 Astra: 80% точности, три минуты на обработку одной фотографии
  • Claude Fable 5.1: 70%
  • Claude Opus 5: 61%
  • Claude Opus 4.5 (ноябрь 2025): 28%

Китайские модели с открытыми весами, включая Kimi K3, отстают от лидеров минимум на семь месяцев. GPT-6 Astra также демонстрирует сильные результаты в визуальных роботизированных задачах.

Вопросы и ответы

Что такое Furniture Assembly Benchmark?
Бенчмарк от Epoch AI, в котором модели анализируют фотографии сборки мебели IKEA с намеренными ошибками и сопоставляют их с инструкцией.
Насколько GPT-6 Astra лучше предыдущих моделей?
GPT-6 Astra показала 80% точности против 28% у Claude Opus 4.5 в ноябре 2025 года.
Можно ли использовать GPT-6 Astra для помощи в реальной сборке?
Пока нет — модель обрабатывает одну фотографию за три минуты, что слишком медленно для подсказок в реальном времени.