OpenAI o1-preview показал 83% успеха в олимпиадном программировании
Новое исследование на arXiv протестировало OpenAI o1-preview на сложных задачах из разных областей. Модель показала 83,3% успеха в конкурентном программировании и 100% точности в школьной математике.
- o1-preview решил 83,3% задач конкурентного программирования, обойдя многих людей-экспертов.
- Модель достигла 100% точности в математических задачах уровня старшей школы с пошаговыми решениями.
- o1-preview превзошёл другие модели в генерации радиологических отчётов и задачах проектирования чипов.
Исследователи опубликовали на arXiv всестороннюю оценку большой языковой модели OpenAI o1-preview. Тестирование охватило задачи из компьютерных наук, математики, естественных наук, медицины, лингвистики и социальных наук. Модель часто демонстрировала уровень человека или выше.
Среди ключевых результатов: 83,3% успеха в решении сложных задач конкурентного программирования, что превосходит многих экспертов-людей. В математических задачах уровня старшей школы o1-preview показал 100% точность, предоставляя подробные пошаговые решения.
Модель также превзошла другие оценённые модели в генерации связных и точных радиологических отчётов. В проектировании чипов o1-preview обошёл специализированные модели в генерации скриптов EDA и анализе ошибок. Отмечены сильные способности в антропологии, геологии, количественном инвестировании и анализе социальных сетей, включая анализ тональности и распознавание эмоций.
Исследование также выявило продвинутые возможности естественно-языкового вывода в общих и специализированных областях, таких как медицина. В анализе социальных сетей модель эффективно справлялась с анализом тональности и распознаванием эмоций. В количественном инвестировании o1-preview продемонстрировал обширные финансовые знания и навыки статистического моделирования.
Несмотря на успехи, исследование выявило и ограничения: occasional ошибки на простых задачах и трудности с некоторыми узкоспециализированными концепциями. Общие результаты указывают на значительный прогресс в направлении искусственного общего интеллекта (AGI).
Для профиТехнические детали: архитектура, цифры, ссылки
Исследование arXiv:2409.18486v5 оценивает o1-preview на множестве задач. Ключевые метрики:
- 83,3% успеха в конкурентном программировании.
- 100% точности в школьной математике.
- Превосходство в радиологии, генерации EDA-скриптов, анализе ошибок.
- Сильные результаты в антропологии, геологии, количественном инвестировании, анализе социальных сетей.
Ограничения: ошибки на простых задачах, сложности с узкоспециализированными концепциями. Полный текст доступен на arXiv.
Вопросы и ответы
- Какие задачи лучше всего решает o1-preview?
- Модель показала 83,3% успеха в конкурентном программировании, 100% в школьной математике, а также превзошла другие модели в радиологии и проектировании чипов.
- Есть ли у o1-preview ограничения?
- Да, исследование отметило occasional ошибки на простых задачах и трудности с некоторыми узкоспециализированными концепциями.



