Zhipu запускает внешний RSI-цикл и другие новости AI
Zhipu начала внешний RSI-цикл для самоулучшения ИИ. Также в дайджесте: TPU в космосе, платонический разум и проблемы робототехники.
- Zhipu запустила внешний RSI-цикл для самоулучшения ИИ.
- TPU планируется использовать в космосе.
- Майкл Левин предложил модель платонического разума.
Китайская компания Zhipu начала внешний RSI-цикл (recursive self-improvement) для своих ИИ-систем. Об этом сообщается в дайджесте Import AI. RSI-цикл предполагает, что модель самостоятельно улучшает свои способности, что может ускорить прогресс в разработке ИИ.
TPU в космосе
В дайджесте также упоминается использование TPU (Tensor Processing Units) в космосе. Подробности не раскрываются, но это указывает на расширение применения специализированных чипов за пределы дата-центров.
Платонический разум
Учёный Майкл Левин опубликовал работу, в которой предлагает нефизикалистскую модель разума. Согласно его гипотезе, существует платоническое пространство паттернов, которые стремятся воплотиться в физическом мире. Тела и машины — это интерфейсы для таких паттернов. Левин приводит примеры ксеноботов и антроботов, демонстрирующих неожиданное поведение, не предписанное их алгоритмами.
Проблемы робототехники
Исследователи Перри Донг и Челси Финн отмечают, что робототехника отстаёт от LLM из-за отсутствия универсального алгоритма постобучения. Для языковых моделей существует общий рецепт: предобучение, определение среды и награды, RL-оптимизация и борьба с патологиями. В робототехнике такого единого подхода пока нет.
Для профиТехнические детали: архитектура, цифры, ссылки
В работе Майкла Левина «Ingressing Minds: Causal, Non-Physical Patterns In-Form Natural, Synthetic, and Hybrid Embodiments» (MDPI) предлагается модель, где разум и тело соотносятся как математика и физика. Паттерны из платонического пространства внедряются в физические системы, включая биологические и синтетические. Примеры: ксеноботы (из клеток лягушки) и антроботы (из клеток трахеи человека), демонстрирующие поведение, не заложенное в их алгоритмах.
Перри Донг и Челси Финн описывают четыре шага постобучения LLM: предобученная модель, среда и награда, RL-оптимизация, устранение патологий. Для робототехники аналогичный универсальный рецепт отсутствует.
Вопросы и ответы
- Что такое RSI-цикл?
- RSI (recursive self-improvement) — цикл, в котором ИИ самостоятельно улучшает свои способности.
- Что такое TPU?
- TPU (Tensor Processing Unit) — специализированный чип для ускорения задач машинного обучения.


