Zhipu запускает внешний RSI-цикл и другие новости AI

Zhipu начала внешний RSI-цикл для самоулучшения ИИ. Также в дайджесте: TPU в космосе, платонический разум и проблемы робототехники.

Главное
  • Zhipu запустила внешний RSI-цикл для самоулучшения ИИ.
  • TPU планируется использовать в космосе.
  • Майкл Левин предложил модель платонического разума.

Китайская компания Zhipu начала внешний RSI-цикл (recursive self-improvement) для своих ИИ-систем. Об этом сообщается в дайджесте Import AI. RSI-цикл предполагает, что модель самостоятельно улучшает свои способности, что может ускорить прогресс в разработке ИИ.

TPU в космосе

В дайджесте также упоминается использование TPU (Tensor Processing Units) в космосе. Подробности не раскрываются, но это указывает на расширение применения специализированных чипов за пределы дата-центров.

Платонический разум

Учёный Майкл Левин опубликовал работу, в которой предлагает нефизикалистскую модель разума. Согласно его гипотезе, существует платоническое пространство паттернов, которые стремятся воплотиться в физическом мире. Тела и машины — это интерфейсы для таких паттернов. Левин приводит примеры ксеноботов и антроботов, демонстрирующих неожиданное поведение, не предписанное их алгоритмами.

Проблемы робототехники

Исследователи Перри Донг и Челси Финн отмечают, что робототехника отстаёт от LLM из-за отсутствия универсального алгоритма постобучения. Для языковых моделей существует общий рецепт: предобучение, определение среды и награды, RL-оптимизация и борьба с патологиями. В робототехнике такого единого подхода пока нет.

Для профиТехнические детали: архитектура, цифры, ссылки

В работе Майкла Левина «Ingressing Minds: Causal, Non-Physical Patterns In-Form Natural, Synthetic, and Hybrid Embodiments» (MDPI) предлагается модель, где разум и тело соотносятся как математика и физика. Паттерны из платонического пространства внедряются в физические системы, включая биологические и синтетические. Примеры: ксеноботы (из клеток лягушки) и антроботы (из клеток трахеи человека), демонстрирующие поведение, не заложенное в их алгоритмах.

Перри Донг и Челси Финн описывают четыре шага постобучения LLM: предобученная модель, среда и награда, RL-оптимизация, устранение патологий. Для робототехники аналогичный универсальный рецепт отсутствует.

Вопросы и ответы

Что такое RSI-цикл?
RSI (recursive self-improvement) — цикл, в котором ИИ самостоятельно улучшает свои способности.
Что такое TPU?
TPU (Tensor Processing Unit) — специализированный чип для ускорения задач машинного обучения.