Яндекс открыл веса языковой модели AliceAI-Foundation-80B-A3B-Base

Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонних open source-моделей, и лидирует на сложных задачах IMO AnswerBench и LiveCodeBench среди сравниваемых открытых претрейнов.

Главное
  • Веса AliceAI-Foundation-80B-A3B-Base опубликованы под лицензией Apache 2.0.
  • Модель обучена с нуля без использования весов сторонних open source-моделей.
  • На IMO AnswerBench и LiveCodeBench модель лидирует среди сравниваемых открытых претрейнов.
Иллюстрация к новости об открытии весов языковой модели Яндекса AliceAI-Foundation-80B-A3B-Base
Фото: Хабр: Яндекс

Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель прошла полный цикл обучения в Яндексе с нуля — без использования весов сторонних open source-моделей.

В претрейн-замерах новая модель обходит более крупные DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих задачах: от фактологических и экспертных вопросов до математики и кода. На сложных задачах IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов.

Предыдущую закрытую Alice AI LLM 235B новая модель превосходит по фактологическим знаниям, математике, программированию и работе с длинным контекстом — при почти втрое меньшем общем числе параметров и примерно в семь раз меньшем числе активных.

Весь путь к релизу занял около полугода. За это время команда пересобрала корпус, перебрала архитектурные решения, подобрала гиперпараметры и добавила данные для рассуждений и агентских взаимодействий. Вклад обновлённого корпуса, архитектуры и гиперпараметров проверили в серии обучений с нуля — по 2 трлн токенов каждое.

Вместе с весами Яндекс публикует большой технический отчёт: от пайплайнов подготовки данных и протоколов оценки до стабилизации обучения и scaling laws. Для ключевых решений приводятся абляционные эксперименты и разбор подходов, от которых пришлось отказаться.

Отдельная часть отчёта посвящена измерению качества претрейнов. Результат базовой модели может сильно зависеть от примеров в промпте, а правильное решение сложной задачи — появляться лишь в одной из многих попыток. Яндекс рассказывает, как выбирали протоколы замеров, строили бенчмарки, проверяли автоматическую оценку и выясняли, какие метрики позволяют предсказать качество после дообучения.

Также открыты два фактологических бенчмарка — WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст — и протоколы их оценки.

Для профиТехнические детали: архитектура, цифры, ссылки

AliceAI-Foundation-80B-A3B-Base — базовая модель, обученная с нуля без весов сторонних open source-моделей. Общее число параметров — 80B, активных — 3B (из названия). Обучение заняло около полугода. Вклад архитектуры и гиперпараметров проверяли серией обучений с нуля по 2 трлн токенов каждое.

Модель обходит DeepSeek-V4-Flash-Base и Nemotron-3-Super на многих претрейн-задачах, лидирует на IMO AnswerBench и LiveCodeBench среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B превосходит по фактологическим знаниям, математике, программированию и длинному контексту при почти втрое меньшем общем числе параметров и примерно в семь раз меньшем числе активных.

Вместе с весами опубликованы технический отчёт, фактологические бенчмарки WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст и протоколы их оценки. Лицензия — Apache 2.0.

Вопросы и ответы

Под какой лицензией открыта модель?
Под лицензией Apache 2.0.
Использовались ли веса сторонних open source-моделей?
Нет, модель обучена с нуля без весов сторонних open source-моделей.
Какие бенчмарки открыты вместе с весами?
WikiWebFacts и HardMultiQA с акцентом на русскоязычный контекст, а также протоколы их оценки.