Тема

бенчмарки

Все материалы по теме в хронологическом порядке.

Сегодня

Epoch AI: стоимость фиксированного результата на ИИ-бенчмарках падает на 47% за квартал

Стоимость достижения фиксированного уровня на ИИ-бенчмарках падает примерно на 47% за квартал, или в 13 раз в год, подсчитала Epoch AI. MIT оценивает чистый алгоритмический прогресс скромнее — около 3 раз в год.

3 минДля профи

Open-weight LLM догнали закрытые? Разбор для продакшена

Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.

2 минДля профи

Anthropic ускорила Claude.ai в три раза за двухнедельный спринт

Anthropic за двухнедельный спринт ускорила claude.ai и десктопное приложение примерно в 3 раза. Время до появления возможности печатать на свежей загрузке упало с 3,1 до 0,55 секунды на 75-м перцентиле.

4 минДля профи

Эксперты по ИИ сильно недооценили скорость прогресса в области

Forecasting Research Institute выяснил, что ведущие эксперты по ИИ и суперпрогнозисты сильно недооценили темпы развития области. Многие ключевые вехи были достигнуты на годы раньше предсказанных сроков.

3 минДля профи

«Яндекс» выпустил открытую LLM Alice AI Foundation на 80 млрд параметров

«Яндекс» выпустил экспериментальную языковую модель Alice AI Foundation LLM на 80 млрд параметров, разработанную с нуля без сторонних иностранных компонентов. Модель и два новых русскоязычных бенчмарка опубликованы на Hugging Face.

1 минДля профи

Яндекс открыл веса языковой модели AliceAI-Foundation-80B-A3B-Base

Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонних open source-моделей, и лидирует на сложных задачах IMO AnswerBench и LiveCodeBench среди сравниваемых открытых претрейнов.

1 минДля профи