бенчмарки
Все материалы по теме в хронологическом порядке.
Jev от TypeSafe: guard-модель с контекстом 64K токенов
15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре прогнал её на бенчмарке Aegis 2.0 и разобрал, что она умеет, а что нет.
Epoch AI: стоимость фиксированного результата на ИИ-бенчмарках падает на 47% за квартал
Стоимость достижения фиксированного уровня на ИИ-бенчмарках падает примерно на 47% за квартал, или в 13 раз в год, подсчитала Epoch AI. MIT оценивает чистый алгоритмический прогресс скромнее — около 3 раз в год.
Open-weight LLM догнали закрытые? Разбор для продакшена
Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.
Anthropic ускорила Claude.ai в три раза за двухнедельный спринт
Anthropic за двухнедельный спринт ускорила claude.ai и десктопное приложение примерно в 3 раза. Время до появления возможности печатать на свежей загрузке упало с 3,1 до 0,55 секунды на 75-м перцентиле.
Эксперты по ИИ сильно недооценили скорость прогресса в области
Forecasting Research Institute выяснил, что ведущие эксперты по ИИ и суперпрогнозисты сильно недооценили темпы развития области. Многие ключевые вехи были достигнуты на годы раньше предсказанных сроков.
Mercury 2.5 выдаёт 770 токенов в секунду в тесте Artificial Analysis
LLM Mercury 2.5 показала скорость генерации 770 токенов в секунду в замерах Artificial Analysis. Модель оценивается по Intelligence Index v4.3.2, который включает 10 бенчмарков.
Alibaba выпустила Qwen Image 2.1 — модель на 7 млрд параметров
Alibaba Cloud выпустила Qwen Image 2.1 — открытую модель генерации изображений всего с 7 млрд параметров. Разработчики утверждают, что она обходит Google Nano Banana 2.0 по внутреннему бенчмарку.
«Яндекс» выпустил открытую LLM Alice AI Foundation на 80 млрд параметров
«Яндекс» выпустил экспериментальную языковую модель Alice AI Foundation LLM на 80 млрд параметров, разработанную с нуля без сторонних иностранных компонентов. Модель и два новых русскоязычных бенчмарка опубликованы на Hugging Face.
OpenAI выпустила GPT-6 Sol и Luna вдвое дешевле предшественниц
OpenAI расширила семейство GPT-6 моделями Sol и Luna. Они вдвое дешевле версий на базе GPT-5.6, точнее передают факты и уже доступны в ChatGPT Work, Codex и через API.
Яндекс открыл веса языковой модели AliceAI-Foundation-80B-A3B-Base
Яндекс открыл веса новой языковой модели AliceAI-Foundation-80B-A3B-Base под лицензией Apache 2.0. Модель обучена с нуля, без весов сторонних open source-моделей, и лидирует на сложных задачах IMO AnswerBench и LiveCodeBench среди сравниваемых открытых претрейнов.








