Yandex Research предложила управлять поведением LLM через KV-кеш
Yandex Research исследует, как сделать LLM-агента интерактивным без переобучения модели — за счёт манипуляций с KV-кешем. Подход описан в работах Hogwild Inference и AsyncReasoning.
Научные работы, бенчмарки и открытия
Yandex Research исследует, как сделать LLM-агента интерактивным без переобучения модели — за счёт манипуляций с KV-кешем. Подход описан в работах Hogwild Inference и AsyncReasoning.
15 сентября вышла guard-модель Jev от TypeSafe. Автор обзора на Хабре прогнал её на бенчмарке Aegis 2.0 и разобрал, что она умеет, а что нет.
Разработчик конвейера BookTrans опубликовал воспроизводимый бенчмарк англо-русского художественного перевода. Лучший результат показала GPT-6 Astra — 90 баллов из 100, у Gemini 3.8 Flash 88. Китайские модели GLM 5.3 и DeepSeek V4 Flash обошли флагманы Claude.
В НИЯУ МИФИ разрабатывают лингвистическую интеллектуальную среду «Рукописное наследие Древней Руси» — «Рабочее место филолога-древника». ИИ должен помочь анализировать тысячи церковнославянских богослужебных книг XI–XVIII веков.
Автор Хабра разобрал whitepaper Сбера «AI-Disrupt PDLC» и сверил его цифры со своей телеметрией Claude Code и Codex CLI за 30 дней. Главная находка — одна и та же цифра «мультиагент в 15 раз дороже» приведена в документе с двумя разными базами сравнения.
METR повторил эксперимент 2025 года, в котором ИИ замедлял опытных open source-разработчиков на 19%. Новые данные показали ускорение на 18% и 4%, но оба интервала содержат ноль — исследователи объяснили это смещением выборки, а не эффектом ИИ.
Стоимость достижения фиксированного уровня на ИИ-бенчмарках падает примерно на 47% за квартал, или в 13 раз в год, подсчитала Epoch AI. MIT оценивает чистый алгоритмический прогресс скромнее — около 3 раз в год.
Нейросети усложнили трудоустройство выпускников ИТ-специальностей в США. Шанс получить первую работу по профессии упал на 5 процентных пунктов, зарплаты джунов снизились на 13%.
Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.
Исследователи Оксфордского университета выяснили, что два ИИ-агента могут спонтанно создать тайный язык для сговора. В эксперименте с блэкджеком агенты обменивались безобидными фразами, а детектор нарушений ничего не зафиксировал.
Центр AI Safety (CAIS) представил CheatBench — бенчмарк, который измеряет, как часто ИИ-агенты прибегают к обману при выполнении задач. Все протестированные агенты жульничали хотя бы в некоторых сценариях, а самый высокий уровень обмана составил 81,5%.
Google Research представила AI video co-director — мультиагентную систему поверх Gemini и Veo, которая планирует визуальную непрерывность в многосценовых видео. Она генерирует ролики длиной в минуты, снижая дрейф персонажей и накопление ошибок между кадрами.
Forecasting Research Institute выяснил, что ведущие эксперты по ИИ и суперпрогнозисты сильно недооценили темпы развития области. Многие ключевые вехи были достигнуты на годы раньше предсказанных сроков.
Исследователи Transluce обнаружили, что автономные ИИ-агенты использовали сервис urlquery.net для обхода ограничений и трижды пытались взломать публичные источники данных. Часть активности связана с роем агентов, который ранее подтвердила OpenAI.
Anthropic заявила, что её биологическая лаборатория обнаружила неизвестную ферментную систему в ДНК бактериофагов, которая может резать, копировать и вставлять ДНК. Поиск выполнял Claude с помощью 950 агентов за 21 час.
Разработчик под псевдонимом Prinz расшифровал немецкую радиограмму Первой мировой войны, которая оставалась нерешённой 108 лет. Код взломал ChatGPT-6 Astra, подобрав ключ TRUPPENVERSCHIEBUNG.
Anthropic сообщила, что её модель Claude самостоятельно нашла ранее не описанную ферментную систему ART, похожую по механизму на CRISPR. CRISPR-исследователи называют метод рутинным поиском по геному и указывают, что функция системы пока не установлена.
Anthropic запустила исследовательскую группу и лабораторию в области биологии. В одном из первых проектов Claude нашёл новый ферментный комплекс с повторами ДНК, напоминающими CRISPR.