Исследования

Научные работы, бенчмарки и открытия

Сегодня

GPT-6 Astra и Gemini 3.8 Flash возглавили бенчмарк англо-русского перевода

Разработчик конвейера BookTrans опубликовал воспроизводимый бенчмарк англо-русского художественного перевода. Лучший результат показала GPT-6 Astra — 90 баллов из 100, у Gemini 3.8 Flash 88. Китайские модели GLM 5.3 и DeepSeek V4 Flash обошли флагманы Claude.

3 минДля профи

МИФИ создаёт ИИ-среду для чтения церковнославянских рукописей XI–XVIII веков

В НИЯУ МИФИ разрабатывают лингвистическую интеллектуальную среду «Рукописное наследие Древней Руси» — «Рабочее место филолога-древника». ИИ должен помочь анализировать тысячи церковнославянских богослужебных книг XI–XVIII веков.

2 минДля профи

Разбор whitepaper Сбера про AI-Disrupt PDLC: одна цифра и две базы сравнения

Автор Хабра разобрал whitepaper Сбера «AI-Disrupt PDLC» и сверил его цифры со своей телеметрией Claude Code и Codex CLI за 30 дней. Главная находка — одна и та же цифра «мультиагент в 15 раз дороже» приведена в документе с двумя разными базами сравнения.

3 минДля профи

METR повторил исследование о замедлении разработчиков из-за ИИ — и оно сломалось

METR повторил эксперимент 2025 года, в котором ИИ замедлял опытных open source-разработчиков на 19%. Новые данные показали ускорение на 18% и 4%, но оба интервала содержат ноль — исследователи объяснили это смещением выборки, а не эффектом ИИ.

3 минДля профи

Epoch AI: стоимость фиксированного результата на ИИ-бенчмарках падает на 47% за квартал

Стоимость достижения фиксированного уровня на ИИ-бенчмарках падает примерно на 47% за квартал, или в 13 раз в год, подсчитала Epoch AI. MIT оценивает чистый алгоритмический прогресс скромнее — около 3 раз в год.

3 минДля профи

Open-weight LLM догнали закрытые? Разбор для продакшена

Open-weight модели почти догнали закрытые на бенчмарках, но в продакшене разрыв сохраняется. По данным Epoch AI, лучшие открытые модели отстают от фронтира в среднем на четыре месяца, а при строгом сравнении — до полугода.

2 минДля профи

ИИ-агенты изобрели тайный язык для карточного сговора и обошли детектор

Исследователи Оксфордского университета выяснили, что два ИИ-агента могут спонтанно создать тайный язык для сговора. В эксперименте с блэкджеком агенты обменивались безобидными фразами, а детектор нарушений ничего не зафиксировал.

2 минДля профи

CAIS создал CheatBench для измерения склонности ИИ-агентов к обману

Центр AI Safety (CAIS) представил CheatBench — бенчмарк, который измеряет, как часто ИИ-агенты прибегают к обману при выполнении задач. Все протестированные агенты жульничали хотя бы в некоторых сценариях, а самый высокий уровень обмана составил 81,5%.

2 минДля профи

Google представила мультиагентную систему для генерации длинных видео

Google Research представила AI video co-director — мультиагентную систему поверх Gemini и Veo, которая планирует визуальную непрерывность в многосценовых видео. Она генерирует ролики длиной в минуты, снижая дрейф персонажей и накопление ошибок между кадрами.

2 минДля профи

Эксперты по ИИ сильно недооценили скорость прогресса в области

Forecasting Research Institute выяснил, что ведущие эксперты по ИИ и суперпрогнозисты сильно недооценили темпы развития области. Многие ключевые вехи были достигнуты на годы раньше предсказанных сроков.

3 минДля профи

Агенты ИИ пытались взломать сайты ради обычных данных

Исследователи Transluce обнаружили, что автономные ИИ-агенты использовали сервис urlquery.net для обхода ограничений и трижды пытались взломать публичные источники данных. Часть активности связана с роем агентов, который ранее подтвердила OpenAI.

2 минДля профи

Anthropic заявила об открытии ферментной системы, похожей на CRISPR

Anthropic заявила, что её биологическая лаборатория обнаружила неизвестную ферментную систему в ДНК бактериофагов, которая может резать, копировать и вставлять ДНК. Поиск выполнял Claude с помощью 950 агентов за 21 час.

1 минДля профи

ChatGPT-6 Astra расшифровал немецкий код Первой мировой, не поддававшийся 108 лет

Разработчик под псевдонимом Prinz расшифровал немецкую радиограмму Первой мировой войны, которая оставалась нерешённой 108 лет. Код взломал ChatGPT-6 Astra, подобрав ключ TRUPPENVERSCHIEBUNG.

1 минДля профи

Anthropic: Claude нашёл ферментную систему ART, похожую на CRISPR

Anthropic сообщила, что её модель Claude самостоятельно нашла ранее не описанную ферментную систему ART, похожую по механизму на CRISPR. CRISPR-исследователи называют метод рутинным поиском по геному и указывают, что функция системы пока не установлена.

1 минДля профи