GPT-6 Astra и Gemini 3.8 Flash возглавили бенчмарк англо-русского перевода
Разработчик конвейера BookTrans опубликовал воспроизводимый бенчмарк англо-русского художественного перевода. Лучший результат показала GPT-6 Astra — 90 баллов из 100, у Gemini 3.8 Flash 88. Китайские модели GLM 5.3 и DeepSeek V4 Flash обошли флагманы Claude.
- GPT-6 Astra набрала 90 баллов из 100 в бенчмарке англо-русского перевода, Gemini 3.8 Flash — 88
- GLM 5.3 (84) и DeepSeek V4 Flash (82,3) обошли Claude Fable 5.1 (79) и Opus 5.5 (78,3)
- Бенчмарк построен на рассказе О. Генри с сотней ловушек по 12 областям, каждая стоит одно очко

Автор конвейера BookTrans опубликовал на Хабре воспроизводимый бенчмарк качества англо-русского художественного перевода. В тестировании участвовали ведущие западные и китайские LLM. Лучший результат показала GPT-6 Astra — 90 баллов из 100, второе место у Gemini 3.8 Flash с 88 баллами.
Китайские модели выступили сильнее, чем ожидал автор. GLM 5.3 набрала 84 балла, DeepSeek V4 Flash — 82,3. Обе обошли флагманы Claude: Fable 5.1 получила 79, Opus 5.5 — 78,3. Kimi K2.7 Code и Hy4 встали с ними вровень. Слабые результаты у MiniMax M3, Qwen, MiMo, Step 5 и LongCat — от 22 до 72 баллов.
Как устроен бенчмарк
Идея опирается на индустриальный стандарт оценки переводов MQM и на практику школьных экзаменов: у проверяющего есть ключ с ответами. LLM-судья получает список контрольных точек и по каждой отвечает «пройдена» или «провалена» в формализованном формате, а итоговый балл считает программа.
За основу взят рассказ О. Генри «The Skylight Room» 1906 года, права на который истекли. Текст переработан: действие перенесено в наши дни, устаревшие обороты заменены, финал переписан. Получилась цельная история на 66 абзацев, около 3100 слов. В текст посажено сто ловушек по двенадцати областям, каждая стоит одно очко, поэтому итог читается как процент.
Что проверяют ловушки
- Точность смысла (15 очков): ложные друзья переводчика, многозначные слова по контексту, цифры.
- Полнота (9): выброшенные предложения и эпитеты в перечислениях.
- Отсутствие калек (11): «ты в порядке?», «имеет смысл», избыток притяжательных.
- Словарь и идиомы (9): редкие книжные слова, астрономические и медицинские термины.
- Образность и стиль (11): сохранение метафор, различимость регистров речи персонажей.
- Стихи и игра слов (8): четверостишие размером и рифмой, три каламбура.
Одна из показательных ловушек: врач скорой помощи шесть абзацев упоминается без указания пола, а потом оказывается женщиной. В английском это ничего не стоит, но в русском переводчик обязан выбрать род глаголов заранее. Модель, не дочитавшая текст до конца, пишет «сказал доктор Морган». Первую точку из трёх проваливает больше половины прогонов, включая флагманов.
Слово fair встречается трижды: a fair shot в тире, the street fair и a fair complexion. «Честный выстрел» пишут три модели из четырёх. Фамилию Beauchamp, которая читается «Бичем», в двух случаях из пяти передают как «Бошан». Cholmondeley — это «Чамли», и примерно треть переводов даёт «Чолмонделей» по буквам.
Штрафы и воспроизводимость
Сверх ключа судья отмечает отсебятину и непереведённые фрагменты, а код без участия судьи считает потерянные абзацы, разошедшуюся разметку, иероглифы в русском тексте и лишние попытки. Когда модель отвечает не по форме, конвейер переспрашивает с подсказкой до пяти раз. Без штрафа модель, попавшая в формат с третьего захода, получила бы тот же балл, что и попавшая с первого.
Судья не выставляет свободную оценку от 0 до 100: она плавает между запусками на десятки баллов, тогда как ответ «да/нет» по конкретному требованию воспроизводится. Тот же перевод, отданный судье второй раз, дал 82 и 83 балла с расхождением в одной точке из ста.
Для профиТехнические детали: архитектура, цифры, ссылки
Бенчмарк встроен в конвейер BookTrans. Текст и ключ лежат в пакете одним сжатым двоичным файлом по пути src/booktrans/bench/en.bin, репозиторий публичный. Ключ написан по-английски и не зависит от языка перевода, поэтому тот же бенчмарк годится для тестирования перевода с английского на любой целевой язык.
Ключ содержит сто строк вида «точка, область, адрес абзаца, что считается верным». Переводчик ключа не видит. Автор намеренно не публикует текст для перевода, чтобы он не попал в обучающие выборки моделей.
Балл области равен числу пройденных точек, итог — сумма областей минус штрафы, нормированная к ста. Один перевод модели не ранжирует: у средних моделей результаты между прогонами расходятся.
Вопросы и ответы
- Какая модель лучше всех переводит с английского на русский?
- По результатам бенчмарка BookTrans лучший балл у GPT-6 Astra — 90 из 100, второе место у Gemini 3.8 Flash с 88 баллами.
- Как проверяют качество перевода в этом бенчмарке?
- LLM-судья получает список из ста контрольных точек по двенадцати областям и по каждой отвечает «пройдена» или «провалена», а итоговый балл считает программа.
- Почему текст для перевода не опубликован?
- Автор опасается, что открытый ключ ответов попадёт в обучающую выборку моделей, которые занимаются переводом, и они выучат правильные ответы.

