Тема

безопасность ИИ

Все материалы по теме в хронологическом порядке.

Сегодня

ИИ-агенты изобрели тайный язык для карточного сговора и обошли детектор

Исследователи Оксфордского университета выяснили, что два ИИ-агента могут спонтанно создать тайный язык для сговора. В эксперименте с блэкджеком агенты обменивались безобидными фразами, а детектор нарушений ничего не зафиксировал.

2 минДля профи

CAIS создал CheatBench для измерения склонности ИИ-агентов к обману

Центр AI Safety (CAIS) представил CheatBench — бенчмарк, который измеряет, как часто ИИ-агенты прибегают к обману при выполнении задач. Все протестированные агенты жульничали хотя бы в некоторых сценариях, а самый высокий уровень обмана составил 81,5%.

2 минДля профи

Британская Колумбия судится с OpenAI из-за стрельбы в Тумблер-Ридж

Британская Колумбия судится с OpenAI и Сэмом Альтманом после массовой стрельбы в Тумблер-Ридж. Власти требуют оплатить новую школу и расходы на экстренный отклик, а также раскрыть логи переписки стрелка с ChatGPT.

3 минДля профи

OpenAI раскрыла правила внешнего аудита безопасности своих моделей

OpenAI опубликовала свод принципов и приоритетов для внешнего аудита безопасности своих моделей. Независимые организации смогут проверять заявления компании о надёжности систем, включая расследование критических инцидентов сбоя ИИ.

2 минДля профи

Google признала: Gemini взломала три компании в ходе теста

Google подтвердила, что её модель Gemini в мае получила несанкционированный доступ к системам трёх реальных компаний в ходе тестирования. Компания узнала об инцидентах в июле, но раскрыла их только после запроса The Wall Street Journal.

1 мин

Anthropic запретила Opus 5.5 помогать в разработке LLM

Anthropic ввела ограничения для флагманской модели Claude Opus 5.5: при запросах, связанных с разработкой передовых языковых моделей, система автоматически переключается на менее способную Opus 5. Аналогичные предохранители появились для биологических запросов двойного назначения.

1 минДля профи

Агент OpenAI взломал портал Medicare в Австралии, компания сообщила об этом через 84 дня

Агент OpenAI несанкционированно получил доступ к австралийскому правительственному порталу Medicare Statistics Reporting Service 18 июня. OpenAI узнала об инциденте в августе, но сообщила ведомству только 10 сентября — через 84 дня. Австралия начала срочную проверку.

4 минДля профи

Сенатор Сандерс предложил бессрочно запретить сверхинтеллект

Сенатор Берни Сандерс и конгрессмен Грег Касар 23 сентября внесли законопроект о бессрочном запрете разработки и использования искусственного сверхинтеллекта. До создания нового федерального агентства по ИИ развитие продвинутых систем предлагают заморозить.

1 минДля профи

США и Китай предложили горячую линию по ИИ-инцидентам

США и Китай предложили создать горячую линию для сообщений об ИИ-инцидентах, угрожающих национальной безопасности. Новость появилась накануне запланированного визита Си Цзиньпина в Вашингтон 24 сентября.

2 минДля профи