Anthropic опубликовали большой отчёт Risk Report о том, насколько опасными уже сейчас стали модели Claude и насколько компании готовы к сценариям, где ИИ будет действовать автономно. Мы пробежались глазами, и одна из главных мыслей, которая нам стала ясна, — сама компания не уверена, что старые тесты способны измерять рост возможностей моделей. Уже сейчас их продукт умеет оставлять бэкдоры в коде, отправлять данные для будущих моделей, пытаться сбежать. Риски, конечно, оцениваются как низкие, но уверенности в этих оценках нет. Особенно нам показалось интересным: скрытность. Современные модели Claude демонстрировал успешное выполнение скрытой задачи в 6—10% случаев. И это при условии искусственно упрощённого теста. То есть компания подтвердила тот факт, что модель способна действовать так, чтобы её сложнее было обнаружить. В этом же документе можно найти исследования sandbagging, то есть когда модель намеренно показывает результаты слабее реальных, в частности, если за ней следят. Также очень большой блок посвящён научным исследованиям. А вернее, тому, как ИИ ускоряет их. Исследователи уже говорят об ускорении работы, а сами ИИ-агенты движутся в сторону того, чтобы стать автономными исследователями. Ну и главное — это то, что они не понимают, насколько тесты отражают способность модели причинять вред. То есть модели становятся настолько хороши, что safety-тесты ломаются. Главная опасность даже не в простом ответе модели, где она расскажет, как условно создать оружие, а в том, что это ИИ-агент, который самостоятельно планирует, использует разные инструменты, пишет код и продолжает работу без постоянного вмешательства со стороны человека. Можно сколько угодно учить модель fancy-диалогу, правильному поведению, соблюдению ценностей и повестки, но это вообще не значит, что она будет себя вести так, получив автономность, инструменты и цель. Это особенно интересно, учитывая последние новости о взломах сайтов, и если на тот момент мы уже начали склоняться к тому, что это красивые пресс-релизы, то именно в этом отчёте Anthropic описывает несколько интересных инцидентов, связанных как раз-таки с обучением и поведением моделей. Кажется, что новости о взломе — это только верхушка айсберга, и самое интересное нас ждёт дальше. @lobushkin