Автоматизирани изследователи могат надеждно да ограничават проблеми с AI alignment
Anthropic представя ново изследване, според което автономни AI системи могат самостоятелно да разработват и тестват методи за намаляване на различни проблеми, свързани с поведението и безопасността на изкуствения интелект. Основната идея е, че с…