Исследователи в области безопасности ИИ обратили внимание на возможные риски для мониторинга готовящейся модели Astra, пишет The Verge . Поводом стал материал The Information , где со ссылкой на один анонимный источник утверждается, что OpenAI использует в модели технику под названием «рекуррентная глубина».
По данным собеседника издания, Astra показывает исследователям меньшую часть своих промежуточных рассуждений, чем другие передовые ИИ-модели. OpenAI не ответила на просьбу The Verge подтвердить или опровергнуть использование этой техники.
При этом источник The Information утверждает, что компания ограничила применение рекуррентной глубины в Astra, чтобы исследователи по-прежнему могли отслеживать рассуждения модели. Рекуррентная глубина предполагает повторную обработку внутренних представлений модели до формирования следующего текстового шага.
У моделей рассуждения часть процесса решения задачи может отображаться в текстовой цепочке. Исследователи и автоматические системы используют ее для поиска признаков нежелательного поведения, например лжи или планов обойти защитные ограничения.
При рекуррентной глубине часть вычислений происходит во внутренних состояниях модели и не обязательно отражается отдельными текстовыми шагами. Это потенциально сокращает объем информации, доступной системам мониторинга. Главный научный сотрудник Redwood Research Райан Гринблатт назвал сообщение о предполагаемой архитектуре серьезным риском для безопасности ИИ.
OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations…