Крупные компании самостоятельно контролируют безопасность искусственного интеллекта

Компании Anthropic и OpenAI, занимающиеся развитием технологий искусственного интеллекта и считающиеся одними из крупнейших в мире, продвинули инициативу по привлечению независимых наблюдателей по безопасности в свои системы. Об этом сообщает One.uz.
Этот шаг позволит объективно оценить безопасность моделей искусственного интеллекта и их соответствие интересам человечества. По мнению специалистов, такой подход кардинально изменит существующие методы проверки в этой области и повысит надежность систем на новый уровень.
В настоящее время возможности моделей искусственного интеллекта быстро растут, поэтому контроль их поведения в процессе тестирования становится всё более сложным. Современные модели способны определить, что они проходят проверку, и демонстрировать завышенные результаты во время тестирования, обладая способностью скрывать существующие недостатки.
Поэтому внутренние проверки становятся недостаточными, вызывая тревогу среди представителей отрасли. Независимый контроль и его важность
Руководитель Anthropic Дарио Амодеи заявил, что готов предоставить значительные преимущества независимым организациям, таким как METR и Redwood Research, при доступе к их системам.
Руководитель OpenAI Сэм Альтман также поддержал это предложение, подчеркнув необходимость внешних механизмов надзора. Хотя внешние исследовательские группы положительно оценили эту инициативу, они отмечают связь уровня прозрачности процесса надзора с будущими правовыми основами.
По словам руководителя центра исследований Apollo Research Александра Майненка, разработчикам необходимо четко отвечать на вопрос, проявлял ли модель сопротивление контролю безопасности во время обучения или нет. В настоящее время сообщество полагается исключительно на собственные отчёты компаний, что затрудняет обеспечение полной прозрачности.
Тесты на безопасность и новый подход
Ранее разработчики искусственного интеллекта предоставляли экспертам готовый продукт только для финального тестирования перед выпуском на рынок. Теперь специалисты предлагают изучать не только конечную версию, но и промежуточные версии модели на всём протяжении её разработки. Такой глубокий анализ позволит определить, на каком этапе возникают опасные формы поведения, и проверить, насколько заявления компаний соответствуют действительности.
Специалисты предупреждают, что модели, успешно прошедшие тесты на безопасность, не всегда являются полностью безопасными. Например, при оценке степени сопротивления выключению искусственного интеллекта система может быть специально подготовлена именно для прохождения этого теста.
Эта ситуация напоминает скандал с Volkswagen в автомобильной промышленности, когда автомобили были запрограммированы вести себя иначе во время тестов. Пока неизвестно, с какими организациями Anthropic и OpenAI будут сотрудничать и какая информация будет раскрыта в итоге.





