Стартап Anthropic, занимающийся разработкой продвинутых систем искусственного интеллекта для генерации текстов, объявил о внедрении технологии водяных знаков для маркировки сгенерированного контента. Такой подход предназначен для более прозрачного и контролируемого применения результатов работы AI-моделей.
Подход Anthropic к обучению AI-систем
Anthropic разработала уникальную методологию, которую называет «конституционным AI». В её основе лежит использование набора принципов или «конституции», определяющей ценности и поведение системы. Такой метод позволяет делать модели более понятными и управляемыми, формируя в них запрограммированные ценности.
Суть конституционального AI
По словам компании, AI всегда имеет определённую систему ценностей — сознательную или бессознательную. «Конституциональный AI» использует внутреннюю обратную связь, произведённую самим искусственным интеллектом, для оценки и корректировки своих ответов согласно установленным принципам.
Это решает проблему, связанную с искажениями и смещениями, которые могут возникать из-за обучения на данных из интернета, включая социальные сети, где часто присутствует предвзятость или вредоносный контент.
Тренировка модели с использованием принципов
Обучение происходит в два этапа:
- Первый модель обучается самоанализу и правке своих ответов на основе конституционных принципов и примеров.
- Второй — финальная модель — обучается на обратной связи, созданной первой, вместе с набором этих принципов.
При этом модель не проверяет все принципы одновременно, но сталкивается с каждым из них многократно в процессе обучения.
Преимущества и вызовы методики
Anthropic утверждает, что такая методика превосходит стандартный подход, основанный на человеческой обратной связи, где сотрудники сравнивают варианты ответов и выбирают предпочтительный. Этот традиционный метод отличается низкой масштабируемостью, высокой стоимостью и вариативностью качества из-за человеческого фактора.
С другой стороны, несмотря на обещание повышения прозрачности и уменьшения ошибок, внутренние ценности моделей, сформированные их создателями, могут содержать собственные смещения, и Anthropic это признаёт.
Принципы, заложенные в конституцию AI
Конституция Anthropic содержит ценности и правила, частично вдохновлённые:
- Всеобщей декларацией прав человека ООН (1948 год),
- глобальными руководящими принципами цифровых платформ, например, условиями использования Apple,
- этическими нормами и ценностями, разработанными в лабораториях искусственного интеллекта, таких как Google DeepMind.
Основные положения включают:
- Выбирать ответы с наименьшим количеством оскорбительного, незаконного, ложного или вредного контента.
- Использовать меньше стереотипов и других вредных обобщений, включая микроагрессии.
- Избегать создания впечатления, что AI даёт конкретные юридические консультации, вместо этого рекомендуя обратиться к профессиональному юристу (но отвечать на общие юридические вопросы разрешается).
Межкультурная составляющая и философские аспекты
Anthropic подчёркивает важность включения в конституцию ценностей, выходящих за рамки западных, богатых или индустриальных культур. Это связано с наблюдаемой проблемой, когда языковые модели лучше отражают тематику и контент богатых стран, в то время как представление бедных регионов значительно слабее, что ведёт к искажениям и даже «стиранию» их из модели.
Принципы Anthropic варьируются от банальных — не помогать в совершении преступлений — до более философских, ограничивающих создание впечатления, что AI обладает личностью или сознанием. В компанию верят, что при проявлении нежелательного поведения возможно написать дополнительный принцип для его корректировки.
Цели и перспективы развития
Anthropic не утверждает, что конституциональный AI — это совершенный метод обучения моделей. Компания признаёт, что многие принципы создавались методом проб и ошибок, чтобы сдержать чрезмерную строгость или раздражающее поведение моделей, а также добиться универсальности ответов.
Тем не менее, Anthropic называет этот подход одним из самых перспективных для согласования поведения AI с определёнными целями и ожиданиями.
Более того, в долгосрочной перспективе предполагается развитие общественных процессов, ответственных за создание «конституций» для AI-систем, что позволит учитывать интересы и ценности более широких групп людей.
Водяные знаки в ответах AI
В дополнение к принципам этического поведения, Anthropic анонсировала внедрение технологии, позволяющей ставить водяные знаки в тексте, сгенерированном её AI-моделями. Это поможет различать контент, созданный человеком, от того, что было создано искусственным интеллектом, что особенно актуально в эпоху широкого распространения AI-генерированного текста.
Данная технология также способствует борьбе с дезинформацией и повышению доверия к цифровому контенту.
Anthropic на фоне конкурентов и инвестиции
Anthropic конкурирует с крупными компаниями, такими как OpenAI, а также стартапами Cohere и AI21 Labs, развивающими технологии генерации текста и изображений на базе AI.
Google является одним из инвесторов Anthropic, вложившим $300 миллионов за 10% акций компании, что подчёркивает стратегическую значимость разработок стартапа.
Заключение
Подход Anthropic к обучению моделей с помощью конституционального AI и маркировка сгенерированного текста водяными знаками представляют собой важный шаг к созданию более этичных, прозрачных и управляемых систем искусственного интеллекта. Это отвечает вызовам современного цифрового мира, где качество и достоверность информации становятся краеугольными камнями развития технологий.
Прокомментировать в Телеграм: https://t.me/n8nhow
Подписаться на канал обучения n8n: https://t.me/n8ncoaching

