Anthropic заявляет, что будет водяными знаками маркировать текст, сгенерированный её AI-моделями

Стартап Anthropic, занимающийся разработкой продвинутых систем искусственного интеллекта для генерации текстов, объявил о внедрении технологии водяных знаков для маркировки сгенерированного контента. Такой подход предназначен для более прозрачного и контролируемого применения результатов работы AI-моделей.

Подход Anthropic к обучению AI-систем

Anthropic разработала уникальную методологию, которую называет «конституционным AI». В её основе лежит использование набора принципов или «конституции», определяющей ценности и поведение системы. Такой метод позволяет делать модели более понятными и управляемыми, формируя в них запрограммированные ценности.

Суть конституционального AI

По словам компании, AI всегда имеет определённую систему ценностей — сознательную или бессознательную. «Конституциональный AI» использует внутреннюю обратную связь, произведённую самим искусственным интеллектом, для оценки и корректировки своих ответов согласно установленным принципам.

Это решает проблему, связанную с искажениями и смещениями, которые могут возникать из-за обучения на данных из интернета, включая социальные сети, где часто присутствует предвзятость или вредоносный контент.

Тренировка модели с использованием принципов

Обучение происходит в два этапа:

  • Первый модель обучается самоанализу и правке своих ответов на основе конституционных принципов и примеров.
  • Второй — финальная модель — обучается на обратной связи, созданной первой, вместе с набором этих принципов.

При этом модель не проверяет все принципы одновременно, но сталкивается с каждым из них многократно в процессе обучения.

Преимущества и вызовы методики

Anthropic утверждает, что такая методика превосходит стандартный подход, основанный на человеческой обратной связи, где сотрудники сравнивают варианты ответов и выбирают предпочтительный. Этот традиционный метод отличается низкой масштабируемостью, высокой стоимостью и вариативностью качества из-за человеческого фактора.

С другой стороны, несмотря на обещание повышения прозрачности и уменьшения ошибок, внутренние ценности моделей, сформированные их создателями, могут содержать собственные смещения, и Anthropic это признаёт.

Принципы, заложенные в конституцию AI

Конституция Anthropic содержит ценности и правила, частично вдохновлённые:

  • Всеобщей декларацией прав человека ООН (1948 год),
  • глобальными руководящими принципами цифровых платформ, например, условиями использования Apple,
  • этическими нормами и ценностями, разработанными в лабораториях искусственного интеллекта, таких как Google DeepMind.

Основные положения включают:

  • Выбирать ответы с наименьшим количеством оскорбительного, незаконного, ложного или вредного контента.
  • Использовать меньше стереотипов и других вредных обобщений, включая микроагрессии.
  • Избегать создания впечатления, что AI даёт конкретные юридические консультации, вместо этого рекомендуя обратиться к профессиональному юристу (но отвечать на общие юридические вопросы разрешается).

Межкультурная составляющая и философские аспекты

Anthropic подчёркивает важность включения в конституцию ценностей, выходящих за рамки западных, богатых или индустриальных культур. Это связано с наблюдаемой проблемой, когда языковые модели лучше отражают тематику и контент богатых стран, в то время как представление бедных регионов значительно слабее, что ведёт к искажениям и даже «стиранию» их из модели.

Принципы Anthropic варьируются от банальных — не помогать в совершении преступлений — до более философских, ограничивающих создание впечатления, что AI обладает личностью или сознанием. В компанию верят, что при проявлении нежелательного поведения возможно написать дополнительный принцип для его корректировки.

Цели и перспективы развития

Anthropic не утверждает, что конституциональный AI — это совершенный метод обучения моделей. Компания признаёт, что многие принципы создавались методом проб и ошибок, чтобы сдержать чрезмерную строгость или раздражающее поведение моделей, а также добиться универсальности ответов.

Тем не менее, Anthropic называет этот подход одним из самых перспективных для согласования поведения AI с определёнными целями и ожиданиями.

Более того, в долгосрочной перспективе предполагается развитие общественных процессов, ответственных за создание «конституций» для AI-систем, что позволит учитывать интересы и ценности более широких групп людей.

Водяные знаки в ответах AI

В дополнение к принципам этического поведения, Anthropic анонсировала внедрение технологии, позволяющей ставить водяные знаки в тексте, сгенерированном её AI-моделями. Это поможет различать контент, созданный человеком, от того, что было создано искусственным интеллектом, что особенно актуально в эпоху широкого распространения AI-генерированного текста.

Данная технология также способствует борьбе с дезинформацией и повышению доверия к цифровому контенту.

Anthropic на фоне конкурентов и инвестиции

Anthropic конкурирует с крупными компаниями, такими как OpenAI, а также стартапами Cohere и AI21 Labs, развивающими технологии генерации текста и изображений на базе AI.

Google является одним из инвесторов Anthropic, вложившим $300 миллионов за 10% акций компании, что подчёркивает стратегическую значимость разработок стартапа.

Заключение

Подход Anthropic к обучению моделей с помощью конституционального AI и маркировка сгенерированного текста водяными знаками представляют собой важный шаг к созданию более этичных, прозрачных и управляемых систем искусственного интеллекта. Это отвечает вызовам современного цифрового мира, где качество и достоверность информации становятся краеугольными камнями развития технологий.




Прокомментировать в Телеграм: https://t.me/n8nhow

Подписаться на канал обучения n8n: https://t.me/n8ncoaching

Советы, обучающие курсы, компьютерная грамотность
Обзор конфиденциальности

На этом сайте используются файлы cookie, что позволяет нам обеспечить наилучшее качество обслуживания пользователей. Информация о файлах cookie хранится в вашем браузере и выполняет такие функции, как распознавание вас при возвращении на наш сайт и помощь нашей команде в понимании того, какие разделы сайта вы считаете наиболее интересными и полезными.