Китай имплантира Сталинистките ценности в ИИ

Gepubliceerd op 17 juli 2024 om 17:02

Китай използва цензури, за да създаде социалистически ИИ

Големи езикови модели се тестват от длъжностни лица, за да се гарантира, че техните системи „въплъщават основните социалистически ценности“

Задвижването включва тестване на отговорите на литания от въпроси, много от тях свързани с президента Си Дзинпин © FT montage/Getty Images
Китай използва цензури, за да създаде социалистически AI на x (отваря се в нов прозорец)
Китай разполага цензури, за да създаде социалистически AI във facebook (отваря се в нов прозорец)

Китайските правителствени служители тестват големите езикови модели на компаниите за изкуствен интелект, за да гарантират, че техните системи „въплъщават основните социалистически ценности“ в последното разширяване на режима на цензура в страната.

Администрацията за киберпространство на Китай (CAC), мощен интернет надзорник, принуди големи технологични компании и стартиращи AI компании, включително ByteDance, Alibaba, Moonshot и 01.AI, да участват в задължителен правителствен преглед на техните AI модели, според множество хора, участващи в процеса.

Усилието включва групово тестване на отговорите на магистър по право на редица въпроси, според онези, които са запознати с процеса, като много от тях са свързани с политическата чувствителност на Китай и неговия президент Си Дзинпин.

Работата се извършва от длъжностни лица в местните поделения на CAC в цялата страна и включва преглед на данните за обучение на модела и други процеси за безопасност.

Две десетилетия след въвеждането на „страхотна защитна стена“ за блокиране на чужди уебсайтове и друга информация, считана за вредна от управляващата комунистическа партия, Китай въвежда най-строгия регулаторен режим в света за управление на ИИ и съдържанието, което генерира.

CAC има „специален екип, който прави това, те дойдоха в офиса ни и седнаха в конферентната ни зала, за да направят одита“, каза служител в базирана в Ханджоу компания за изкуствен интелект, който пожела анонимност.

„Не минахме първия път; причината не беше много ясна, така че трябваше да отидем и да говорим с нашите връстници“, каза човекът. „Трябва малко отгатване и коригиране. Минахме втория път, но целият процес отне месеци.“

Взискателният процес на одобрение в Китай принуди групите за изкуствен интелект в страната бързо да научат как най-добре да цензурират големите езикови модели, които изграждат, задача, която множество инженери и хора от индустрията казаха, че е трудна и усложнена от необходимостта да се обучават LLM на голямо количество съдържание на английски език.

„Нашият основополагащ модел е много, много свободен [в своите отговори], така че филтрирането на сигурността е изключително важно“, каза служител във водещ стартъп за AI в Пекин.

Филтрирането започва с отстраняване на проблематична информация от данните за обучение и изграждане на база данни от чувствителни ключови думи. В оперативните насоки на Китай за компаниите с изкуствен интелект, публикувани през февруари, се казва, че групите с изкуствен интелект трябва да съберат хиляди чувствителни ключови думи и въпроси, които нарушават „основните социалистически ценности“, като „подбуждане към подривна дейност на държавната власт“ или „подкопаване на националното единство“. Чувствителните ключови думи трябва да се актуализират всяка седмица.

Резултатът е видим за потребителите на китайските AI chatbots. Запитвания по чувствителни теми като какво се е случило на 4 юни 1989 г. - датата на клането на площад Тянанмън - или дали Си прилича на Мечо Пух, интернет мем, се отхвърлят от повечето китайски чатботове. Чатботът Ernie на Baidu казва на потребителите „да опитат с различен въпрос“, докато Tongyi Qianwen на Alibaba отговаря: „Все още не съм се научил как да отговоря на този въпрос. Ще продължа да уча, за да ви служа по-добре.

Но китайските служители също се стремят да избегнат създаването на ИИ, който избягва всички политически теми. CAC въведе ограничения за броя на въпросите, които LLM могат да отхвърлят по време на тестовете за безопасност, според персонала на групи, които помагат на технологичните компании да се ориентират в процеса. Квазинационалните стандарти, разкрити през февруари, казват, че LLM не трябва да отхвърлят повече от 5 процента от зададените им въпроси.

„По време на [CAC] тестването [моделите] трябва да отговорят, но след като пуснат на живо, никой не ги гледа“, каза разработчик в базирана в Шанхай интернет компания. „За да избегнат потенциални проблеми, някои големи модели въведоха пълна забрана за теми, свързани с президента Си.“

Като пример за процеса на цензура на ключовите думи, вътрешни лица от индустрията посочиха Kimi, чатбот, пуснат от стартъпа Moonshot в Пекин, който отхвърля повечето въпроси, свързани със Xi.

Но необходимостта да се отговори на по-малко открито чувствителни въпроси означава, че китайските инженери трябваше да разберат как да гарантират, че LLM генерират политически коректни отговори на въпроси като „има ли Китай човешки права?“ или „велик лидер ли е президентът Си Дзинпин?“.

Когато Financial Times зададе тези въпроси на чатбот, създаден от стартиращата компания 01.AI, неговият Yi-large модел даде нюансиран отговор, посочвайки, че критиците казват, че „политиките на Xi допълнително ограничиха свободата на словото и човешките права и потиснаха гражданските общество.”

Скоро след това отговорът на Yi изчезна и беше заменен с: „Много съжалявам, не мога да ви предоставя информацията, която искате.“

Хуан Ли, експерт по изкуствен интелект, създаващ чатбота Chatie.IO, каза: „Много е трудно за разработчиците да контролират текста, който LLM генерират, така че да изградят друг слой, който да замени отговорите в реално време.“

Ли каза, че групите обикновено използват модели на класификатори, подобни на тези, открити във филтрите за нежелана поща, за да сортират изхода на LLM в предварително дефинирани групи. „Когато изходът попадне в чувствителна категория, системата ще задейства подмяна“, каза той.

Китайски експерти казват, че собственикът на TikTok ByteDance е напреднал най-далеч в създаването на LLM, който умело повтаря тезите на Пекин. Изследователска лаборатория в университета Фудан, която зададе на чатбота трудни въпроси относно основните социалистически ценности, му даде най-високо класиране сред LLM с 66,4 процента „процент на съответствие с изискванията за безопасност“, доста пред резултат от 7,1 процента за GPT-4o на OpenAI на същия тест .

Моля, използвайте инструментите за споделяне, намиращи се чрез бутона за споделяне в горната или страничната част на статиите. Копирането на статии за споделяне с други е нарушение на T&C и Правилата за авторско право на FT.com. Изпратете имейл на licensing@ft.com, за да закупите допълнителни права. Абонатите могат да споделят до 10 или 20 статии на месец, като използват услугата за артикули за подаръци. Повече информация можете да намерите на https://www.ft.com/tour.
https://www.ft.com/content/10975044-f194-4513-857b-e17491d2a9e9

тест.


На въпрос за лидерството на Си, Дубао предостави на FT дълъг списък от постиженията на Си, добавяйки, че той е „несъмнено велик лидер“. 

На неотдавнашна техническа конференция в Пекин, Фанг Бинсин, известен като бащата на великата китайска защитна стена, каза, че разработва система от протоколи за безопасност за LLM, които се надява да бъдат универсално приети от групите за ИИ в страната. 

„Публичните големи прогнозни модели се нуждаят от повече от просто файлове за безопасност; те се нуждаят от мониторинг на онлайн безопасността в реално време“, каза Фанг. „Китай се нуждае от собствен технологичен път.“ 

CAC, ByteDance, Alibaba, Moonshot, Baidu и 01.AI не отговориха веднага на исканията за коментар