Czym jest bias? Obciążenie bazy danych, biasy sztucznej inteligencji a stronniczość ludzi
Bias to termin, który bardzo często jest przywoływany w odniesieniu do sztucznej inteligencji. Jednocześnie konotacje tego pojęcia w różnych kontekstach są nieco inne. W tym artykule wskazuję, czym różni się bias opisywany w statystyce oraz obciążenie bazy danych od biasów w machine learningu (ML) oraz wynikach działania AI i jak to się ma do stronniczości ludzi. Będzie trochę o doborze próby, o problemach z analizą zawartości w naukach społecznych i medioznawstwie oraz kilka trudnych tematów społecznych.
Wraz ze wzrostem popularności wykorzystania sztucznej inteligencji w firmach, coraz częściej możemy spotkać różne wypowiedzi specjalistów na temat biasów. Wynika to z faktu historycznych doświadczeń z wykorzystaniem algorytmów machine learningowych w przeszłości. Bias z określenia dotyczącego obciążenia baz danych oraz stronniczości w nich zawartej i specyfiki działania określonych sieci neuronowych stał się popularnym sposobem opisu niekorzystnych efektów działania AI w życiu społecznym. Chociaż przyczyniły się do tego algorytmy o wiele prostsze niż obecnie dostarczane rozwiązania bazujące na sztucznej inteligencji, to nie możemy zapominać, że nadal niezbędne jest monitorowanie pracy takich systemów.
- Biasy w statystyce oraz obciążenie baz a stronniczość zbierania danych
- Bias a stronniczość w opiniach podzielanych przez ludzi
- Bias w efektach działania AI
- Biasy a sieci neuronowe i machine learning
- Działanie algorytmów na styku tego, co techniczne oraz społeczne
- Biasy w działaniu AI wymagają ciągłego monitorowania
Biasy w statystyce oraz obciążenie baz a stronniczość zbierania danych
Bias w bazach, stronniczość w procesie zbierania danych i bias w statystyce to pewnego rodzaju obciążenie. Może ono wynikać z wielu czynników:
- z rozbieżności rozkładu pewnych cech w próbie względem badanej populacji:
- braku reprezentacji określonych kategorii (w socjologii również zbiorowości, grup społecznych w zależności od kontekstu), grup (często powie statystyk), klas (w terminologii odnoszącej się do klasyfikacji i ML, a nie w kontekście terminu odnoszącego się do struktury społecznej) w bazie;
- nieadekwatnego rozkładu cech w próbie, bazie danych względem badanej populacji i tym samym – niewłaściwego odwozorwania cech populacji w danych;
- przewagi nietypowych reprezentantów rzeczywistej czy badanej populacji w bazie danych, próbie, bez względu na to, czy ich liczebność jest adekwatna do rozkładu innych cech w populacji;
- z powielania przeszłych rozkładów cech w populacji, bazowania na informacjach historycznych, gdy uległy one zmianie, dezaktualizacji w rzeczywistości lub wykorzystania danych z pominięciem kontekstu (np. społeczno-kulturowego, historycznego charakteru danych, ale też innej ich specyfiki);
- ze zbyt małej reprezentacji określonych kategorii, grup, klas w bazie, dla części obliczeń problematyczna, nawet gdy rozkład cech jest adekwatny do rozkładu w populacji;
- ze specyfiki algorytmów, obliczeń, które zostały zastosowane w kontekście rozkładu danych w samej bazie, co prowadzi do stronniczych wniosków, biasów w efekcie takiego procesu, nawet jeżeli rozkład cech w próbie, bazie danych odzwierciedla rzeczywistość;
- ze świadomego stronniczego zbierania danych w bazach, gdy celowo wykorzystywana jest metodyka obarczona błędem, przy czym może ona bazować na przestarzałych, niepoprawnych czy niepełnych teoriach lub być arbitralną decyzją;
- z nieświadomego stronniczego zbierania danych w bazach (na podstawie niewłaściwych kryteriów, błędów metodologicznych, niepełnej wiedzy, niewłaściwych regulacji lub praktyki pracy administracji, instytucji publicznych lub prywatnych, stronniczości zawartej w przepisach, gdy odzwierciedlają one stronniczość kulturową lub np. występujące tendencje do nierównego traktowania ze względu na określone cechy);
- ze świadomego stronniczego doboru próby, czyli doboru celowego, który powoduje, że dane w próbie nie oddają cech populacji lub oddają je, ale przetworzone przez konkretne algorytmy, poddane obliczeniom prowadzą do wnioskowania obarczonego stronniczością, biasem;
- z nieświadomego stronniczego doboru próby, doboru celowego na błędnych przesłankach, gdy w bazie danych pojawiają się wyselekcjonowane informacje na podstawie niewłaściwych kryteriów, czemu w pewnym stopniu może zapobiegać dobór losowy;
- ze stronniczego kodowania, zmiany informacji na wartości wyrażone liczbami na potrzeby analiz lub etykietowania na potrzeby ML/AI, przez co bazując na odpowiednio dobranej próbie, pewne cechy rzeczywistości ulegają zniekształceniu, a taka baza danych lub próba obarczona jest biasem wnikającym z: analizy jakościowej prowadzonej przez człowieka, przetworzenia wstępnego przez algorytmy itp.
Jak widać, sprawa nie jest tak prosta, jak często zwykło nam się przedstawiać. Oddanie rozkładu cech populacji w próbie, bazie danych jest niezwykle trudne i każda osoba, która prowadziła kiedykolwiek badania z zakresu socjologii, doskonale wie, że jest to wyzwanie wymagające dokładnego zaplanowania metodologii. Czasami należy łączyć kilka metod, technik analiz oraz tworzyć różne bazy danych, aby uniknąć błędów.
Zbyt dobrze dobrana próba również może prowadzić do biasów
Dość często o biasach w danych mówi się w kontekście próby i jej adekwatności oraz odpowiedniej reprezentacji do rozkładu cech w badanej rzeczywistości, populacji. Problem jednak może pojawić wtedy, gdy mamy nierównoliczne kategorie, grupy, klasy. Należy jasno wskazać, że jest to problem powszechny i czym głębiej analizujemy określoną tematykę, tym szybciej dochodzimy do wniosku, że w próbach, które posiadamy, często występują takie wyzwania. W najgorszym wypadku nie posiadamy reprezentanta dla określonych kategorii, grupy, klasy, a w innych niekorzystnych przypadkach posiadamy ich zbyt mało, aby prowadzić sensowne analizy statystyczne.
Można zatem paść ofiarą zbyt dobrze dobranej próby. Teoretycznie możemy uznać, że skoro świetnie oddaje populację – tak, jak my ją widzimy – to obciążenia nie ma. Oczywiście o ile faktycznie potrafimy zidentyfikować wszystkie cechy danej populacji. W praktyce coś, co zgodnie z przyjętą metodologią świetnie oddaje populację, może być esencją biasu na poziomie obliczeń i wyciągania wniosków.
Z punktu widzenia badań populacją bywają czasami teksty, dotyczy to m.in. analizy zawartości w medioznawstwie – ilościowej metody, która pozwala statystycznie ujmować m.in. tekst oraz inną zawartość mediów (np. fotografie, filmy, nagrania dźwiękowe). Tutaj dobór próby w przypadku prasy najczęściej obejmuje próbę pełną dla określonego zakresu, czyli 100% treści z określonego przedziału czasowego. Taka decyzja nie jest bezpodstawna. Dlaczego?
Przyjmijmy jako przykład, że badamy populację 1000 tekstów. Załóżmy, że 1000 tekstów to artykuły z jakiejś prasy, a my wiemy, że występują tam kategorie: komentarz polityczny, porady i żarty. Okazuje się, że pismo jest bardzo poważne i kategoria żarty stanowi 10 sztuk z 1000, natomiast dwie pozostałe po 495. Podjęliśmy się doboru losowego 100 elementów do próby, nie jest to warstwowo-losowy dobór, który uwzględniałby kategorie w czasopiśmie, jest to losowanie bez zwracania. Rozkład elementów w populacji dla kategorii w czasopiśmie to: 49,5%; 49,5% i 1%, a w próbie mamy: 50%, 49% i 1% (odpowiednio: 50 sztuk, 49, 1 na 100 artykułów). Jeżeli skupimy się tylko na tym rozkładzie, to uznamy, że całkiem dobrze oddajemy populację, więc możemy bez problemu liczyć, co jest totalną bzdurą.
Wyobraźmy sobie, że chcielibyśmy dokładnie mierzyć szczegółowe cechy badanych artykułów. Szybko wtedy okaże się, że nasz osamotniony reprezentant tych 10 – stanowiący 10% tych tekstów – posiada jakieś indywidualne cechy, których nie mają te pozostałe, albo nie posiada jakichś cech charakterystycznych dla 9 pozostałych artykułów z tej kategorii. Tym samym pominiemy wiele cech, które też w tej populacji tekstów występują.
Biasy jako efekt zastosowanych obliczeń w kontekście posiadanych danych
Znaczna część obliczeń staje się zwyczajnie bezsensowna w przypadku porównywania tak nierównolicznych kategorii. Ktoś powie: „to po prostu przeanalizujmy ten tekst!”. Jasne, możemy to zrobić, o ile mamy świadomość, że informacje na temat jednego elementu nie mogą zostać uogólnione na populację 10, ponieważ zwyczajnie mogliśmy mieć pecha w losowaniu i trafił nam się do próby najmniej reprezentatywny tekst. W końcu losowaliśmy.
Jeżeli ktoś jednak stwierdzi, że bardzo mocno chce wyciągać wnioski na podstawie tego jednego tekstu o 9 pozostałych, to jest to problem, który możemy przyrównać do średniej z jednego elementu, będącej tym elementem. W efekcie do próby mógł nam się trafić artykuł żartobliwy, który dotyczy motyli, a 9 pozostałych to w istocie krytyka polityczna. Faktycznie szansa na to jest mała jak 1 do 9, a prawdopodobieństwo wynosi 0,1.
W takim razie załóżmy coś bardziej prawdopodobnego. Wśród 10 żartobliwych artykułów 5 stanowiło krytykę polityczną, a pozostałe 5 dotyczyło innych tematów. Nam trafił się żart o motylach. Jeżeli ktoś jednak uparcie przeanalizuje ten tekst, nawet pod pewnymi względami statystycznie (np. częstość występowania określonych słów dotyczących polityki), to na końcu stwierdzi, że żartobliwe artykuły w tym czasopiśmie nie dotyczą polityki. Chociaż – jak wiemy z naszego założenia – 50% z nich to właśnie żarty o polityce.
Taki błąd obrazuje, jak może powstać bias w procesie wnioskowania, który wynika z błędnych decyzji metodologicznych. Możemy dostrzec go dopiero po ukończeniu wszystkich etapów działań, ale w momencie planowania należy takie problemy przewidywać i próbować ich uniknąć.
Bias a stronniczość w opiniach podzielanych przez ludzi
Stronniczość we wnioskowaniu to problem, który może dotyczyć potencjalnie każdej osoby. Mówimy o błędach w wydawaniu sądów na temat ludzi lub zjawisk, które mogą wynikać z uwarunkowań społeczno-kulturowych lub doświadczeń własnych danej osoby. W literaturze naukowej można spotkać pojęcie stronniczości wnioskowania w kontekście testów i badań opinii1 – które mogą cechować się takim problem – oraz w odniesieniu do utożsamiania się jednostek z określoną przynależnością do grup społecznych czy zbiorowości. W naukach społecznych w kontekście jednostek często te rozważania pojawiają się przy analizowaniu wyprzedzania rzeczywistego poznania stereotypami (przekonania osoby oceniającej biorą zatem górę nad faktami)2 czy w kontekście heurystyk (w tym heurystyk dostępności i reprezentatywności). W tym wypadku poczucie przynależności do określonej grupy czy zbiorowości oraz indywidualne schematy poznawcze mogą wpływać na stronniczość w postrzeganiu innych osób, uznawanych za reprezentantów innych grup oraz zbiorowości, a także na ocenę zjawisk społecznych czy przypisywanie atrybucji (przypisanie odpowiedzialności osobie lub okolicznościom podczas analizowania przyczyn)3.
Heurystyki reprezentatywności a rzeczywisty rozkład cech w populacji
Błędy we wnioskowaniu jednostek mogą mieć jednak pierwotnie bardziej neutralny charakter, a z czasem przeradzać się w stereotypy. Przykładowo w zawodzie pielęgniarza występuje istotna nadreprezentacja kobiet. GUS nazywa taką sytuację feminizacją zawodu, a w październiku 2020 roku wyraźnie sfeminizowanymi zawodami były te związane z opieką zdrowia (84,7% specjalistów stanowiły kobiety, szczególnie w zakresie pielęgniarstwa oraz pielęgniarstwa i położnictwa), a także nauczaniem, wychowaniem (77,7% specjalistek). Jest to odwrotność maskulinizacji charakterystycznej dla m.in. zawodów powiązanych z technologiami informacyjno-komunikacyjnymi (w październiku 2020 roku 80,1% specjalistów stanowili mężczyźni)4. W efekcie wskazany przeze mnie zawód na poziomie społecznym jest mocno utożsamiany z pielęgniarką, kobietą. Można to zauważyć w przypadku protestów, gdy w niektórych mediach pojawia się informacja, że to „pielęgniarki protestują”, co jasno implikuje płeć i niejako pomija mężczyzn w tym zawodzie.
Załóżmy teraz, że jakaś osoba w rodzinie spotkała kilku pielęgniarzy mężczyzn i ani jednej pielęgniarki. Inne osoby spotykały osoby różnej płci, a jeszcze inne spotykały w większości pielęgniarki i taki obraz pozyskały też z mediów. W efekcie wyobrażenia tych wszystkich osób o tym, co jest typowe dla tego zawodu, będą zupełnie inne. Możemy przypuszczać, że osoby spotykające w większości pielęgniarki, będą miały wzmacniany obraz zawodu pielęgniarza jako powiązanego z kobietami przez czynniki społeczne. Natomiast ci, którzy poznali tylko pielęgniarzy – mężczyzn, bez innych wpływów społecznych, mogliby uznać, że dominują w tym zawodzie osoby innej płci niż kobiety. Ludzie poddani bardziej różnorodnym wpływom edukacyjnym, prawdopodobnie utworzą bardziej skomplikowane modele wnioskowania, np. przy rozpoznaniu, że zawód jest sfeminizowany, będą rozumieć, iż wykonują go nie tylko kobiety.
Chciałabym podkreślić, że na tym etapie trudno mówić o tym, czy i kto ma prawo poczuć się dyskryminowany oraz w jakim zakresie. Przynamniej do momentu, gdy jakiś rekruter zacząłby zatrudniać specjalistów, kierując się wyłącznie ich płcią i odrzucając część kandydatów, pomijając przy tym ich rzeczywiste kwalifikacje. W takich sytuacjach mogłoby okazać się, że dobrzy specjaliści nie mieliby szans na zatrudnienie tylko ze względu na fakt, że nie są kobietami stanowiącymi większość we wskazanym zawodzie. AI może w określonych warunkach odwzorować rzeczywiste różnice w rozkładach pewnych danych, sprzyjając powielaniu dotychczasowych tendencji, nawet jeżeli to nie jest sensowne z punktu widzenia celu działania i może być dyskryminujące.
Stronniczość ludzi w wydawaniu sądów bazująca na fikcji
Jeżeli takie błędy związane z wydawaniem sądów na podstawie wytworów kultury i uwarunkowań społecznych (książki, film, teatr, obrazy, rzeźby, badania naukowe, legendy, powiedzenia, praktyka działania instytucji społecznych, edukacja itd.) są szerszym zjawiskiem, to możemy mówić o stronniczości na poziomie społeczno-kulturowym. Powiązane jest to z szerszym kontekstem społecznym, w tym również z osobistymi doświadczeniami jednostek oraz informacjami wspieranymi przez różne nośniki kultury.
Jednocześnie tak uformowane błędy wnioskowania jednostek, mogą bazować również na zupełnej fikcji. Dotyczy to przykładowo wytworów społeczno-kulturowych, które nie mają żadnego obiektywnego odniesienia w aktualnej rzeczywistości lub nigdy nie były poparte faktami. Może to być kwestia pewnych uwarunkowań historycznych, gdy sytuacja zmieniła się tak drastycznie, że dotychczasowe przekonania stanowią stereotypy niepoparte faktami. Możemy sobie jednak wyobrazić, że obciążenie czy stronniczość wydawania sądów wynikają z błędów o charakterze administracyjnym lub zbyt małej wiedzy naukowej, która pochopnie została wdrożona w życie. Taka potwierdzona po fakcie stronniczość natury administracyjnej, decyzji administracyjnych powiązana z niepełną wiedzą w teoriach nauk medycznych, społecznych, kryminologii rzeczywiście miała miejsce w różnych krajach, a doprowadzała do dyskryminacji wielu osób, które wobec aparatu państwa były bezsilne.
W efekcie obciążone tym błędem dane nadal mogą znajdować się w różnych bazach. Tworzone w stronniczy sposób zbiory danych i inne dzieła ludzi, w tym artykuły, książki, obrazy, które zawierają stronniczość charakterystyczną dla autorów, mogą trafić do baz treningowych, co również będzie przekładać się na działanie sztucznej inteligencji.
Bias w efektach działania AI
Biasy jako niepożądane efekty działania sztucznej inteligencji, stronniczość w działaniu systemów AI, mogłyby – przykładowo – pozbawiać ludzi pracy w sposób dyskryminujący na etapie rekrutacji czy selekcjonować w sposób dyskryminujący do awansu. Taka dyskryminacja może jednak obejmować także inne aspekty życia ludzi, w zależności od kontekstu użycia AI. Często mogą być pochodną stronniczości zebranych danych wynikającej z działania całych struktur społecznych, z wytworów kultury, dotychczasowych obarczonych błędem sposobów podejmowania decyzji.
W przypadku wymiaru sprawiedliwości oraz bezpieczeństwa algorytmy budzą najwięcej kontrowersji. Wynika to z faktu, że nawet jeżeli z zasady nie powinny analizować cech pozamerytorycznych, a koncentrować analizy na innych zagadnieniach niż przykładowo płeć czy kolor skóry, to i tak w toku trenowania takich algorytmów na bazach danych, może dojść do utworzenia relacji powiązanych z cechami takimi jak płeć, wiek, kolor skóry, religia, przynależność związkowa. Co to oznacza w praktyce? Ktoś może zostać uznany za potencjalnie niebezpiecznego przestępcę na podstawie płci, zamiast na podstawie cech istotnych przy takiej analizie. Wyobrażacie sobie, że AI przepuszcza pozornie spokojną kobietę ewidentnie uzbrojoną, ponieważ właśnie zatrzymuje innego człowieka obok przez płeć i nerwowe zachowanie?
Biasy w efektach działania AI w kontekście danych
Biasy w efektach działania sztucznej inteligencji są zarówno pochodną biasów w danych jak i błędów w bazach oraz specyfiki algorytmów (obliczeń) w kontekście określonych danych. Problemy mogą być wynikiem m.in.:
- nadreprezentacji określonych danych w bazie treningowej co nie jest zgodne z rozkładem w populacji (np. jest wynikiem celowego, subiektywnego doboru danych, dezaktualizacji danych, stronniczości zbierania danych, błędów administracyjnych lub niewłaściwych kryteriów przy zbieraniu danych) oraz dalszego potwierdzania tej błędnej tendencji;
- rzeczywistej nadreprezentacji określonych danych w bazie treningowej przy nierównolicznych kategoriach, grupach, klasach, co jest zgodne z rozkładem cech w populacji, jednak w efekcie osoby stanowiące mniejszość mogą być traktowane lepiej lub gorzej w sposób nieuzasadniony;
- nadreprezentacji określonych danych w bazie treningowej, co jest zgodne z rozkładem cech w rzeczywistości, jednak cecha nieistotna staje się zbyt determinująca działanie algorytmu, nie można bowiem wyciągać wniosków o wszystkich przymiotach konkretnej jednostki na podstawie cech takich, jak np. kolor skóry, wyznanie, wiek, płeć, gdyż cechy te nie determinują całokształtu predyspozycji konkretnego człowieka;
- powiązań pomiędzy danymi, które nie są uchwytne dla ludzi, jednak są możliwe do odwzorowania przez algorytmy i dają się sprowadzić do nieistotnej cechy dla klasyfikacji, a tak utworzone relacje pomiędzy danymi nie mają w ogóle sensownej reprezentacji w rzeczywistości;
- powiązań pomiędzy danymi, które nie są uchwytne dla ludzi, jednak są możliwe do odwzorowania przez algorytmy, a następnie wykorzystanie wzorców dających się sprowadzić do nieistotnej cechy, by identyfikować przykładowo zagrożenia, gdy nieistotna cecha ma sensowną reprezentację w rzeczywistości, ale nie jest kluczowa dla klasyfikacji, przez co jej stosowanie doprowadza do wzrostu błędów klasyfikacji (fałszywie pozytywne wyniki, fałszywie negatywne);
- specyfiki zastosowanych algorytmów (obliczeń) w kontekście rozkładu danych w bazach (treningowej, służącej do walidacji);
- braku walidacji oraz weryfikacji lub niewłaściwie prowadzonej walidacji i weryfikacji, co jest szczególnie istotne przy bazach obarczonych błędami lub obciążonych biasami (przykładowo wysokie uzależnienie algorytmów od danych treningowych, walidacja na danych zbyt zbieżnych z danymi treningowymi, a także powielenie błędu podczas weryfikacji działania AI, mogą utwierdzić w przekonaniu, że klasyfikacja jest wystarczająco poprawna i nie jest obarczona biasem).
Wiem, że zabrzmiało to w zawiły sposób. Pomyślmy o tym tak, że przynajmniej część wzorców w danych i relacji pomiędzy nimi, z których korzystają systemy AI, nie ma żadnego pokrycia z rzeczywistością postrzeganą przez człowieka. Często warunkują one właściwą pracę takiej sztucznej inteligencji, ale są też przypadki, gdzie każdy zada sobie pytanie: „jak to możliwe, że takie inteligentne AI robi tak bezsensowną robotę?”. Przykładem mogą być kwestie rozpoznawania obrazu (computer vision) z wykorzystaniem ML, gdzie algorytmy, sieci neuronowe mogą wykrywać wzorce i tworzyć relacje dla danych odzwierciedlających części obrazu, które każdy człowiek uzna za bezsensowne dla celu ich działania. Załóżmy, że na obrazie chcemy wykryć kwiaty, a AI będzie nam je wykrywać z wysokim prawdopodobieństwem zawsze, gdy jest jakaś zieleń w większej ilości, czyli przykładowo na idealnie zielonym dywanie imitującym trawę bez żadnych kwiatów. Sensowne, ale nie zawsze i dla człowieka jest to oczywiste, że kwiatów nie rozpoznaje się po trawie, chociaż można znaleźć je w trawie. Jeżeli walidacja i weryfikacja działania takich algorytmów będzie prowadzona na bazie zawierającej bardzo podobne dane do tych treningowych, to może się okazać, że takie AI uzyska całkiem dobre statystyki działania. Chociaż dostrzegamy jako ludzie, że mogą pojawić się istotne problemy w praktyce, gdy takie rozwiązanie zacznie działać na danych z zielonymi dywanami imitującymi trawę bez kwiatów.
Przykład biasu w działaniu sztucznej inteligencji
Jako przykład weźmy badania, które opisała Hannah Fry. Autorka wskazała analizy, w których weryfikowano po fakcie trafność przewidywania, czy dana osoba w przyszłości po raz kolejny dopuści się przestępstwa. W wyniku przeprowadzonych analiz stwierdzono, że „w grupie oskarżonych, którzy faktycznie dopuścili się kolejnego przestępstwa w ciągu dwóch lat od zatrzymania, prawdopodobieństwo postawienia fałszywej prognozy niskiego ryzyka było dwukrotnie większe dla podsądnych o białym kolorze skóry niż dla czarnoskórych”. Natomiast wśród osób uznanych za winne, które po odbyciu kary nie weszły ponownie w konflikt z prawem, czarnoskórzy oskarżeni mieli „prawdopodobieństwo fałszywego zaliczenia przez algorytm do grupy wysokiego ryzyka dwukrotnie większe” niż osoby białe. Predykcja ta przekładała się na wyrok, długość zasądzonej kary, co bezpośrednio wpływało na życie ludzi. W efekcie powstało wyższe ryzyko zasądzenia krótszego wyroku dla recydywistów o białym kolorze skóry i wyższe ryzyko bardziej surowego potraktowania czarnoskórych skazanych, którzy w rzeczywistości nie dopuścili się ponownie przestępstwa w analizowanym okresie5. Oczywiste jest wskazywanie w tym wypadku na problem ewidentnej dyskryminacji czarnoskórych oskarżonych. Jednak spójrzmy na to z perspektywy wszystkich mieszkańców, podatników, którzy utrzymują taki system sprawiedliwości i chcieliby czuć się bezpiecznie. Wystarczy tylko pomyśleć o tym, że na podstawie cechy, będącej źródłem dyskryminacji, ktoś błędnie został uznany za osobę, która nie ponowi przestępstwa, a jednak odbył krótszą karę i dopuścił się recydywy. Ofiary oraz ich bliscy zdecydowanie nie poczują się pocieszeni tym, że o ich cierpieniu przesądził biały kolor skóry sprawcy, gdyż stanowił przepustkę do szybszego wyjścia na wolność. Podczas gdy miejsca w więzieniach, również na mocy koloru skóry, zajmują osoby, które nie sprawią ponownie, iż ktokolwiek będzie ofiarą.
To efekt utworzenia wzorców przez algorytm, w wyniku czego – z punktu widzenia ludzi – cecha, która nie warunkuje ryzyka recydywy (kolor skóry), stała się na tyle determinująca klasyfikację, że znalazła odzwierciedlenie w wynikach przetwarzania informacji przez system AI. Należy podkreślić, że taka cecha może warunkować wynik działania systemu sztucznej inteligencji pośrednio, na podstawie innych parametrów. Intencje twórców danego rozwiązania bazującego na sztucznej inteligencji mogą być zatem dobre, jednak w toku trenowania AI może dojść do utworzenia powiązań pomiędzy danymi, które pośrednio odnoszą się do innych cech. W ten sposób w wynikach działania sztucznej inteligencji powstaje bias, który powiela obciążenia związane ze stronniczością lub występujące społecznie powszechne tendencje pomijające mniejszości, wyjątki, indywidualność, a czasami te najistotniejsze cechy. To właśnie stronniczość wyników AI, która pokrywa się z biasem uwarunkowanym społecznie lub kulturowo. W przytoczonym przykładzie szczegóły działania algorytmów nie były znane oraz jawne.
Wskazywane rozwiązania często krytykowane przez specjalistów to machine learning wykorzystywany w przeszłości, algorytmy o wiele prostsze, z ogromnymi ograniczeniami mocy obliczeniowej, bez tak dużego doświadczenia w projektowaniu rozwiązań AI, jak współcześnie. To nie oznacza jednak, że nie potrzebujemy dalszego kontrolowania efektów działania sztucznej inteligencji, ponieważ potencjalne błędy i biasy mogą przekładać się na życie każdego z nas.
Biasy a sieci neuronowe i machine learning
Niekiedy można spotkać także określenie bias prezentowane przez specjalistów jako coś niezbędnego i oczywistego w ramach działania AI. Dotyczy to określonych rozwiązań stosowanych w machine learningu. Biasy i wagi w takich rozwiązaniach to podstawowe komponenty uczenia maszynowego, algorytmów tworzonych do wykrywania wzorców w danych. Bazując na prostym przykładzie, na każdym z węzłów w warstwach ukrytych występują wagi i biasy jako dodatkowe wartości dodawane w toku działań. Warstwy ukryte zawierają określoną liczę węzłów, w efekcie mówimy o działaniach na macierzach wag oraz biasów, co można zobrazować jako mnożenie wag przez wartości wejściowe i dodanie biasów. Wynik następnie poddany jest kolejnym działaniom, np. ReLU jako funkcja aktywacji w celu wyzerowania ujemnych wartości. Tak przetworzone wyjście warstwy ukrytej staje się wejściem dla kolejnej warstwy, aż do uzyskania efektu końcowego, czyli wyjścia sieci6.
Jak obrazuje powyższy bardzo uproszczony opis, nawet bardzo prosta sieć neuronowa to sporo obliczeń. Biasy w tym przykładzie stanowią część z nich i są również istotne w procesie fine-tuningu, czyli dostrojenia modelu do bardziej wyspecjalizowanych zadań. To, na ile zmianie powinny ulec wagi a na ile biasy, aby efekt działania algorytmów ML był optymalny, to spore wyzwanie.
Działanie algorytmów na styku tego, co techniczne oraz społeczne
Czym prostsze algorytmy lub większe uproszczenie poprzez zmniejszanie zakresu cech branych pod uwagę na każdym etapie procesu projektowania AI, tym większe ryzyko powstania biasów, często wyglądających na stereotyp, heurystykę. Jednocześnie wyższa szczegółowość, czy nadmierna szczegółowa wrażliwość również doprowadzą do błędów i mogą doprowadzić do biasów w działaniu. Poprzez przetworzenie informacji przez algorytmy może dojść także do zapośredniczonego powiązania pewnych danych z innymi, w efekcie czego wyniki działania AI mogą zawierać błędy, biasy. No i trzeba trafić idealnie w punkt, mając wiedzę na temat bazy danych, docelowego wykorzystania danego rozwiązania oraz rozumiejąc specyfikę wykorzystanych obliczeń.
Zbyt proste obliczenia funkcjonujące w organizacjach czy społecznościach, nazwane algorytmami, mają jeszcze jeden minus. Załóżmy, że ktoś „rozwiązał” skomplikowany, stały lub potencjalnie powtarzający się problem regresją liniową, a przynajmniej tak twierdzi. Na dodatek zoperacjonalizował pojęcia tak, że przyjął jeden wskaźnik i zastosował dwie zmienne, a ich wartości stanowią liczby rzeczywiste oddające badane zjawisko, przy jednym prostym obliczeniu. Inni w to uwierzyli. „Zaawansowany algorytm” został wdrożony w życie, co przekłada się przykładowo na ocenę pracy oraz wypłatę pracowników. Być może nawet ktoś na wstępie poczuł się nim skrzywdzony, to będzie już zależało od założonej metodologii. W bardzo krótkim czasie jakaś osoba będzie wiedziała, jak ten algorytm działa, a więc i doskonale będzie potrafiła ten algorytm oszukać wraz z innymi pracownikami. Dlaczego wybrałam przykład regresji liniowej? Ponieważ każdy socjolog w Polsce powinien rozumieć, jak działa regresja liniowa i dobrze byłoby, aby potrafił też zastosować w praktyce korelację Pearsona oraz rozumiał, dlaczego w badaniach stosuje się korelację rang Spearmana przez wszechobecne skale porządkowe w socjologii7. Podobnie w przypadku osób kończących psychologię, niektóre inne kierunki społeczne oraz znaczną część kierunków medycznych, przyrodniczych, technicznych. Oznacza to, że nawet osoby, które nie są statystykami, bez problemu mogą zrozumieć, jak działa taki algorytm i w prosty sposób na niego wpływać, manipulować nim. Muszą oczywiście wygenerować wspólnie określone wartości zmiennych, czyli podjąć właściwe działania. Szczerze mówiąc, nawet dziecko intuicyjnie szybko zorientuje się, jak przy takim obliczeniu wygląda korelacja zmiennych. Biorąc po uwagę powszechność reklam oferujących „hakowanie algorytmów” lub inne sposoby na dopasowanie treści do algorytmów social media czy wyszukiwarek, na bardziej skomplikowane rozwiązania ludzie też chcą znaleźć sposób.
Oczywiście zbyt skomplikowane algorytmy przestają być dla ludzi czytelne, a wtedy każdy efekt ich działania jest niepewny. Jeżeli na ich podstawie podejmowane są decyzje, to z takim samym poczuciem pewności osoby decydującej, jak uznanie za prawdę wróżby wróżki lub wróża. Oznacza to, że bazuje się na zaufaniu, a nie na rzetelnej wiedzy.

Biasy w działaniu AI wymagają ciągłego monitorowania
Problem biasów w wynikach AI jest ważny, podobnie jak stronniczość podczas podejmowania decyzji przez ludzi. Człowiek zapytany o taki bias w jego wnioskowaniu, mógłby unikać przyznania się do błędu. Za to sztuczna inteligencja zapytana o wyjaśnienie swojego działania, niezbyt potrafi nam odpowiedzieć, więc zakładamy, że ryzyko podjęcia decyzji bez zrozumienia szczegółów jest wysokie. Wzrasta ono szczególnie, jeżeli żadna osoba korzystająca z takiego systemu, nie zada sobie pytania: czy na pewno to AI spełnia założone cele, czy jest to efekt przetworzenia danych w sposób dyskryminujący, obciążony błędami, stronniczy? Na korzyść obecnych rozwiązań przemawia fakt, że posiadamy większe możliwości, które zawdzięczamy nie tylko mocy obliczeniowej i usługom chmurowym, bazującym na nowoczesnych centrach danych. Doświadczenia z przeszłości, zmiany w zakresie podejścia do tworzenia modeli i cała wiedza zgromadzona przez specjalistów przekładają się na większą wrażliwość na potencjalne niekorzystne efekty działania tworzonych systemów. Z wrażliwością oraz doświadczeniem jest jednak tak, że zawsze warto przypominać problemy z przeszłości, aby unikać ich w przyszłości.
- Elżbieta Hornowska, Stronniczość testów psychologicznych: problemy metodologiczne – konsekwencje społeczne, „Przegląd Psychologiczny”, 2000, tom 43, nr 1, 39-46. ↩︎
- Walter Lippmann, Opinia publiczna, Kraków 2020, s. 90. ↩︎
- Elliot Aronson, Timothy D. Wilson, Robin M. Akert, Psychologia społeczna. Serce i umysł, wyd. I, Poznań 1997, rozdziały 4 i 5. ↩︎
- Urząd Statystyczny w Bydgoszczy, pod kierunkiem Leszka Kozłowskiego, Struktura wynagrodzeń według zawodów w październiku 2020 r., Bydgoszcz, Warszawa 2022, s. 15–16. ↩︎
- Hannah Fry, rozdział Wymiar sprawiedliwości w: Hello world. Jak być człowiekiem w epoce maszyn, Kraków 2019. ↩︎
- Thomas Nield, Podstawy matematyki w data science. Algebra liniowa, rachunek prawdopodobieństwa i statystyka, Gliwice 2022, s. 201-208. ↩︎
- Hubert M. Blalock, Statystyka dla socjologów, Warszawa 1977, s. 304-439. ↩︎


