Wykorzystanie sztucznych sieci neuronowych - Łukasz Wordliczek


Reflow text when sidebars are open.
[1] Isaac Asimov's Book of Science and Nature Quotations, red. I. Asimov, J. Shulman, Weidenfeld & Nicolson, New York 1988, s. 281.
[2] G. Mulgan, Collective intelligence as humanity's biggest challenge, "Nesta Blog", 2017, https://bit.ly/2mfRsKN (dostęp: 3 października 2018 r.).
[3] Za: M.A. Boden, Computer Models of Creativity, "AI Magazine" 2009, t. 30, nr 3, s. 24-25.
[4] Co jest oczywiście wynikiem przyjęcia pewnej konwencji społecznej; zob. M.A. Boden, Computer Models of Creativity, w: Handbook of Creativity, red. R.J. Sternberg, Cambridge University Press, Cambridge 1999, s. 351.
[5] Także i tym razem Czytelnik zainteresowany taką perspektywą bez trudu znajdzie stosowne informacje w szeroko przytaczanej literaturze przedmiotu.
[6] Warto w tym miejscu przypomnieć, co miał powiedzieć Stefan Kryński o mikrobiologu Rudolfie Weiglu (wynalazcy szczepionki przeciwtyfusowej): "Mówił, że człowiek ma w swym życiu trzy okresy: w pierwszym jest przekonany, że wszystko wie; w drugim dochodzi do wniosku, że bardzo mało wie; a w trzecim zaczyna się uczyć. Niestety większość przez całe życie pozostaje w pierwszym okresie"; cyt. za: I. Wagner, Odpowiedź na polemikę, czyli więcej na temat publikacji w języku angielskim w zagranicznych czasopismach przez polskich specjalistów nauk społecznych i humanistycznych, "Przegląd Socjologii Jakościowej" 2012, t. 8, nr 2, s. 278.
[7] Dane za: "vapnik", Google Scholar, 2019, https://bit.ly/2Etrb0S (dostęp: 17 grudnia 2019 r.).
[8] Ze względów edycyjnych oraz z uwagi na coraz częściej zyskującą na popularności praktykę, większość linków została skrócona przy wykorzystaniu narzędzia Bitly (https://bitly.com/). Przyjęte standardy narzucają także stosowanie oznaczeń DOI (Digital Object Identifier). W niniejszej publikacji przyjęto zasadę podawania DOI w wypadku źródeł, które pochodzą wyłącznie z Internetu. Jeżeli powoływany materiał ma także wersję drukowaną i posiada pełny opis bibliograficzny umożliwiający jego identyfikację, to zrezygnowano z podawania DOI.
[9] Wielki slownik wyrazów obcych PWN, red. M. Bańko, PWN, Warszawa 2010, s. 40.
[10] Zwraca na to wyraźnie uwagę - w sposób całkowicie opisowy, niealgorytmiczny - autor książki traktującej właśnie o "ludzkim" wymiarze rozwiązań z zakresu sztucznej inteligencji (zob. K. Hosanagar, A Human's Guide to Machine Intelligence. How Algorithms Are Shaping Our Lives and How We Can Stay in Control, Viking, 2019, s. 5-6). Z kolei o rozróżnieniu na szerokie i wąskie (techniczne) rozumienie terminu "algorytm" zob. J. Danaher i in., Algorithmic governance: Developing a research agenda through the power of collective intelligence, "Big Data & Society" 2017, t. 4, nr 2, s. 19.
[11] Funkcjonalnie, przykładem algorytmu mogą być dobrze znane z praktyki organizacyjnej wielu instytucji "standardowe reguły działania (standard operating procedures, SOPs)"; za: D. Lazer, The Rise of the Social Algorithm, "Science" z 5 czerwca 2015 r., t. 348, nr 6239, s. 1091.
[12] J.Z. Cypkin, Podstawy teorii układów uczących się, Wydawnictwa Naukowo-Techniczne, Warszawa 1973, s. 10.
[13] Ze względów stylistycznych w dalszych częściach pracy będzie także stosowana nazwa uproszczona: sieci neuronowe. Jeżeli będzie mowa o biologicznym pierwowzorze, zawsze wtedy jest użyty właśnie przymiotnik "biologiczny". Autor spotkał się także w krajowym środowisku naukowym ze znacznie rzadziej używanym terminem "sieci neuronalne"; zob. np. A. Kasperska, Problemy zastosowania sztucznych sieci neuronalnych w praktyce prawniczej, "Przegląd Prawa Publicznego" 2017, nr 11, s. 25-32. Z kolei wyrażenie "sieci neuralne" jest stosowane, ale głównie w ograniczonym zakresie jedynie w naukach medycznych; zob. np. w J. Trąbka, Neurocybernetyka, Collegium Medicum UJ, Kraków 1994, s. 14. Nieco podobna sytuacja występuje w języku angielskim - najczęściej stosowane jest określenie neural networks, a znacznie rzadziej skrótowo: neural nets. Inne pojawiające się terminy [sztuczne sieci liczące, sieci (auto-)asocjacyjne, obliczenia neuronowe, zespołowe przetwarzanie sygnałów, równoległe przetwarzanie sygnałów, konekcjonizm, modele konekcjonistyczne, teoria automatów skończonych, maszyny uczące się, układy uczące się itd.) są czasami stosowane - głównie w dziedzinie nauk ścisłych i przyrodniczych oraz inżynieryjno-technicznych. Z tego powodu będą one tutaj używane tylko sporadycznie.
[14] Warto w tym miejscu odnieść się do pewnej zawiłości semantycznej. Otóż wielokrotnie, opisując sieci neuronowe, będziemy się posługiwać pojęciem "parametr". W ścisłym rozumieniu model parametryczny charakteryzuje się koniecznością znajomości rozkładu (identyfikacji struktury) analizowanej zmiennej, samo ustalenie wartości parametrów zaś określa się estymacją parametrów opisujących rozkład tejże zmiennej. Z kolei ogólnie rzecz ujmując, model parametryczny zakłada stałą liczbę parametrów - to znaczy nieprzyrastającą wraz ze wzrostem danych i/lub struktury samego modelu.
[15] J. Żurada, M. Barski, W. Jędruch, Sztuczne sieci neuronowe. Podstawy teorii i zastosowania, Wydawnictwo Naukowe PWN, Warszawa 1996, s. 289; P.A. Schrodt, Seven Deadly Sins of Contemporary Quantitative Political Analysis, "Journal of Peace Research" 2014, t. 51, nr 2, s. 295; S. Hegelich, Decision Trees and Random Forests: Machine Learning Techniques to Classify Rare Events, "European Policy Analysis" 2016, t. 2, nr 1, s. 100, 117. Por. L. Zeng, Prediction and Classification with Neural Network Models, "Sociological Methods & Research" 1999, t. 27, nr 4, s. 511; S. de Marchi, Ch. Gelpi, J.D. Grynaviski, Untangling Neural Nets, "American Political Science Review" 2004, t. 98, nr 2, s. 371-378. Jak wiadomo, proces estymacji klasycznych modeli liniowych posiada wiele istotnych ograniczeń. Jednym z nich jest konieczność pozbawienia danych autokorelacji w celu dokonania oszacowania jakości modelu przy użyciu funkcji gęstości prawdopodobieństwa; za: S. Hegelich, Deep learning and punctuated equilibrium theory, "Cognitive Systems Research" 2017, nr 45, s. 67. O ograniczeniach modeli regresji liniowej i możliwościach ich przezwyciężenia zob. także w M. Hindman, Building Better Models: Prediction, Replication, and Machine Learning in the Social Sciences, "The ANNALS of the American Academy of Political and Social Science" 2015, t. 659, nr 1, s. 48-62.
[16] Tak np. w N. Beck, G. King, L. Zeng, Improving Quantitative Studies of International Conflict: A Conjecture, "American Political Science Review" 2000, t. 94, nr 1, s. 21-35; G. King, L. Zeng, Improving Forecasts of State Failure, "World Politics" 2001, t. 53, nr 4, s. 639-640.
[17] Zob. w: B. Cheng, D.M. Titterington, Neural Networks: A Review from a Statistical Perspective, "Statistical Science" 1994, t. 9, nr 1, s. 2-30; G.D. Garson, Neural networks: an introductory guide for social scientists, Sage, London 1998, s. 17.
[18] Za: N. Beck, G. King, L. Zeng, Theory and Evidence in International Conflict: A Response to de Marchi, Gelpi, and Grynaviski, "American Political Science Review" 2004, t. 98, nr 2, s. 380. Analogicznie G.D. Garson, Neural networks..., s. 7.
[19] Za: A. Wuffle, Reflections on Academia, "PS: Political Science and Politics" 1986, t. 19, nr 1, s. 60.
[20] Za: A.R. Barron, Universal approximation bounds for superpositions of a sigmoidal function, "IEEE Transactions on Information Theory" 1993, t. 39, nr 3, s. 930-945; L. Zeng, Prediction and Classification..., s. 501; L. Zeng, Neural Network Models for Political Analysis, w: Political complexity: nonlinear models of politics, red. D. Richards, University of Michigan Press, Ann Arbor 2000, s. 240.
[21] Co do zasady liczba parametrów modelu zależy od analizowanego problemu. W wypadku kiedy jest relatywnie mało danych, oznacza to względnie niewielką liczbę parametrów modelu. Zob. szczegółowe ustalenia W. Duch, N. Jankowski, T. Maszczyk, Make it cheap: Learning with O(nd) complexity, "The 2012 International Joint Conference on Neural Networks (IJCNN)" 2012, nr 1-4, https://doi.org/10.1109/IJCNN.2012.6252380 (dostęp: 4 maja 2017 r.).
[22] Za: D.H. Bearce, Economic Sanctions and Neural Networks: Forecasting Effectiveness and Reconsidering Cooperation, w: Political complexity: nonlinear models of politics, red. D. Richards, University of Michigan Press, Ann Arbor 2000, s. 269-295. Zob. także D. Richards, Optimizing, Strategizing, and Recognizing: Learning in a Dynamic Social Environment, w: Political complexity: nonlinear models of politics, red. D. Richards, University of Michigan Press, Ann Arbor 2000, s. 337.
[23] D. Richards, Optimizing, Strategizing, and Recognizing..., s. 338.
[24] Za: S. Hegelich, Deep learning..., s. 62.
[25] Za: J. Trąbka, Neurocybernetyka..., s. 17, 18-19.
[26] Do znacznego stopnia taki stan rzeczy ilustruje znany przykład z życia codziennego. Otóż w układach elektrycznych połączonych szeregowo (np. lampki na choinkę w tradycyjnej wersji) przepalenie się jednej żarówki powoduje usterkę całego łańcucha. Z kolei układy połączone równolegle nie wykazują takiej słabości. Struktury sieciowe upowszechniają się także w znacznie bardziej skomplikowanych systemach, czego przykładem może być oczywiście Internet czy choćby światowa gospodarka ery globalizacji; szerzej na ten temat zob. uwagi i literatura w S.J. Kobrin, Economic governance in an electronically networked global economy, w: The Emergence of Private Authority in Global Governance, red. R.B. Hall, T.J. Biersteker, [2007 ed.], Cambridge University Press, New York 2002, s. 52-55.
[27] Zob. podstawowe informacje w S. Kulhari, The Midas Touch of Blockchain: Leveraging it for Data Protection, w: Building-Blocks of a Data Protection Revolution: The Uneasy Case for Blockchain Technology to Secure Privacy and Identity, Nomos Verlagsgesellschaft mbH, Baden-Baden 2018, s. 15-22. W największym skrócie blockchain opiera się na zasadach: zdecentralizowania, rozproszenia zasobów zaangażowanych podmiotów, przejrzystości działania (anonimowość i nieodwracalność operacji), oraz oparciu na poszczególnych elementach konstrukcyjnych. Są one powszechnie nazywane "blokami" (blocks), które w wyniku połączenia tworzą liniową strukturę (chain) - stąd nazwa blockchain. W tym wypadku kolejne "łańcuchy" tworzą sieć.
[28] Ten ostatni postulat np. L. Zeng, Neural Network Models..., s. 247.
[29] Na temat sztucznych sieci neuromodulowanych (Neuro-Modulated Networks) zob. N. Vecoven i in., Introducing neuromodulation in deep neural networks to learn adaptive behaviours, "PLOS ONE" 2020, t. 15, nr 1, s. 1-13.
[30] Za: G.D. Garson, Neural networks..., s. 9.
[31] Jednym z powszechniej identyfikowanych związków zachodzących między danymi jest ich zależność od funkcji czasu; szerzej na ten temat zob. np. L.K. Williams, Temporal Dependence and the Sensitivity of Quantities of Interest: A Solution for a Common Problem, "International Studies Quarterly" 2018, t. 62, nr 4, s. 892-902.
[32] Szerzej zob. D.H. Bearce, Economic Sanctions..., s. 272.
[33] Przykład za: S. Astill, P. Cairney, Complexity Theory and Political Science: Do New Theories Require New Methods?, w: Handbook on Complexity and Public Policy, red. R. Geyer, P. Cairney, Edward Elgar Publishing Ltd., Cheltenham, UK 2015, s. 133. Na temat zdolności SSN do analizy zjawisk odznaczających się nieliniowością i odziaływaniem na siebie zmiennych zob. np. Ch.M. Bishop, Neural Networks for Pattern Recognition, Oxford University Press, Oxford 1995; K.K. Minu, M.C. Lineesh, C.J. John, Wavelet neural networks for nonlinear time series analysis, "Applied Mathematical Sciences" 2010, t. 4, nr 50, s. 2485-2495; S. Tonidandel, E.B. King, J.M. Cortina, Big Data Methods: Leveraging Modern Data Analytic Techniques to Build Organizational Science, "Organizational Research Methods" 2018, t. 21, nr 3, s. 533. Z kolei o sieciach neuronowych jako przykładach układów złożonych np. D.W. Tank, J. Hopfield, Collective Computation in Neuronlike Circuits, "Scientific American" 1987, t. 257, nr 6, s. 104-114.
[34] Z.J. Pietraś, Sztuczna inteligencja w politologii. Heurystyczne modelowanie procesów adaptacji politycznej, Wydawnictwo UMCS, Lublin 1990, s. 62.
[35] Za: D. Richards, Nonlinear Modeling: All Things Suffer Change, w: Political complexity: nonlinear models of politics, red. D. Richards, University of Michigan Press, Ann Arbor 2000, s. 2, 8.
[36] K. Hornik, M. Stinchcombe, H. White, Multilayer feedforward networks are universal approximators, "Neural Networks" 1989, t. 2, nr 5, s. 359-366; L. Zeng, Prediction and Classification..., s. 501.
[37] Szerzej na ten temat w M. Lagazio, B. Russett, A Neural Network Analysis of Militarized Disputes, 1885-1992: Temporal Stability and Causal Complexity, w: Toward a Scientific Understanding of War: Studies in Honour of J. David Singer, University of Michigan Press, Ann Arbor 2003.
[38] Za: B.D. Jones, F.R. Baumgartner, From There to Here: Punctuated Equilibrium to the General Punctuation Thesis to a Theory of Government Information Processing, "Policy Studies Journal" 2012, t. 40, nr 1, s. 10.
[39] Przykłady takich sytuacji zob. C. Brown, Serpents in the Sand: Essays on the Nonlinear Nature of Politics and Human Destiny, University of Michigan Press, Ann Arbor 1995. Tam także zob. argument na rzecz tego, że nieliniowość jest immanentnie związana z interakcjami zachodzącymi w zbiorowościach ludzkich, jest cechą definiującą je; C. Brown, Serpents in the Sand..., s. 140-146. Podobnie D. Richards, Optimizing, Strategizing, and Recognizing..., s. 335-336. Zob. także na temat prób modelowania zjawisk nieliniowych N. Beck, S. Jackman, Beyond Linearity by Default: Generalized Additive Models, "American Journal of Political Science" 1998, t. 42, nr 2, s. 596-627.
[40] Zob. D. Richards, Nonlinear Modeling..., s. 3, 13. Zob. także D.A. Sylvan, Planning Foreign Policy Systematically: Mathematical Foreign Policy Planning, "Journal of Conflict Resolution" 1979, t. 23, nr 1, s. 139-173.
[41] Za: D. Richards, Nonlinear Modeling..., s. 15.
[42] Zob. np. w H.A. Simon, Public Administration in Today's World of Organizations and Markets, "PS: Political Science & Politics" 2000, t. 33, nr 4, s. 749-756; P. Érdi, Complexity Explained, Springer, Berlin 2008.
[43] Za: S. Glouberman, B. Zimmerman, Complicated and Complex Systems: What Would Successful Reform of Medicare Look Like?, 2002, t. 1-2, https://bit.ly/2m6rCZC (dostęp: 23 października 2019 r.). Zob. także A. Balicki, Statystyczna analiza wielowymiarowa i jej zastosowania społeczno-ekonomiczne, Wydawnictwo Uniwersytetu Gdańskiego, Gdańsk 2009. Warto w tym miejscu odnotować, że tradycyjne podejścia w ramach metod wielowymiarowych (np. analiza skupień) wymagają na wstępnym etapie dokonania standaryzacji zmiennych w celu zagwarantowania posługiwania się jednorodnymi skalami pomiaru zmiennych. W sztucznych sieciach neuronowych nie jest to założenie konieczne. Oczywiście skala pomiaru i skalowanie zmiennych to nie są tożsame zagadnienia.
[44] Podane przykłady za: S. Glouberman, B. Zimmerman, Complicated and Complex Systems...
[45] Za: S. Astill, P. Cairney, Complexity Theory and Political Science..., s. 133, 135.
[46] Za: M. Givel, "What's the Big Deal?": Complexity Versus Traditional US Policy Approaches, w: Handbook on Complexity and Public Policy, red. R. Geyer, P. Cairney, Edward Elgar Publishing Ltd., Cheltenham, UK 2015, s. 66. Także i metody badań systemów złożonych posiadają swoją ugruntowaną tradycję. Wspomnijmy w tym miejscu o najczęściej wykorzystywanych podejściach: agent-based-modeling, analiza sieci (network analysis), eksploracja danych (data mining), analiza scenariuszowa (scenario modeling); za: M. Givel, "What's the Big Deal?"..., s. 65. Elementarne wprowadzenie do network analysis zob. L. Johnson, Complexity Modelling and Application to Policy Research, w: Handbook on Complexity and Public Policy, red. R. Geyer, P. Cairney, Edward Elgar Publishing Ltd., Cheltenham, UK 2015, s. 161-164.
[47] Za: G. King, L. Zeng, Improving Forecasts..., s. 634.
[48] Za: Ch.S. Taber, R.J. Timpone, Beyond Simplicity: Focused Realism and Computational Modeling in International Relations, "Mershon International Studies Review" 1996, t. 40, nr 1, s. 64. Por. Z.J. Pietraś, Sztuczna inteligencja..., rozdz. 1.
[49] Za: M. Givel, "What's the Big Deal?"..., s. 65.
[50] Za: D. Richards, Optimizing, Strategizing, and Recognizing..., s. 332-336.
[51] Szerzej zob. argumentacja i przytaczana literatura w P.A. Schrodt, Patterns, Rules and Learning: Computational Models of International Behavior, Parus Analytical Systems, Vinland, Kansas 2004, http://www.ku.edu/~keds/books.html (dostęp: 6 maja 2017 r.), s. 54-55.
[52] Za: N. Beck, G. King, L. Zeng, Improving Quantitative Studies of International Conflict..., s. 25. W interesującym nas tutaj aspekcie modelowanie sprowadza się do wykorzystania odpowiedniego algorytmu w celu wydobycia wiedzy z danych.
[53] Za: M. Hindman, Building Better Models...
[54] D. Richards, Optimizing, Strategizing, and Recognizing..., s. 337.
Projekt okładki i stron tytułowych
Przemysław Spiechowski
Ilustracja na okładce
https://www.flickr.com/photos/inggroup/25681989673/in/photostream/
Ilustracja na okładce przedstawia obraz stworzony w 2016 roku przy wykorzystaniu sztucznych sieci neuronowych w oparciu o istniejące prace Rembrandta. Partnerami tego projektu byli: ING, Microsoft, Uniwersytet Techniczny w Delft, Muzeum Mauritshuis w Hadze oraz Muzeum Domu Rembrandta (Museum het Rembrandthuis). Szerzej na ten temat - oraz o innych zastosowaniach sieci neuronowych w sztuce - zob. na s. 38-39 niniejszej książki.
Wydawca
Katarzyna Rosińska
Redakcja
Agnieszka Zagozda
Korekta
Małgorzata Nowak
Produkcja
Monika Dąbrowska
Skład wersji elektronicznej na zlecenie Wydawnictwo Naukowe PWN Michał Latusek
Recenzenci
prof. dr hab. Włodzisław Duch
dr hab. Daniel Mider
Praca powstała w wyniku realizacji projektu badawczego nr UMO-2014/15/B/HS5/01885 finansowanego ze środków Narodowego Centrum Nauki.
Nazwy własne firm, produktów oraz usług zostały wykorzystane wyłącznie w celu zilustrowania analizowanych zagadnień - osobiste preferencje i doświadczenie autora są w tym względzie bez znaczenia.
Copyright ? by Łukasz Wordliczek
Warszawa 2020
ISBN 978-83-01-21651-1
eBook został przygotowany na podstawie wydania papierowego z 2021r. (Wydanie I)
Wydawnictwo Naukowe PWN SA
02-460 Warszawa, ul. Gottlieba Daimlera 2
tel. 22 69 54 321, faks 22 69 54 280
e-mail: pwn@pwn.com.pl, www.pwn.pl
ADALINE
Adaptive Linear Neuron
AI
sztuczna inteligencja (Artificial Intelligence)
AIC
kryterium informacyjne Akaike
AITO
Artificial Intelligence Trade Organization
ARMA
model autoregresyjny ze średnią ruchomą
ARPANET
Advanced Research Projects Agency Network
AUC
area under the curve (w analizie ROC)
CAMEO
Conflict and Mediation Event Observations
CEDS
Computational Event Data System
COMPAS
Correctional Offender Management Profiling for Alternative Sanctions
CPU
procesor centralny (= główny, central processing unit)
DA-RT
Data Access & Research Transparency
Data-PASS
Data Preservation Alliance for the Social Sciences
DL
głębokie nauczanie, głębokie uczenie (deep learning)
DOI
Digital Object Identifier
EEG
obrazowanie elektroencefalograficzne
EWP
Early Warning Project
FCC
Federalna Komisja ds. Komunikacji (Federal Communication Commission)
FISA
Foreign Intelligence Surveillance Act
fMRI
obrazowanie przy wykorzystaniu rezonansu magnetycznego
fNIR
obrazowanie przy wykorzystaniu podczerwieni
FNR
błąd II rodzaju (False-Negative Rate)
FPR
błąd I rodzaju (False-Positive Rate)
GAN
generatywna sieć przeciwstawna (generative adversarial network)
GCHQ
Government Communications Headquarters
GDELT
Global Database of Events, Language and Tone
GDPR
General Data Protection Regulation
GPU
procesor graficzny (= obrazu, graphics processing unit)
GRU
sieć Gated Recurrent Unit
HTM
Hierarchical Temporal Memory
IaaS
Infrastructure as a Service
ICEWS
Integrated Crisis Early Warning System
ICPSR
Inter-university Consortium for Political and Social Research
IEEE
Institute of Electrical and Electronics Engineers
iTRACE
Trending, Recognition, and Assessment of Current Events
KEDS
Kansas Event Data System
LSTM
sieć long short-term memory
MAE
średni błąd bezwzględny (mean absolute error)
MEG
magnetoencefalografia
MIDs
baza danych Militarized Interstate Disputes
ML
uczenie maszynowe (machine learning)
MLP
perceptron wielowarstwowy (multi-layer perceptron)
MSE
błąd średniokwadratowy (mean squared error)
NLP
przetwarzanie języka naturalnego (Natural Language Processing)
OLS
metoda najmniejszych kwadratów (ordinary least squares)
PaaS
Platform as a Service
PCA
analiza głównych składowych (Principal Component Analysis)
PET
Privacy Enhancing Technology
RBF
sieć z radialną funkcją bazową (Radial Basis Function)
RMSE
pierwiastek błędu średniokwadratowego (root mean squared error)
RNN
sieć rekurencyjna (recurrent neural network)
ROC
Receiver Operating Characteristic
RODO
Rozporządzenie o ochronie danych osobowych
SaaS
Software as a Service
SIC
kryterium informacyjne Schwartza
SIGACTS
repozytorium Significant Activities
SNARC
Stochastic Neural Analog Reinforcement Computer
SOM
samoorganizująca się mapa (self-organizing map), sieć Kohonena
SSN
sztuczne sieci neuronowe
SVMs
metoda wektorów nośnych (support vector machines)
TABARI
Textual Analysis by Augmented Replacement Instructions
TNR
True-Negative Rate
TPR
True-Positive Rate
TPU
Tensor Processing Unit
ViEWS
Violence Early-Warning System
XAI
Explainable Artificial Intelligence
Obecnie najsmutniejsze jest to, że nauka gromadzi wiedzę szybciej, niż społeczeństwo gromadzi mądrość.
Isaac Asimov[1]
[...] jest uderzająca nierównowaga pomiędzy elegancją otaczających nas narzędzi a znacznie bardziej ograniczoną elegancją rezultatów ich użycia.
Geoff Mulgan[2]
Jest prawdopodobne, że sięgną do niniejszej książki osoby zaintrygowane tylko jej tytułem. Przez wzgląd na takich Czytelników, przed przejściem do zasadniczych rozważań, należy poczynić kilka uwag o charakterze wyjaśniającym. Dzięki temu jaśniejsze powinny się stać zarówno dalsze wywody, jak i intencje autora. Zacznijmy właśnie od tego zagadnienia: intencji.
Oczywiście podstawową przesłanką, która stała za pomysłem na niniejszą książkę, była chęć zmierzenia się z intrygującym zagadnieniem wyrażonym w tytule. Okazało się to przedsięwzięcie tyleż wielce angażujące, co i inspirujące do dalszych poszukiwań. Niezależnie od tego dodatkowa motywacja wynikała z powodów jak najbardziej pragmatycznych - chodzi tutaj o zarysowanie możliwości skierowania zainteresowania badaczy na obszary, które nie są przesadnie licznie reprezentowane w literaturze przedmiotu, zwłaszcza krajowej. Wydaje się, że możliwości tkwiące w statystyce opisowej i indukcyjnej powinny nas skłonić do nieco wnikliwszego przyjrzenia się możliwościom przez nie oferowanym. Oczywiście nie jest to strategia badawcza o uniwersalnym charakterze; wszakże nie każdy problem badawczy w ramach politologii może być zoperacjonalizowany przy użyciu zmiennych poddających się analizie statystycznej. Jak jednak jest podniesione w książce, takie zagadnienia są we współczesnych realiach raczej wyjątkiem niż regułą. Paradoksalnie, literatura przedmiotu - znowu: głównie krajowa - zdaje się kreować sytuację dokładnie odwrotną: to oszczędne sięganie po podejścia ilościowe jest regułą, i to nawet w pracach o charakterze empirycznym. Niniejsza publikacja jest zatem zaproszeniem do przedmiotowej refleksji oraz dyskusji na temat kondycji metodologicznej współczesnej politologii.
Jeżeli ktoś zechciałby użyć na opisanie powyższych zamierzeń określenia "podejście kreatywne", wypada to opatrzyć następującym zastrzeżeniem. Otóż przyjmuje się, że istnieją trzy główne rodzaje kreatywności: kombinacyjna (combinational, tworzenie nowych bytów ze znanych elementów), badawcza lub też poszukiwawcza (exploratory, testowanie granic bez radykalnej modyfikacji dostępnych elementów) oraz przekształcająca (transformational, polega na przesuwaniu granic dotychczasowych podejść, paradygmatów i procedur)[3]. Ocena zasadności takiej klasyfikacji pozostaje oczywiście poza tematem zasadniczych rozważań. Jednocześnie treść niniejszej książki wydaje się lokować pomiędzy tymi wszystkimi trzema rodzajami kreatywności. W poniższych rozważaniach mamy bowiem do czynienia zarówno z wykorzystaniem znanych elementów procedur badawczych, jak i - mniej lub bardziej - twórczym poszukiwaniem ich granic. Stąd intencją autora było coś więcej niż tylko zarysowanie problemu, naszkicowanie jego zarysów, ale i jednocześnie nie chodziło o daleko ambitniejsze zamierzenie - uporządkowaną, wyraźną, zdecydowaną deklarację zasad nowej (sub)dyscypliny. Dwa podstawowe zamierzenia badawcze można streścić zatem następująco. Po pierwsze, chodzi o wskazanie roli, jaką współcześnie odgrywają dane - zarówno w szeroko rozumianym wymiarze społecznym/politycznym, jak i w towarzyszących mu zamierzeniach badawczych. Po drugie zaś, chodzi o wskazanie - poprzez odpowiednio usystematyzowany wywód - wad, zalet oraz możliwości tkwiących w tytułowym narzędziu analitycznym. Na ile owe zamierzenia są udane - jak zawsze w takich sytuacjach - rozstrzygną zainteresowani dalszą lekturą[4]. Przejdźmy w tym miejscu do uwag wprowadzających i dotyczących treści książki.
Niniejsza praca nie jest podręcznikiem. Czytelnik zainteresowany dalej idącymi szczegółami związanymi z budową, działaniem, rodzajami i stosowaniem sztucznych sieci neuronowych powinien sięgnąć do szeroko przytaczanej literatury przedmiotu. Oferowane są teksty zarówno w języku polskim, jak i - w odpowiednio dużej ilości - w języku angielskim. Wielokrotnie w tej książce znajdują się odwołania do tych źródeł, co powinno ułatwić ich identyfikację i zachęcić do dalszych studiów. Dlatego też dość obszerna bibliografia ma pomóc tym, którzy mogą czuć się nieco zagubieni - czy wręcz sfrustrowani - różnorodnością poruszanej tematyki. Od razu bowiem należy wyraźnie zaznaczyć - wielość oferowanych modeli sztucznych sieci neuronowych może oszałamiać swoją różnorodnością oraz liczbą. Ich przedstawienie w formie podręcznikowej zajmuje kilkaset stron, co wszakże nie jest zamierzeniem niniejszego tekstu - stąd wskazówki, gdzie należy poszukiwać bardziej szczegółowych informacji. A zatem, odwołując się do konwencji wyznaczonej przez okładkę niniejszej publikacji - chodzi tutaj raczej o nakreślenie palety możliwych rozwiązań niż naukę ich stosowania.
Książka nie jest także z założenia przeznaczona dla Czytelników z zaawansowanym poziomem wiedzy o sztucznych sieciach neuronowych i poszukujących informacji o charakterze wysoce specjalistycznym. Może to być lektura dla takich osób, o ile tylko są one zainteresowane nieco szerszą refleksją naukową nad znanymi im sposobami analizy danych. Niniejszy tekst jest efektem prac wykonanych w ramach grantu NCN OPUS 8 "Wykorzystanie sieci neuronowych w badaniach politologicznych" (UMO-2014/15/B/HS5/01885) w latach 2015-2020. Projekt ten był realizowany w obszarze badawczym HS (Nauki Humanistyczne, Społeczne i o Sztuce, panel HS5: Normy i władza), stąd jego efekty w postaci tej publikacji są skierowane głównie do osób właśnie nieposiadających wykształcenia ścisłego/technicznego. Dlatego też dołożono wszelkich starań, aby do absolutnego minimum ograniczyć stosowanie żargonu typowego dla przedstawicieli tychże dziedzin nauki. Dodatkowo notacja matematyczna także została potraktowana w sposób elementarny, świadomie zrezygnowano również z przytaczania formalnych dowodów matematycznych[5]. Z powyższych względów praca zawiera w dużej części rozważania o charakterze wstępnym, które przez bardziej zaawansowanych Czytelników mogą być z powodzeniem ominięte. Jednak dalsze fragmenty (traktujące o wyzwaniach wobec nauk społecznych oraz o zastosowaniach tytułowej techniki do rozwiązywania konkretnych problemów badawczych w politologii, czyli - odpowiednio - rozdziały 6 i 7) mogą zainteresować także i osoby posiadające bardziej zaawansowaną wiedzę z dziedziny nauk ścisłych, przyrodniczych czy też inżynieryjno-technicznych.
Niniejsza książka skierowana jest zatem w szczególności do osób, które do tej pory nie wykorzystywały w działalności naukowej omawianych tutaj podejść, a zwłaszcza jest kierowana do tych, którzy zakładają, że prawdopodobnie nigdy ich nie wykorzystają. Przez wzgląd na nich dołożono wszelkich starań, aby wywód - momentami nieco hermetyczny - opatrzyć odpowiednią liczbą przykładów ilustrujących interesujące nas zjawiska. Stąd też z konieczności część wykorzystanej literatury przedmiotu to prace popularnonaukowe oraz publicystyczne.
Tytuł pracy pozostaje w ścisłym związku z układem jej treści. I tak, najpierw omówione zostają zagadnienia dotyczące biologicznych sieci neuronowych, następnie założenia modelu obliczeniowego, a na końcu - mowa jest o przykładowych zastosowaniach. Stąd też, w szerszej perspektywie, książka składa się z dwóch części: teoretycznej i empirycznej opartej na swego rodzaju studium przypadku (jest nim politologia). Autor skłania się więc ku stanowisku, że to właśnie teoretyzowanie jest koniecznym - wstępnym - elementem rozeznania danego obszaru badawczego. Dopiero dysponując wiedzą uzyskaną w tym kroku, można się odnieść do określonych zastosowań praktycznych. Dzięki temu posiadanie wnikliwej, fachowej wiedzy przedmiotowej związanej z danym narzędziem niekoniecznie musi ograniczać możliwości zastosowania tego narzędzia przez osoby niemające takiej wiedzy[6]. Podbudowa teoretyczna jest w stanie wypełnić taką lukę poprzez stworzenie stosownych ram heurystycznych. Ilustracją tej argumentacji może być - dość wszakże banalny - przykład. Otóż efektywne wykorzystanie komputera - w znakomitej większości codziennych zastosowań - nie wymaga posiadania fachowej wiedzy informatycznej. Bardziej wyrafinowanym zjawiskiem są jednak same sieci neuronowe - zarówno biologiczne, jak i sztuczne. Otóż wiele ich aspektów wciąż pozostaje nierozstrzygniętych na gruncie nauki, co nie zmienia faktu, że stanowią one przedmiot nie tylko ożywionych badań, lecz także i dynamicznie rozwijanych praktycznych aplikacji. Szerzej jest o tym mowa w dalszych częściach tekstu. Stąd wydaje się, że znajomość - choćby na podstawowym poziomie - danych narzędzi może decydować o ich właściwym wykorzystaniu, gdyż istotą takiego podejścia jest posiadanie świadomości ograniczeń tychże narzędzi.
Osobne wyjaśnienie dotyczy wspomnianej bazy źródłowej. Wykorzystano materiały różnorakiego rodzaju. Większą ich część stanowią anglojęzyczne prace naukowe, które zostały opublikowane w recenzowanych czasopismach oraz w wydawnictwach o zasięgu międzynarodowym. Warto w tym miejscu zaznaczyć, że autor niniejszej książki jest świadomy tego, że do rozwoju wielu technik omawianych poniżej przyczynili się także i badacze spoza świata anglosaskiego. Spore osiągnięcia miała w tym zakresie np. nauka rozwijana w krajach byłego bloku komunistycznego, ze Związkiem Radzieckim na czele. Gwoli ilustracji, przypomnijmy w tym miejscu choćby o osobach Aleksieja Iwachnienki (1913-2007) związanego głównie z kijowskim Instytutem Cybernetyki przy Ukraińskiej Akademii Nauk, czy też Władimira Vapnika (1936-), który do lat 90. XX wieku był związany z moskiewskimi ośrodkami naukowo-badawczymi, a następnie przeniósł się do USA. O tym, że nie są to postacie marginalne, może choćby świadczyć to, że W. Vapnik ma na swoim koncie kilkanaście tysięcy cytowań rocznie (sic!), jego książka The Nature of Statistical Learning Theory była zaś cytowana od wydania w 1995 r. niemal 85 tysięcy razy[7].
Ze względów oczywistych dla piszącego te słowa dodatkowo przeanalizowano także literaturę wydaną w języku polskim. Nawet jeśli nie stanowi ona części obiegu międzynarodowego, to i tak wiele publikowanych w kraju prac ma istotny walor poznawczy, a niektóre mają oryginalny charakter. Takie stanowisko jest odzwierciedlone przede wszystkim w rozdziale 3, gdzie obok dokonań nauki anglosaskiej jest także mowa właśnie i o pracach polskojęzycznych.
Jak wspomniano, poza tekstami naukowymi - głównie w celu zilustrowania omawianych zagadnień - odwołano się także do źródeł popularnonaukowych oraz publicystycznych. Jakkolwiek praktyka uwzględniania takich źródeł jest dość powszechna, to wypada wyraźnie ten wątek zaakcentować wobec rezerwy niektórych badaczy przed taką właśnie strategią przygotowywania źródeł. Nie wydaje się jednak zasadne, żeby nadmierna ostrożność musiała paraliżować szerokie poszukiwania istotnych informacji, także w źródłach nienaukowych. Oczywiście podstawowym zastrzeżeniem jest, aby były to źródła o charakterze wspomagającym, uzupełniającym, ilustrującym omawiane zjawiska - a tak jest w wypadku niniejszego tekstu. Naturalną koleją rzeczy duża część bibliografii obejmuje materiały dostępne w Internecie[8].
Ze względu na tematykę publikacji pewna część źródeł pochodzi także z serwisu arXiv (https://arxiv.org/). Jest to repozytorium artykułów naukowych, które jest utrzymywane na Cornell University i gromadzi ponad 1,5 miliona tekstów z nauk ścisłych oraz biologii i ekonomii. Poza faktem korzystania z zasobów w wolnym dostępie, arXiv oferuje jeszcze co najmniej jedną interesującą funkcjonalność: możliwość umieszczania kolejnych wersji tekstu. Pozwala to autorom modyfikować swoje artykuły, co wszakże z zasady jest niemożliwe w tradycyjnych kanałach komunikacji naukowej. Warto jednak pamiętać, że zasoby repozytorium tworzą prace, które nie są poddawane formalnym recenzjom, a jedynie przechodzą bardzo wstępną, elementarną weryfikację np. pod kątem uniknięcia plagiatów czy też publikowania treści nienaukowych.
Oddzielną kategorię wykorzystanych źródeł stanowią rozmowy autora z innymi badaczami, często zajmującymi się dość odległymi zagadnieniami od tych poruszanych na kartach książki. Dyskusja naukowa była prowadzona głównie przy okazji kongresów i konferencji, zarówno krajowych, jak i międzynarodowych. Zyskana przy tej okazji wiedza pozwoliła na wprowadzenie licznych zmian do oryginalnej koncepcji wywodu. Naturalnie, zgodnie z przyjętym zwyczajem, wszelkie uchybienia pozostają po stronie autora publikacji. W tym miejscu należą się także stosowne słowa podziękowania dla Recenzentów wydawniczych za wnikliwą i krytyczną lekturę tekstu.
Chcąc dokonać możliwie łagodnego wprowadzenia do tematyki, która dla części Czytelników może wydawać się nieco hermetyczna, warto odwołać się do pojęcia, które będzie wielokrotnie wykorzystywane: algorytm. Otóż dla wielu osób prawdopodobnie pierwsze skojarzenia wiążą się z informatyką lub też innymi naukami ścisłymi. Tymczasem należy sięgnąć do słownikowej definicji tego terminu, co sprowadza się do następującej formuły: algorytm to "ściśle określony ciąg czynności, których wykonanie prowadzi do rozwiązania jakiegoś zadania, zwykle zapisywany formalnie, np. w postaci programów komputerowych"[9]. W istocie druga część definicji jest wyraźnym nawiązaniem do współczesnej dominacji wielu rozwiązań technicznych - o niektórych z nich będzie zresztą mowa dalej. Jednak zasadniczo podejście algorytmiczne - w szerokim rozumieniu tego wyrażenia - oznacza postępowanie zgodnie z określonymi procedurami, kwestią wtórną jest zaś w tym wypadku sposób konstrukcji tychże procedur[10]. Jak zatem widać, algorytmy nie tylko mają swoje matematyczne oblicze, lecz także są powszechnie dostępne w licznych codziennych zastosowaniach od dłuższego już czasu[11].
Jak wydaje się, istnieją trzy stopnie poznania: pierwszy stopień - przyjemne uczucie, że się zrozumiało argumenty zawarte w książce, drugi stopień - kiedy możesz powtórzyć i wykorzystać te argumenty i w końcu trzeci stopień - kiedy możesz je obalić.
J.Z. Cypkin[12]
Sztuczne sieci neuronowe (SSN)[13] są bardzo uogólnionym modelem obliczeniowym wzorowanym na zachowaniu komórek nerwowych, a więc czerpią z analogii do budowy mózgu. Ta analogia nie jest jednak celem samym w sobie (poza zupełnie niezależnymi próbami budowy "sztucznego mózgu", co nie jest przedmiotem niniejszego tekstu), a przeradza się w budowę obliczeniowych modeli matematycznych opartych na idei tak zwanego uczenia maszynowego (ang. machine learning, ML).
1.1. Zalety sztucznych sieci neuronowych
Względna atrakcyjność SSN jest związana z licznymi ich właściwościami, które zostają omówione w dalszej części tekstu. Tutaj wspomnijmy tylko o tym, że mówimy o pokłosiu wieloletnich doświadczeń związanych ze stosowaniem sieci neuronowych jako przykładowego sposobu analizy danych uzyskanych z materiału empirycznego. Jest to technika badawcza, która pojawiła się na horyzoncie nauki w latach II wojny światowej, lecz szczególnie dynamicznie rozwija się od około 20-30 lat, stając się obecnie jednym z ciekawszych wyzwań metodologicznych w ramach wielu dyscyplin naukowych.
1.1.1. Liczba parametrów modelu
Przegląd zalet modeli sztucznych sieci neuronowych rozpocznijmy od cechy stosunkowo mało imponującej, czy wręcz kontrowersyjnej, gdyż mogącej wyglądać raczej jak wada niż zaleta. Otóż SSN charakteryzują się zazwyczaj znaczną liczbą parametrów[14]. Jest to potencjalnie niekorzystna sytuacja, gdyż większa liczba parametrów stawia większe wymagania analityczne zarówno w zakresie obliczeń, jak i interpretacji wyników. Tak jest jednak tylko w tradycyjnych metodach badawczych, jak np. regresji liniowej, gdzie liczba parametrów, wzrastając w sposób wykładniczy, istotnie utrudnia analizę. Tymczasem w wypadku sieci nawet ze znaczną liczbą parametrów (porównywalną, czy wręcz przewyższającą liczbę przypadków) wciąż jest możliwe efektywne modelowanie takiego układu - a zatem mamy do czynienia z przezwyciężeniem jednego z ograniczeń klasycznej analizy danych (np. właśnie wspomniana regresja liniowa), gdzie co do zasady zakłada się, że liczba obserwacji powinna odpowiednio przewyższać liczbę estymowanych parametrów[15].
Zdaniem niektórych badaczy sztuczne sieci neuronowe mogą być traktowane jako uogólniony przypadek szerszej rodziny technik regresyjnych[16]. Wskazuje się zatem na podobieństwo SSN do niektórych założeń tradycyjnych podejść statystycznych, takich jak analiza dyskryminacyjna, analiza czynnikowa (zwłaszcza analiza głównych składowych, PCA), regresja czy też analiza skupień[17]. W konsekwencji twierdzi się, że sztuczne sieci neuronowe "należą do grupy całkiem standardowych modeli statycznych i nie wymagają zastosowania nowej "epistemologii" ani nowej teorii wnioskowania"[18].
Inne tradycyjne podejście - regresja logistyczna (logit) - które jest popularne zwłaszcza w ekonomii i ekonometrii, ale i w politologii w problemach klasyfikacyjnych, co do zasady zakłada, że istnieje możliwość określenia precyzyjnych założeń odnośnie do charakteru danych. W praktyce badań politologicznych jest to jednak sytuacja raczej wyjątkowa niż typowa. Nie zmienia to faktu, że modele regresyjne należą tutaj do kanonu. Czasami skłania to do nieco złośliwej konstatacji, że: "Nauki polityczne są jedyną dyscypliną naukową, gdzie regresja jest utożsamiana z postępem"[19].
Co szczególnie interesujące, SSN, które posiadają zazwyczaj sporą liczbę parametrów, i tak pozwalają na modelowanie złożonych zjawisk przy wykorzystaniu mniejszej liczby tychże parametrów, niż byłoby to w wypadku innych klasycznych technik, o ile miałyby one być stosowane do rozwiązywania analogicznych zadań[20].
W powyższym kontekście interesująca powinna być następująca konstatacja. Otóż sztuczne sieci neuronowe wiążą się często z analizą znacznej liczby parametrów i danych, ale jednocześnie nie musi to oznaczać konieczności uwzględnienia wielu zmiennych[21]. W niektórych zastosowaniach SSN oznacza to osiągnięcie lepszych modeli przy zastosowaniu ponad połowy mniejszej liczby zmiennych niż w modelach liniowych[22]. Jest tak wtedy, gdy ważniejsze od ich liczby są wzajemne relacje pomiędzy nimi zachodzące. Krótko rzecz ujmując: "W podejściach nieliniowych to raczej związki zachodzące pomiędzy zmiennymi, a nie ich duża liczba, wystarczają do wytworzenia złożonych rezultatów"[23]. Jeżeli są to faktycznie związki nieliniowe (o czym szerzej poniżej), to SSN są podejściem szczególnie predestynowanym do wykorzystania w analizie.
1.1.2. Biologiczne inspiracje
Jest to argument obecny w przedmiotowych rozważaniach na wielu płaszczyznach, o szczegółowych kwestiach mowa zaś także i poniżej. Jednocześnie należy go tutaj potraktować jako wartość samą w sobie. To znaczy, fakt oparcia się o biologiczny pierwowzór uprawdopodobnia możliwość dysponowania odpowiednio atrakcyjnym narzędziem. Jest to szczególnie uzasadnione, jeżeli uwzględnimy, że oryginał jest rozwiązaniem nadzwyczaj sprawnym. Choć będzie o tym mowa dalej (podrozdział 2.1), to już na wstępie zaznaczmy, że owa sprawność układu biologicznego w większości sytuacji wielokrotnie przewyższa możliwości analityczne rozwiązań algorytmicznych.
1.1.3. Elastyczność
Sztuczne sieci neuronowe - zwłaszcza w porównaniu z klasycznymi metodami regresyjnymi - są elastyczne w tym sensie, że w razie wystąpienia zbyt dużych błędów ich pracy i spadku możliwości analitycznych sieć poszukuje lepszej "reprezentacji procesu generującego dane, nawet jeżeli oznacza to zmianę całej struktury sieci"[24]. Ujmując rzecz najprościej - sieć neuronowa modyfikuje swoją strukturę zgodnie z posiadanymi danymi i zadanym problemem - zmiana tych elementów pociąga za sobą zmianę struktury sieci. Jak wiadomo, w wypadku podejść bardziej konwencjonalnych, w takiej sytuacji jesteśmy zmuszeni odrzucić nieefektywny model i przystąpić do konstruowania nowego. Wskazywana tutaj cecha oznacza w szczególności możliwość zastosowania SSN do analizy masowych danych napływających w czasie rzeczywistym.
1.1.4. Sieciowa struktura. Stabilność i efektywność analizy dużych zbiorów danych
Ponadto szczególna budowa (powszechnie używa się określeń "architektura" oraz "topologia" - tak też w dalszej części tekstu) SSN decyduje o jej stabilnym zachowaniu, co ma zasadnicze znaczenie użytkowe, gdyż ułatwia prowadzenie obliczeń. Jak większość rozwiązań opartych o strukturę sieciową, tak i w interesującym nas wypadku mamy do czynienia z układem odznaczającym się stosunkowo daleko idącą odpornością na uszkodzenia pojedynczych elementów - przyjmuje się, że pozbawienie układu sieciowego nawet około 1/10 jego elementów wciąż może oznaczać jego poprawne funkcjonowanie[25].
Dodatkowo struktura sieciowa oznacza rozproszenie informacji oraz towarzyszących jej błędów, co sprowadza się do wydajnego sposobu pracy układu. Stąd sztuczne sieci neuronowe mają zdolność do efektywnej analizy dużych zbiorów danych (big data). Owa efektywność analizy w szczególności oznacza:
1) zdolność do równoległego (współbieżnego) przetwarzania informacji. Cecha ta zasadniczo odróżnia sieci neuronowe od tradycyjnego podejścia do analizy danych, gdzie proces przebiega w określonej sekwencji obliczeń, "krok po kroku", iteracyjnie - jak to ma miejsce np. w wypadku klasycznych komputerów opartych na podejściu zapoczątkowanym jeszcze w połowie XX wieku przez Johna (Jánosa) von Neumanna, gdzie stosuje się sekwencję zaprogramowanych instrukcji. W takim wypadku błąd jednego elementu powoduje awarię całego systemu. W wypadku struktur sieciowych, czyli zazwyczaj odpowiednio rozbudowanych ("gęstych", "głębokich"), mamy do czynienia ze znoszeniem się błędów części składowych, wynik zaś jest rezultatem pracy całego układu[26]. Ujmując rzecz nieco inaczej - sieć nie przetwarza jednego sygnału w danej jednostce czasu, ale równolegle cały zbiór sygnałów. Ze względów tutaj wskazywanych struktura sieciowa (zdecentralizowana) jest także wykorzystywana w niektórych nowszych technologiach przetwarzania informacji, takich jak np. technologia rozproszonego rejestru (blockchain) - zwłaszcza wtedy gdy mamy do czynienia z danymi o charakterze wrażliwym[27];
2) zdolność do generalizacji (uogólniania), czyli uczenia się na zaprezentowanych przykładach i stosowania tak uzyskanej wiedzy do rozwiązywania nowych problemów (jest to więc zdolność do adaptacji do nowych danych). Inaczej rzecz ujmując, sztuczne sieci neuronowe "uczą się na własnych błędach", czyli są przykładem systemu, który polepsza swoje działanie wraz z upływem czasu. Ze względów wskazanych w dalszej części tekstu to właśnie zdolność do generalizacji, a nie tradycyjnie wykorzystywane w modelowaniu statystycznym miary dobroci dopasowania, powinna być wyznacznikiem jakości modelu[28]. Od razu należy wyraźnie zaznaczyć, że możliwość uogólniania wiedzy przez rozwiązania algorytmiczne jest kwestią dyskusyjną i wciąż są podejmowane próby jej efektywnego zapewnienia - np. poprzez odniesienie się do biologicznego mechanizmu neuromodulacji, czyli elastycznego dostrajania działania neuronu do nowych sygnałów[29];
3) użyteczność przy analizie danych, które są niekompletne i/lub nieustrukturyzowane. Jest to istotne zwłaszcza w realiach współczesnego świata, gdzie mamy do czynienia z natłokiem danych, które jednak nie zawsze są uporządkowane w sposób ułatwiający ich analizę. Tym samym sztuczne sieci neuronowe posiadają zdolność analizy danych nie tylko wyrażonych w skali interwałowej, lecz także i porządkowej czy też nominalnej. Dodatkowo, powszechnie jako dane wejściowe stosuje się nie tylko wielkości liczbowe, czy też szerzej - symbole alfanumeryczne, ale i obrazy. Problemu jakości (i ilości) danych dotyczy także zdolność radzenia sobie sieci z wpływem danych odstających, nietypowych (outliers, anomalies) na wyniki analizy;
4) uniwersalność. Dzięki swojej charakterystyce sztuczne sieci neuronowe mogą być względnie łatwo stosowane do analizy podobnych zadań. Dotyczy to także możliwości wykorzystania modelu do replikacji badań. Ta kwestia jest szerzej omówiona w dalszej części tekstu (podrozdziały 6.2 oraz 6.3).
Powyżej wskazane argumenty na rzecz SSN powinny być oceniane jako istotne. Tym bardziej warto nieco więcej miejsca poświęcić prawdopodobnie najważniejszej zalecie sztucznych sieci neuronowych - zdolności do odwzorowywania złożonych związków funkcyjnych.
1.1.5. Brak konieczności spełnienia warunku liniowości i normalnego rozkładu danych
Ze względu na wagę tego argumentu poświęcimy mu nieco więcej miejsca. I tak, sztuczne sieci neuronowe są pomocne w analizie zjawisk nie do końca zdefiniowanych precyzyjnie w sposób formalny, czyli jest możliwe zastosowanie interesującej nas techniki bez dogłębnego wnikania w charakter (związek funkcyjny) założeń teoretycznych badanego problemu. Dalszą konsekwencją takiego stanu rzeczy jest możliwość manipulowania w sieciach neuronowych związkami przyczynowo-skutkowymi - można zatem uczynić skutek przyczyną, czyli można dokonać badania pod kątem oczekiwanych parametrów, efektów, skutków (sieć neuronowa jako tzw. model odwrotny). W szczególności oznacza to także brak konieczności spełnienia a priori warunku liniowości oraz normalnego rozkładu zmiennych[30]. Brak tych cech oraz współzależności zachodzące między zmiennymi są natomiast dość powszechne w danych wykorzystywanych w politologii[31].
Argument dotyczący jakości zmiennych jest szczególnie dobrze widoczny w zastosowaniach wspomnianej już regresji wielokrotnej. Otóż oprócz tego, że dane muszą spełniać warunek normalnego rozkładu i liniowego związku zmiennych zależnych i niezależnych, należy także zbadać zmienne pod kątem możliwych odstępstw od równomiernego rozkładu wariancji reszt modelu (heteroskedastyczność). Formalnie rzecz ujmując, stajemy przed problemem wielowymiarowości danych. Dodatkowo w modelowaniu liniowym raczej pomija się możliwość, że to nie tyle same zmienne niezależne wpływają na zmienną zależną, ile wzajemne relacje pomiędzy zmiennymi mogą determinować logikę wyjaśnianego zjawiska.
Od strony technicznej modelowanie nieliniowe oznacza z kolei odejście od powszechnie znanych metod analizy regresyjnej, jak choćby metoda najmniejszych kwadratów (ordinary least squares, OLS). Jakkolwiek posiada ona ugruntowaną pozycję w statystyce, odznacza się ona także co najmniej jedną "kłopotliwą" właściwością - jest wrażliwa na wartości odstające w zbiorze danych. Sposób radzenia sobie z tym faktem jest także dobrze znany: pomija się takie dane ze zbioru. Mówiąc zatem wprost - dane dobiera się do narzędzia, a nie narzędzie do danych. Czytelnika, który uważa taki stan rzeczy za pożądany, szczególnie zachęca się do dalszej lektury.
Sieci neuronowe pozwalają zatem na budowę nieliniowych modeli zachowań złożonych systemów, zwykle lepiej odwzorowujących rzeczywistość od prostszych modeli liniowych. Owa prostota jest głównie związana z tym, że założenia modeli liniowych są dobrze rozpoznane i istnieją wypracowane strategie optymalizacji. W najogólniejszym ujęciu związek liniowy polega na tym, że zmienna niezależna ma stały wpływ (w sensie jego kierunku i wielkości) na zmienną zależną. Ów wpływ jest niejako "uśredniany" pomiędzy zmiennymi w skali całego badanego procesu. Jest to szczególnie dobrze widoczne w wypadku operowania zmiennymi wyrażonymi w skali porządkowej: w związkach liniowych zakłada się, że przejście od jednej kategorii do kolejnej jest zawsze równe, jest jednakowy dystans pomiędzy tymi kategoriami. Kwestią otwartą pozostaje, na ile jest to zgodne z empirycznym ekwiwalentem[32]. Pozostawiając na boku dane wyrażone w skali porządkowej, dość prostym, ale i jednocześnie dobrym przykładem z życia codziennego jest związek pomiędzy wzrostem temperatury (zmienna niezależna) a podnoszeniem się słupka rtęci w termometrze (zmienna zależna): dokonuje się to zawsze w tym samym tempie, to znaczy wzrost temperatury o daną wielkość powoduje zawsze wzrost słupka rtęci, niezależnie czy są to wartości dodatnie, czy też ujemne[33]. W interesujących nas zagadnieniach politologicznych liniowość oznacza możliwość opracowania modelu, który przy wykorzystaniu skończonej (choć znacznej) liczby parametrów jest w stanie wyjaśnić dane zjawisko; jest to postulat co do możliwości wyznaczenia "deterministycznego algorytmu"[34].
Z kolei procesy nieliniowe charakteryzują się podatnością na duży wpływ małych zmian warunków początkowych ("efekt motyla"), nierównowagą przebiegu, złożonymi wzorami zachowań, nagłymi zmianami wyników oraz - co oczywiste - skomplikowanym powiązaniem zmiennych i ich różnym wpływem na wynik końcowy[35]. Przekładając powyższe na język bardziej formalny: sztuczne sieci neuronowe dzięki znacznej liczbie parametrów są w stanie odwzorować jakikolwiek związek funkcyjny, w tym zwłaszcza o charakterze nieliniowym[36]. Dodatkowo SSN sprawdzają się w sytuacjach, gdy charakter tego związku pomiędzy zmiennymi w ogóle nie jest znany. A zatem wykorzystanie SSN nie determinuje konieczności rozstrzygnięcia dylematu liniowość-nieliniowość, a tym bardziej - nie na korzyść tej pierwszej cechy.
Inną cenną właściwością sztucznych sieci neuronowych jest możliwość modelowania zjawisk zoperacjonalizowanych przy użyciu zmiennych, które niekoniecznie pochodzą z niezależnych obserwacji. Ponownie w problemach z nauk politycznych - czy też ogólnie z nauk społecznych - jest to zagadnienie o istotnym ciężarze gatunkowym. Odwołując się do konkretnego przykładu: racjonalne założenie odnośnie do badania konfliktów zbrojnych opiera się na przyjęciu tezy mówiącej o tym, że fakt zaistnienia wojny w przeszłości może w jakimś stopniu wpływać na prawdopodobieństwo jej wybuchu w przyszłości; nie są to zatem obserwacje niezależne od siebie[37].
Założenie nieliniowości jest w istocie dość powszechnie obecne w politologii, gdzie gruntowna analiza musi uwzględniać zarówno wewnętrzną dynamikę badanego systemu, jak i siły działające na niego z zewnątrz[38]; rzadko kiedy są to mechanizmy znane, proste, przewidywalne i w konsekwencji często zakłada się, że nie są łatwe do formalnego modelowania. Wypada zgodzić się tylko z pierwszą częścią tego stwierdzenia: istotnie, szereg zjawisk społecznych (a zatem także i politycznych) charakteryzuje się nieliniową dynamiką typową dla systemów złożonych[39]. Jednocześnie okazuje się, że wcale nie musi to automatycznie oznaczać spiętrzenia trudności analitycznych. Otóż istnieje stosunkowo długa (sięgająca co najmniej lat 70. XX wieku) linia argumentacji podkreślająca możliwość wyjaśnienia złożonych zjawisk społecznych poprzez stosunkowo niewielką liczbę zmiennych - o ile tylko owe zmienne będą powiązane ze sobą nieliniowo[40]. Ujmując rzecz precyzyjnie, jeżeli związki nieliniowe są trudne w analizie, wynika to nie tyle ze złożoności samych stosowanych modeli, ile ze złożonego charakteru otrzymanych informacji i związanych z tym trudności interpretacyjnych[41].
Wspomniane powyżej "systemy złożone" są samodzielną przestrzenią dociekań naukowych[42]. Co do zasady wyróżnia się trzy główne rodzaje systemów: proste (simple), skomplikowane (complicated) i właśnie złożone (complex)[43]. Pierwsze z nich znacznie uprawdopodobniają osiągnięcie sukcesu w razie kierowania się określonymi wskazówkami/regułami (jak np. przy przygotowywaniu potraw). W wypadku układów skomplikowanych wymagana jest już wiedza fachowa, szczegółowa, ale wciąż postępowanie wynika z przestrzegania wypracowanych procedur (przykład: wysłanie statku kosmicznego na Księżyc). Z kolei systemy złożone charakteryzują się daleko idącą nieprzewidywalnością, niepowtarzalnością zaistniałych warunków czy też zdolnością do adaptacji (przykład: proces wychowywania dzieci)[44].
Systemy złożone to także takie układy, których analiza wiąże się m.in. z następującymi zastrzeżeniami:
1) jest możliwość zaobserwowania względnie rzadkich, ale za to znacznych zmian w interesującym nas procesie - stąd badanie przy wykorzystaniu statystyki opisowej czy też analizy korelacyjnej i formułowanie na tej podstawie wniosków o związkach przyczynowo-skutkowych bywa bardzo zawodne;
2) wykorzystanie podstawowych metod ilościowych jest ograniczone, gdyż są one związane z koniecznością spełnienia warunku liniowości i bardzo często normalnego rozkładu zmiennych[45].
Przedmiotowe badania systemów złożonych są realizowane m.in. w ramach teorii chaosu, mechaniki kwantowej, logiki rozmytej, sztucznej inteligencji czy też modelowania komputerowego[46]. Niektóre z tych obszarów są także punktem odniesienia do dalszych rozważań w niniejszej pracy - dotyczy to w szczególności trzech ostatnich pól badawczych.
W naukach politycznych (zresztą nie tylko w politycznych, ale wszędzie tam, gdzie badacze jedynie wykorzystują modele matematyczne, jednak bez ich lepszego zrozumienia) można napotkać na zastosowanie z jednej strony bardzo upraszczających modeli liniowych, z drugiej zaś - ich odpowiedników zbyt złożonych, niepotrzebnie zaciemniających rozwiązanie. W naukach społecznych, a w politologii w szczególności, związki przyczynowo-skutkowe charakteryzują się zwykle wysokim współczynnikiem nieliniowości, zmienne zaś często są ze sobą powiązane, ale nie jest znany powód takiego stanu rzeczy. Warto także w tym miejscu powtórzyć jedną z klasycznych przestróg metodologicznych: związek zachodzący między zmiennymi nie zawsze musi oznaczać relację przyczynowo-skutkową[47].
Dodatkowo, wiele spośród relacji społecznych odznacza się zdolnością do zmiany, adaptacji[48], trajektoria tych procesów jest zaś stosunkowo trudna do ujęcia w precyzyjne ramy teoretyczne. Przykładem ilustrującym taką sytuację może być choćby konkretna realizowana polityka (np. w sektorze energetycznym czy też ochronie zdrowia) - wyniki jej realizacji są do pewnego (znacznego) stopnia nieprzewidywalne, gdyż w istocie zależą od licznych pozytywnych i negatywnych "oddziaływań zwrotnych (feedback loops)"[49].
W świetle powyższych rozważań dość oczywiste wydaje się stwierdzenie mówiące o sferze polityki jako przykładzie układu złożonego. Badania prowadzone w tym zakresie wskazują na co najmniej dwa czynniki uzasadniające taką tezę. Są nimi: (1) wzajemne powiązanie ze sobą zjawisk politycznych (interconnectedness) oraz (2) powiązane ze sobą procesy ograniczonego dostępu do informacji i uczenia się[50]. Oba te składniki mają swoje przełożenie na realia stosowania sztucznych sieci neuronowych, o czym jest szerzej mowa w dalszej części książki.
Jeszcze inna perspektywa spojrzenia na świat polityki z uwzględnieniem jej złożoności sprowadza się do zaproponowania kategorii "nieprecyzyjnie zdefiniowanych problemów (ill-defined problems)"[51]. Jest to próba zaakcentowania wyraźnie odmiennego charakteru zjawisk politycznych od np. zjawisk fizycznych. Te drugie bowiem są względnie dobrze rozpoznane pod kątem zachodzących relacji między zmiennymi, co z kolei skutkuje możliwością wskazania strategii optymalizacyjnych wobec badanego układu.
Podsumujmy zatem, jak powyższe uwagi - a zwłaszcza te dotyczące nieliniowości dość powszechnie charakteryzującej zjawiska społeczne - należy odnieść do sztucznych sieci neuronowych. W jakim sensie może to determinować ich użyteczność w analizie politologicznej? Tradycyjnie wykorzystywane techniki analizy - regresja liniowa i jej warianty nieliniowe - posiadają swoje istotne ograniczenia, o jednym z nich należy zaś tutaj wyraźnie wspomnieć. Otóż obie zakładają istnienie określonych zależności funkcyjnych w wyjaśnianym zjawisku. Są to - odpowiednio - związki liniowe i nieliniowe. Jest to założenie, które w wielu - zbyt wielu, aby to przemilczać - sytuacjach stawia pod znakiem zapytania wartość prowadzonych badań. Jak wskazano powyżej, jest to szczególnie widoczne w wypadku odwołania się do regresji liniowej. Tymczasem właściwości matematyczne SSN pozwalają na modelowanie wszelkich związków funkcyjnych przekształcających dane wejściowe na wyjściowe - związków zarówno liniowych, jak i nieliniowych, i to w ramach jednej procedury badawczej[52]. Dzieje się tak dlatego, że w wypadku sztucznych sieci neuronowych nie ma potrzeby zakładania określonych związków funkcyjnych przed przystąpieniem do analizy, co więcej - wcześniejsza wiedza co do istnienia takich relacji w ogóle nie jest wymagana. Jednym z celów badania zjawisk przy użyciu SSN jest właśnie wykrycie, czy takie związki funkcyjne zachodzą, a jeżeli tak - to jaki mają charakter (liniowy, nieliniowy, dodatni, ujemny itd.). Jako oczywistość trzeba przy tym potraktować uwagę, że w świetle powyższego badacz bynajmniej nie jest zwolniony z konieczności posiadania wiedzy fachowej, merytorycznej odnośnie do rozwiązywanego problemu. Uwidacznia się to choćby już na samym początku procedury, gdy należy postawić właściwe pytania badawcze/hipotezy; właściwe, czyli uzasadnione właśnie wiedzą ekspercką, sformułowane w oparciu o stan badań przedmiotu, odpowiednie założenia teoretyczne czy też poddane operacjonalizacji. Także i dobór właściwych zmiennych wymaga wykazania się stosowną wiedzą przedmiotową - owe zmienne nie mogą bowiem mieć ateoretycznego charakteru[53]. Także i końcowa faza badań - czyli ocena wartości modelu i interpretacja wyników - nie zwalnia nas z obowiązku posiadania stosownej wiedzy i umiejętności. Błędem jest zakładanie, że SSN "same" działają - jest tak, ale tylko w bardzo wąskim rozumieniu, czyli wtedy kiedy chodzi o dokonanie stosownych obliczeń.
Ujmując rzecz krótko, sztuczne sieci neuronowe mogą spełnić warunek elastycznego modelowania zjawisk społecznych, co - w nieco innym ujęciu - D. Richards nazwała modelowaniem "zupełnym", "całościowym" (full-spectrum modeling)[54]. Chodzi mianowicie o taką procedurę, która, po pierwsze, jest odpowiednio dobrana do danych, po drugie, jest odpowiednio efektywna i, po trzecie, nadmiernie nie ogranicza horyzontów analitycznych ani krępującymi warunkami wstępnymi, ani innymi kanonami analizy - w tym miejscu brak konieczności znajomości zależności funkcyjnych jest znamienny. SSN szeroko otwierają przed nami drzwi do poznania naukowego.
Jednocześnie należy mieć na względzie, że jakkolwiek niektóre szczegóły związane z sieciami neuronowymi mogą sugerować nieograniczone możliwości analityczne, w istocie nie mamy do czynienia z uniwersalnym narzędziem badawczym, które zawsze da się zastosować do każdego problemu badawczego. Przyjrzyjmy się zatem ograniczeniom SSN.