-labyrinth_qlearning.r: Lernt das Finden eines Weges durch ein vorgegebenes Labyrinth mit Hilfe von Q-Learning. Q wird gespeichert als Matrix, d.h. es findet keine Approximation von Q mittels neuronaler Netzwerke etc. statt. Waehrend des Lernvorgangs erfolgt eine Ausgabe der beim Aktualisieren von Q gemachten Fehler. Nach abgeschlossenem Lernvorgang (fest vorgegebene Anzahl an Iterationen des Q-Learnings) wird die Bewertungsfunktion V ausgegeben sowie ein vollstaendiger Lauf durch das Labyrinth mit den jeweiligen Werten von Q an dem geradigen Zustand.

-tictac_qlearning.r: Lernt eine Strategie beim Spiel TicTacToe mit Hilfe von Q-Learning. Q wird gespeichert als Matrix, d.h. es findet keine Approximation von Q mittels neuronaler Netzwerke etc. statt. Der Lernvorgang kann entweder gegen einen zufaellig agierenden Gegner oder gegen "sich selbst" durchgefuehrt werden (gesteuert mit der Variable gegen_sichselbst in der Datei). Waehrend des Lernvorgangs erfolgt eine Ausgabe der beim Aktualisieren von Q gemachten Fehler und ein Validierungsfehler, der durch Spielen gegen einen zufaelligen Gegner mit dem aktuell gelernten Q erhalten wird. Der Lernvorgang erfolgt mit einer hohen Anzahl an Iterationen (kann eingestellt werden), so dass ein manueller Abbruch per Stop-Taste in R notwendig ist. Mit Hilfe der Datei 'tictac_qlearning_mensch.r' kann dann gegen das gelernte Q gespielt werden.

-tictac_qlearning_mensch.r: Lernt kein Q, sondern erlaubt das Spielen gegen das zuvor mit 'tictac_qlearning.r' gelernte Q. Die Eingabe des Zugs erfolgt mit den Zahlen 1-9, welche den 9 Spielfeldern entsprechen (spaltenweise gezaehlt, vgl. erklaerende Header in der Datei).

-tictac_neuronal_qlearning.r: Lernt eine Strategie beim Spiel TicTacToe mit Hilfe von Deep-Q-Learning und eines frei waehlbaren voll verbundenem neuronalen Netzes. Q wird gespeichert durch das neuronale Netz (gewichtsmatrizen und biasvektoren). Der Lernvorgang kann entweder gegen einen zufaellig agierenden Gegner oder gegen "sich selbst" durchgefuehrt werden (gesteuert mit der Variable gegen_sichselbst in der Datei). Waehrend des Lernvorgangs erfolgt eine Ausgabe der beim Aktualisieren von Q gemachten Fehler und ein Validierungsfehler, der durch Spielen gegen einen zufaelligen Gegner mit dem aktuell gelernten Q erhalten wird. Der Lernvorgang erfolgt mit einer hohen Anzahl an Iterationen (kann eingestellt werden), so dass ein manueller Abbruch per Stop-Taste in R notwendig ist. Mit Hilfe der Datei 'tictac_neuronal_qlearning_mensch.r' kann dann gegen das gelernte Q gespielt werden.

-tictac_neuronal_qlearning_mensch.r: Lernt kein Q, sondern erlaubt das Spielen gegen das zuvor mit 'tictac_neuronal_qlearning.r' gelernte Q. Die Eingabe des Zugs erfolgt mit den Zahlen 1-9, welche den 9 Spielfeldern entsprechen (spaltenweise gezaehlt, vgl. erklaerende Header in der Datei).

-tictac_neuronal_ini.r: Keine eigenstaendige R-Datei, wird von tictac_neuronal_qlearning.r genutzt um das neuronale Netzwerk zu initialisieren und die Funktionen zur Aktualisierung und Vorhersage bereitzustellen.