
Reinforcement Learning (verstärkendes Lernen) ist ein Teilgebiet des maschinellen Lernens, bei dem ein System durch Ausprobieren lernt, statt aus vorgegebenen Beispielen. Ein Agent handelt in einer Umgebung, bekommt für gute Entscheidungen eine Belohnung und für schlechte eine Strafe, und passt sein Verhalten schrittweise an, um die Gesamtbelohnung zu maximieren.
Die drei Grundbausteine sind der Agent, der handelt, die Umgebung, in der er sich bewegt, und die Belohnung, die als Feedback dient. Anders als beim überwachten Lernen gibt es keine feste Liste richtiger Antworten, aus der das Modell lernt. Stattdessen probiert der Agent Aktionen aus, beobachtet die Konsequenz und lernt über viele Wiederholungen, welche Strategie langfristig am meisten Belohnung bringt. Genau diese Trial-and-Error-Logik unterscheidet Reinforcement Learning grundlegend von unüberwachtem Lernen, das lediglich Muster in Daten sucht, ohne Belohnung oder Zielvorgabe.
Reinforcement Learning ist auch die Grundlage moderner KI-Agenten, die mehrstufige Aufgaben lösen. Damit ein solches Training überhaupt funktioniert, braucht es eine klare Belohnungsfunktion. Ob diese nur das Endergebnis bewertet (Outcome-based Reward Model) oder jeden Zwischenschritt einzeln prüft (Process Reward Model), entscheidet maßgeblich über die Qualität und Nachvollziehbarkeit des trainierten Verhaltens.
Bezug zu SAP Business One
Für den ERP-Alltag ist Reinforcement Learning derzeit vor allem als Grundlagentechnologie relevant, nicht als direkt sichtbares Feature. KI-Agenten, die in SAP-B1-Umgebungen Belege vorprüfen, Buchungen vorschlagen oder Rückfragen beantworten, bauen häufig auf Modellen auf, die mit Reinforcement-Learning-Verfahren trainiert oder verfeinert wurden. Für den Anwender bleibt das im Hintergrund. Sichtbar wird nur das Ergebnis: ein Assistent, der zuverlässiger auf mehrstufige Anfragen reagiert.
SAP B1 10.0 FP2608: Service Layer KI als transaktionalen Schicht
Process Reward Models: Warum ein richtiges Ergebnis noch keinen richtigen Weg beweist
Test-Time Compute Scaling: Warum ein kleineres KI-Modell am Ende gewinnen kann — und was der Lieferantenvergleich in SAP Business One damit zu tun hat
RLHF und Reward-Modelle: Was hinter dem KI-Hype steckt — und was der Genehmigungsprozess in SAP Business One damit zu tun hat
KI – Antworten aus SAP Business One – ohne SQL, ohne IT-Ticket