14 Sep.

Outcome-based Reward Model


E-Rechnung in Deutschland: So setzen Sie die Pflicht mit SAP Business One um

Outcome-based Reward Model (ORM) ist ein Verfahren, das ein KI-Modell allein anhand der finalen Antwort bewertet, ohne den Weg dorthin zu prüfen. Stimmt das Ergebnis, gibt es Belohnung. Der Rechenweg, die Argumentation oder die Zwischenschritte spielen keine Rolle.

Diese Herangehensweise hat einen praktischen Vorteil: Sie ist einfach zu trainieren, weil nur das Endergebnis annotiert werden muss und nicht jeder einzelne Zwischenschritt. Für viele Aufgaben reicht das aus, etwa bei einfacher Klassifikation, Textzusammenfassung oder Frage-Antwort-Aufgaben mit klar prüfbarem Resultat. Der Nachteil zeigt sich bei komplexeren, mehrstufigen Aufgaben. Ein Modell kann durch einen fehlerhaften oder sogar erratenen Lösungsweg trotzdem zum richtigen Ergebnis gelangen. Ein Outcome-based Reward Model erkennt diesen Unterschied nicht und belohnt den Zufallstreffer genauso wie eine saubere Herleitung. Über viele Trainingsdurchläufe hinweg kann das dazu führen, dass ein Modell lernt, sich auf plausibel klingende, aber inhaltlich brüchige Argumentationen zu verlassen, solange am Ende die Zahl stimmt.

Abgrenzung

Der Gegenpart ist das Process Reward Model, das jeden Zwischenschritt einzeln bewertet und dadurch auch fehlerhafte Herleitungen mit zufällig richtigem Ergebnis erkennt. Ein Outcome-based Reward Model ist günstiger im Training, ein Process Reward Model liefert das feinere Signal. Beide sind Varianten der Belohnungsfunktion innerhalb eines Reinforcement-Learning-Trainings, nicht das Reinforcement Learning selbst.


 

Service Layer KI als transaktionalen Schicht

SAP B1 10.0 FP2608: Service Layer KI als transaktionalen Schicht

Der Service Layer von SAP Business One diente bisher überwiegend als passiver Datenlieferant: Anwendungen fragten Daten über OData ab, jede ...
Process Reward Model

Process Reward Models: Warum ein richtiges Ergebnis noch keinen richtigen Weg beweist

Diese Reihe nimmt fortlaufend einzelne KI-Grundbegriffe und Methoden wie die Process Reward Model unter die Lupe .Die vorige Folge hat ...
Test-Time-Compute-Scaling

Test-Time Compute Scaling: Warum ein kleineres KI-Modell am Ende gewinnen kann — und was der Lieferantenvergleich in SAP Business One damit zu tun hat

Dies ist eine Fortsetzung der Reihe auf diesem Blog, die sich mit Künstlicher Intelligenz im Zusammenspiel mit SAP Business One ...
RLHF

RLHF und Reward-Modelle: KI-Hype oder was der Genehmigungsprozess in SAP Business One damit zu tun hat

Key Takeaways Der Beitrag behandelt die Anwendung von Künstlicher Intelligenz im Zusammenhang mit SAP Business One und grundlegenden KI-Themen. Dank ...
AI WEBINAR

KI – Antworten aus SAP Business One – ohne SQL, ohne IT-Ticket

Live-Webinar am 30. Juli 2026, 14:00–14:30 Uhr | Live-Demo über Microsoft Teams | Dauer: 30 Minuten „Wie war der Umsatz ...
Generative KI im ERP

KI im ERP – aber unter Kontrolle: Was Versino AI für SAP-Business-One-Anwender bedeutet

KI kann heute vieles – aber ohne Kontrolle schafft sie oft mehr Probleme als sie löst. Versino AI verbindet KI-Modelle ...
Wird geladen …