3 private links
Viele Studien zu Effekten
Wie eng Fortschritt und Sicherheit bei KI miteinander verknüpft sind, zeigt für Amodei auch die Entstehungsgeschichte von GPT-2 und GPT-3 bei OpenAI. Diese Modelle seien ursprünglich als Nebenprodukt der Sicherheitsforschung entstanden. Amodei und seine späteren Mitgründer hatten die Methode des Reinforcement Learning from Human Feedback (RLHF) entwickelt, um KI-Modelle besser zu steuern. Da diese Technik bei den damaligen kleinen GPT-1-Modellen nicht funktionierte, sei die Skalierung zu GPT-2 und GPT-3 notwendig gewesen, um RLHF an komplexeren Modellen zu erproben und weiterzuentwickeln.
Welcome to the Era of Experience
David Silver, Richard S. Sutton
Das wirds
https://the-decoder.de/google-deepmind-bereitet-den-naechsten-moeglichen-ki-durchbruch-vor/
Alpha zero mit LLM Kombination