Die Mathematiker Timothy Gowers und Peter Sarnak äußern sich kritisch zu den Fähigkeiten großer Sprachmodelle (LLMs). Gowers hebt hervor, dass diese Modelle zwar über bemerkenswerte mathematische Fertigkeiten verfügen, jedoch an der Entwicklung wirklich neuer Ideen scheitern. Er erklärt, dass die aktuellen Modelle stark darin sind, bereits bekannte Methoden zu kombinieren und zahlreiche Suchpfade zu erkunden. Ihnen fehle jedoch die Intuition, um die wenigen fruchtbaren Wege in einem riesigen Suchraum zu erkennen. Um die Grundlagen dieser Technologien besser zu verstehen, ist es hilfreich, die wesentlichen Konzepte für die Entwicklung von LLM-Systemen zu betrachten.
Sarnak teilt diese Einschätzung und ergänzt, dass eine KI zwar aus bestehender Theorie Resultate ableiten kann, jedoch nicht in der Lage ist, aus grundlegenden Fragen selbstständig die Abstraktionen und Theorien zu entwickeln, die für bedeutende Beweise notwendig sind. Diese Thematik wird auch in der Diskussion um die Fähigkeiten von KI-Modellen deutlich, wie in dem Artikel Neues Framework zeigt: KI-Modelle benötigen menschliche Unterstützung beim Roboter-Coding behandelt.
Ähnliche Schlussfolgerungen zieht der DeepMind-Forscher Tom Zahavy in seinem Positionspapier „LLMs can’t jump“. Er identifiziert den Engpass als „manipulative Abduktion“, also das Erfinden neuer Grundannahmen ohne sprachliche Vorlagen. Zahavy schlägt vor, dass Weltmodelle möglicherweise einen Ausweg bieten könnten. Diese Aussagen fügen sich in eine umfassendere Debatte ein, ob LLMs tatsächlich vielseitiger werden oder sich eher auf spezifische Benchmarks und bekannte Lösungsräume konzentrieren. Ein Beispiel für die Entwicklung solcher Modelle ist die Forschung, die in Vom Face-Plant zu Parkour: Virtuelle Agenten lernen Akrobatik, wenn Forscher immer mehr Netzwerkschichten stapeln beschrieben wird.
„`
Quellen: the-decoder, Die Zeit
Bildquelle: KI generiert
Dieser Text wurde mit Hilfe von künstlicher Intelligenz in Zusammenarbeit mit unserer Redaktion erstellt.
🚀