KI-Startup aus Miami behauptet 1000-fache Effizienzsteigerung
Die Art und Weise, wie KI-Modelle mit langen Texten umgehen, steht vor einem fundamentalen Problem. Die Rechenkosten steigen schneller als die Eingabelänge selbst. Ein Startup aus Miami behauptet nun, das Problem an seiner Wurzel gelöst zu haben.
Das quadratische Skalierungsproblem
Jedes moderne KI-System, das auf der Transformer-Architektur basiert, arbeitet mit einem Mechanismus namens Attention. Dabei vergleicht das Modell jeden Token mit jedem anderen Token der Eingabe. Verdoppelt sich die Eingabelänge, vervierfachen sich die Rechenkosten. Diese quadratische Beziehung hat die gesamte KI-Industrie geprägt.
Selbst bei aktuellen Modellen mit Kontextfenstern von bis zu einer Million Token wird die Verarbeitung langer Eingaben zunehmend kostspielig. Die Industriestandards bewegen sich bei 128.000 Token, manche Frontier-Modelle bieten jedoch bis zu einer Million. Jedes Mal, wenn ein Nutzer ein langes Dokument verarbeiten möchte, zahlt er diesen quadratischen Preis.
Die Lösung des Startups
Das Unternehmen aus Miami verspricht eine 1000-fache Effizienzsteigerung bei der Verarbeitung langer Kontexte. Der Ansatz basiert auf einer neuen Architektur, die das Attention-Problem umgeht, statt es durch Workarounds zu mildern. Retrieval-Augmented Generation und ähnliche Hilfskonstruktionen werden überflüssig, weil das Modell lange Dokumente direkt und effizient verarbeiten kann.
Wenn sich die Behauptungen bestätigen, hätte das weitreichende Konsequenzen. Die Kosten für KI-gestützte Dokumentenanalyse, Codeverarbeitung und Forschungsanwendungen würden drastisch sinken. Allerdings stehen solche Versprechen in der KI-Branche unter besonderer Beobachtung, weil viele Startups ähnliche Effizienzversprechen nicht halten konnten, wie auch TechCrunch berichtet. Auch unser Bericht zu DeepSeeks Effizienzansatz zeigt dieses Thema.