KI-Sprachmodelle generieren bis zu 22 Prozent falsche Antworten. Doch es gibt Methoden und Technologie, die diesen Wert deutlich verbessern.

Der Begriff „Retrieval-Augmented Generation“, kurz RAG, wurde erstmals 2020 in einer Studie erwähnt, in der es um „ein universelles Feintuning-Konzept“ ging, bei dem Large Language Modelle (LLM) mit zusätzlichen externen Daten gefüttert werden, um bessere Antworten zu generieren. Damit adressierte die Studie ein gravierendes Problem: Standard-LLMs können nur allgemeine Fragen richtig beantworten. Experten schätzen, dass die weltweit beliebtesten LLMs bis zu 22 Prozent falsche Ergebnisse liefern, sogenannte Halluzinationen. Das passiert vor allem bei spezifischen Fragen, wie firmenindividuelle Prozesse, Produkte und Kunden.

Intel
KI-Antworten basieren auf der Auswertung von vielen allgemein zugänglichen Informationen – somit versagen sie bei firmenindividuellen Anfragen.

RAG ergänzt jetzt die LLM-Datengrundlage mit weiteren Ressourcen, insbesondere mit aktuellen technischen oder geschäftsrelevanten Details. Hierzu werden Handbücher, Videos oder Protokolle in Wissensdatenbanken umgewandelt, um sie anschließend mit einem LLM zu verknüpfen. Das generiert bessere Antworten beim Kunden- oder Außendienstsupport, der Mitarbeiterschulungen oder verbessert die Entwicklerproduktivität. Ein weiteres Plus von RAG ist, dass es zitierbare Quellen liefert, ähnlich wie die Fußnoten in einer Forschungsarbeit. So lassen sich alle Aussagen überprüfen, was das Vertrauen in die KI deutlich verbessert. Analysten sehen die Zukunft von GenKI nur noch im RAG-Umfeld. Forrester meint, dass RAG inzwischen der gängigste Ansatz für die Entwicklung von LLM-basierten Enterprise Knowledge-Anwendungen ist. Bei Gartner sieht man noch einen weiteren Vorteil: „Kleine, aufgabenspezifische Modelle liefern mithilfe von RAG schnellere Antworten und benötigen weniger Rechenleistung. Das senkt die Betriebs- und Wartungskosten“, sagt Gartner-Analyst Sumit Agarwal.

RAG: Nur so gut, wie die zugrundeliegende Technik

Das Ergänzen eines LLMs um RAG ist jedoch nicht ohne Probleme. Beispielsweise ist darauf zu achten, dass die bereitgestellten Daten weiterhin den regulatorischen Vorgaben entsprechen. Auch technologisch sind Maßnahmen zu ergreifen, die eine RAG-Nutzung von der User-Experience und von der wirtschaftlichen Seite her sinnvoll machen, denn eine RAG-Pipeline besteht aus mehreren meist sehr rechenintensiven Komponenten, die die Antwortzeiten deutlich beeinträchtigen können. Daher ist die Wahl der Rechenplattform eine der wichtigsten Entscheidungen für eine zufriedenstellende RAG-Nutzung. Beispielsweise ermöglichen die Intel® Xeon® Prozessoren die Steuerung und Verwaltung einer RAG-Pipeline auf einer einzigen Plattform. Sie verfügen über integrierte KI-Engines, um wichtige Vorgänge in der gesamten Pipeline – einschließlich Datenaufnahme, -abruf und KI-Inferenz – auf der CPU ohne zusätzliche Hardware zu beschleunigen. Für RAG-Anwendungen, die auf höchsten Durchsatz oder niedrigste Latenz angewiesen sind, bietet Intel auch die Gaudi® KI-Beschleuniger an. Diese wurden speziell für schnelle Inferenzen entwickelt. Viele Unternehmen benötigen für ihre RAG-Anwendungen sensitive Daten, die entsprechend geschützt sein müssen. Die Intel Xeon Prozessoren bieten hierzu die integrierten Sicherheitstechnologien Guard Extensions (Intel SGX) und Trust Domain Extensions (Intel TDX) an. Damit wird über die gesamte RAG-Pipeline hinweg ein vertrauliches Computing mit entsprechender Datenverschlüsselung erzielt. Schlussendich geht es aber nicht nur um den sicheren und effizienten Betrieb von RAG, sondern auch um eine schnelle und günstige Entwicklung. Hier können integrierte Frameworks wie LangChain, fastRAG und LlamaIndex von Intel Lab die Entwicklung beschleunigen.

RAG-Partner und -Anwender

Viele Intel-Partner haben die Intel-Technologie mit speziellen Komponenten ergänzt, um die Möglichkeiten von RAG auszuweiten und zu verbessern. Eine besonders leistungsstarke RAG-Lösung hat das auf KI-Tools spezialisierte Unternehmen Aible entwickelt. Hierbei handelt es sich um eine serverlose RAG-Lösung, die keine teuren GPUs nutzt, sondern auf verschiedenen Generationen der skalierbaren Intel Xeon Prozessoren basiert. Das erweist sich besonders vorteilhaft bei rechenintensiven KI-Anwendungen, wie:

  • Natural Language Processing (NLP)
  • Empfehlungen
  • Entscheidungsunterstützung
  • Content-Erstellung

Laut Aible ergeben sich bei solchen Lösungen Kosteneinsparungen um bis zum Faktor 55.

Fazit

RAG ist eine Technik zur Verbesserung der Genauigkeit und Zuverlässigkeit von GenKI mithilfe von Informationen aus spezifischen und relevanten Datenquellen. Hierzu muss das LLM auf diese Daten schnell und einfach zugreifen können und die dafür erforderliche Verarbeitungs-Pipeline muss entsprechend leistungsstark sein. Gleichzeitig sind die erforderlichen Datenschutzauflagen zu beachten. Intel Xeon Prozessoren erfüllen alle Voraussetzungen und erweisen sich im Vergleich zu GPU-basierten Systemen vielfach als wesentlich kostengünstiger.

Teilen
Teilen