Modelle & Technik

Embedding

Embeddings sind mathematische Darstellungen von Wörtern oder Sätzen als Zahlenvektoren. Sie helfen der KI, die Bedeutung und Ähnlichkeit von Texten zu verstehen. Wörter mit ähnlicher Bedeutung liegen im Vektorraum näher beieinander. Embeddings sind die Grundlage für semantische Suche und Empfehlungssysteme.

Was sind Embeddings?

Embeddings sind numerische Darstellungen von Texten, Bildern oder anderen Daten in Form von Zahlenvektoren. Sie uebersetzen menschlich verständliche Informationen in ein Format, das Computer effizient verarbeiten und vergleichen können. Statt Wörter als Buchstabenfolgen zu betrachten, ordnet ein Embedding-Modell jedem Wort, Satz oder Dokument einen Punkt in einem hochdimensionalen Raum zu -- wobei aehnliche Bedeutungen nah beieinander liegen.

Ein einfaches Beispiel: Die Wörter "Hund" und "Katze" würden im Embedding-Raum nah beieinander platziert, weil sie semantisch verwandt sind (beides Haustiere). "Hund" und "Algebra" wären dagegen weit voneinander entfernt. Dieses Prinzip ermöglicht es Computern, die Bedeutung von Sprache zu erfassen -- nicht nur die Zeichenkette.

Wie funktionieren Embeddings?

Ein Embedding-Modell ist ein spezialisiertes neuronales Netz, das Eingaben in Vektoren fester Länge umwandelt. Ein solcher Vektor besteht aus Hunderten bis Tausenden von Dezimalzahlen. OpenAIs Embedding-Modell text-embedding-3-large erzeugt beispielsweise Vektoren mit 3.072 Dimensionen.

Der Prozess läuft in zwei Schritten ab:

  • Encoding: Der Text wird durch das Embedding-Modell geschickt, das ihn in einen Zahlenvektor umwandelt. Dieser Vektor repräsentiert die semantische Bedeutung des gesamten Textes.
  • Vergleich: Zwei Vektoren können mathematisch verglichen werden (oft ueber die sogenannte Kosinus-Aehnlichkeit). Je aehnlicher die Bedeutung, desto höher der Aehnlichkeitswert.
  • Das Besondere an Embeddings: Sie erfassen semantische Aehnlichkeit, nicht nur wörtliche Uebereinstimmung. Die Frage "Wie wird das Wetter morgen?" und "Welche Temperaturen erwarten uns uebermorgen?" würden aehnliche Embeddings erzeugen, obwohl kein einziges Wort identisch ist.

    Vektordatenbanken: Das Zuhause für Embeddings

    Wenn Sie Tausende oder Millionen von Dokumenten als Embeddings speichern möchten, brauchen Sie eine Vektordatenbank. Diese spezialisierten Datenbanken sind darauf optimiert, schnell die aehnlichsten Vektoren zu einer Suchanfrage zu finden.

    Bekannte Vektordatenbanken sind:

  • Pinecone: Cloud-basiert, einfach zu bedienen, skalierbar
  • Weaviate: Open Source, vielseitig, mit integrierter Vektorisierung
  • Chroma: Leichtgewichtig, ideal für Prototypen und kleinere Projekte
  • Qdrant: Open Source, performant, gute Filterfunktionen
  • pgvector: PostgreSQL-Erweiterung, ideal wenn Sie bereits PostgreSQL nutzen
  • Semantische Suche: Die wichtigste Anwendung

    Die semantische Suche ist der häufigste Einsatzzweck für Embeddings. Im Gegensatz zur klassischen Stichwortsuche versteht die semantische Suche die Bedeutung einer Anfrage:

  • Stichwortsuche: "Kündigung Arbeitsvertrag" findet nur Dokumente, die genau diese Wörter enthalten
  • Semantische Suche: "Kündigung Arbeitsvertrag" findet auch Dokumente ueber "Beendigung des Arbeitsverhältnisses", "Entlassung" oder "Aufhebungsvertrag"
  • Für Unternehmen mit grossen Dokumentenbeständen -- Wissensdatenbanken, Vertragsarchive, Support-Tickets -- ist das ein enormer Fortschritt.

    Embeddings und RAG

    Embeddings sind eine Schlüsseltechnologie für Retrieval Augmented Generation (RAG) -- den Ansatz, KI-Modelle mit externem Wissen zu versorgen. Der Ablauf:

  • Unternehmensdokumente werden in Abschnitte zerlegt und als Embeddings in einer Vektordatenbank gespeichert
  • Bei einer Nutzeranfrage wird die Frage ebenfalls in ein Embedding umgewandelt
  • Die Vektordatenbank liefert die relevantesten Dokumentenabschnitte
  • Diese werden als Kontext an das Large Language Model uebergeben, das darauf basierend antwortet
  • So kann ein KI-Chatbot ueberzeugend und korrekt ueber unternehmensspezifische Themen sprechen, ohne dass das Modell selbst per Fine-Tuning angepasst werden muss.

    Bedeutung für Unternehmen

    Embeddings eröffnen deutschen Unternehmen zahlreiche Möglichkeiten:

  • Intelligente Dokumentensuche: Mitarbeiter finden relevante Informationen schneller
  • Kundensupport-Automatisierung: KI-Chatbots können auf Basis interner Wissensdatenbanken antworten
  • Duplikaterkennung: Aehnliche Kundenanfragen, Fehlerberichte oder Verträge automatisch erkennen
  • Empfehlungssysteme: Aehnliche Produkte, Artikel oder Dienstleistungen vorschlagen
Dabei können Embeddings auch lokal und DSGVO-konform betrieben werden: Open-Source-Embedding-Modelle laufen auf eigenen Servern, und Vektordatenbanken wie Weaviate oder Qdrant können selbst gehostet werden.

Fazit

Embeddings sind die Brücke zwischen menschlicher Sprache und maschinellem Verständnis. Sie ermöglichen es Computern, die Bedeutung von Texten zu erfassen und aehnliche Inhalte zu finden. Für Unternehmen sind Embeddings die Grundlage intelligenter Suchsysteme, wissensbasierter Chatbots und vieler weiterer KI-Anwendungen. Wer die eigene Wissensbasis mit Embeddings erschliesst, hebt das Informationsmanagement auf ein neues Niveau.

Passende KI-Tools

Diese KI-Tools stehen in direktem Zusammenhang mit dem Begriff Embedding: