Embeddings
auch: Vektor-Embeddings · Word Embeddings · Einbettungen
Kurz gesagt: Embeddings sind numerische Darstellungen (Vektoren) von Inhalten wie Texten oder Bildern, die deren Bedeutung abbilden. Inhalte mit ähnlicher Bedeutung erhalten ähnliche Vektoren.
Embeddings übersetzen Bedeutung in Zahlen. Ein KI-Modell wandelt einen Text, ein Bild oder ein anderes Objekt in eine lange Zahlenreihe (einen Vektor) um, die seinen inhaltlichen «Standort» beschreibt. Inhalte mit ähnlicher Bedeutung liegen dabei nahe beieinander. Embeddings sind damit die Grundlage für semantische Suche, Empfehlungssysteme und RAG.
Definition
Ein Embedding ist eine Darstellung von Daten als Vektor in einem hochdimensionalen Raum, in dem semantische Ähnlichkeit als räumliche Nähe abgebildet wird[1].
So lässt sich rechnerisch bestimmen, wie ähnlich sich zwei Inhalte inhaltlich sind – selbst wenn sie keine gemeinsamen Wörter haben.
Wie Embeddings entstehen
Ein speziell trainiertes Modell (Embedding-Modell) erzeugt für jeden Eingabe-Inhalt einen Vektor. Während des Trainings lernt es, bedeutungsverwandte Inhalte nahe beieinander und unterschiedliche weit voneinander zu platzieren[2].
Die Ähnlichkeit zweier Embeddings wird meist über den Winkel zwischen den Vektoren (Kosinus-Ähnlichkeit) berechnet.
Wofür man sie braucht
Verwandte Begriffe
Verwandte Leistungen von Mirostudio
Häufig gestellte Fragen
Was sind Embeddings?
Wozu dienen Embeddings?
Was ist der Unterschied zwischen Embeddings und einer Vektordatenbank?
Wie werden Embeddings erzeugt?
Was hat das mit Chatbots zu tun?
Quellen
- Wikipedia: Word embedding – en.wikipedia.org/wiki/Word_embedding
- Google ML: Embeddings – developers.google.com/machine-learning/crash-course/embeddings

