CLIP
CLIP (Contrastive Language–Image Pretraining) ist ein von OpenAI entwickeltes KI-Modell, das Text- und Bilddaten miteinander verbindet. Es wurde trainiert, sowohl sprachliche als auch visuelle Inhalte zu verstehen und sie kontextuell miteinander in Beziehung zu setzen – weit über einfache Objekterkennung hinaus.
Funktionsweise: kontrastives Lernen auf Millionen von Text-Bild-Paaren aus dem Internet, gemeinsamer Vektorraum (ähnliche Inhalte liegen im Vektorraum nahe beieinander).
Besonderheit: Zero-Shot-Learning – CLIP kann Aufgaben lösen, für die es nie explizit trainiert wurde. Anwendungsbereiche: Bildsuche (textuell gesteuert), Bildbeschreibung, Kunst- und Design-Tools, Content-Moderation, medizinische Bildanalyse. CLIP gilt als wichtige Grundlage für multimodale KI-Systeme.
Beispiel
Eine Bildsuche nutzt CLIP, um zu einer Texteingabe wie sonniger Strand die inhaltlich passenden Fotos zu finden.