KI. Verständlich. Praxisnah. Effizient.ki-academy-leipzig.de
← Zurück zum Glossar
Technik & DatenBuchstabe C

CLIP

Modell von OpenAI, das Bilder und Texte in einem gemeinsamen Vektorraum verknüpft und so Bild-Text-Zuordnungen ermöglicht.

CLIP (Contrastive Language–Image Pretraining) ist ein von OpenAI entwickeltes KI-Modell, das Text- und Bilddaten miteinander verbindet. Es wurde trainiert, sowohl sprachliche als auch visuelle Inhalte zu verstehen und sie kontextuell miteinander in Beziehung zu setzen – weit über einfache Objekterkennung hinaus.

Funktionsweise: kontrastives Lernen auf Millionen von Text-Bild-Paaren aus dem Internet, gemeinsamer Vektorraum (ähnliche Inhalte liegen im Vektorraum nahe beieinander).

Besonderheit: Zero-Shot-Learning – CLIP kann Aufgaben lösen, für die es nie explizit trainiert wurde. Anwendungsbereiche: Bildsuche (textuell gesteuert), Bildbeschreibung, Kunst- und Design-Tools, Content-Moderation, medizinische Bildanalyse. CLIP gilt als wichtige Grundlage für multimodale KI-Systeme.

Beispiel

Eine Bildsuche nutzt CLIP, um zu einer Texteingabe wie sonniger Strand die inhaltlich passenden Fotos zu finden.

Synonyme

Contrastive Language-Image PretrainingCLIP-ModellOpenAI CLIP