Kontakt aufnehmen

Schulungsübersicht

Einführung in die Multimodalität von Gemini 3

  • Fähigkeiten im Umgang mit Text, Bildern, Audio und Video
  • Modellauswahl und Übersicht der Endpoints
  • Wesentliche Konzepte im multimodalen Schliessen

Arbeit mit Text und strukturierten Eingaben

  • Prompting-Strategien für die Textgenerierung
  • Metadaten, Kontextfenster und Embeddings
  • Textbasierte Orchestrierung multimodaler Aufgaben

Bildverständnis und visuelle Arbeitsabläufe

  • Bildanalyse und -interpretation mit Gemini 3
  • Erstellung von visuellen Such- und Tagging-Tools
  • Aufbau von Bild-zu-Text- und Text-zu-Bild-Interaktionen

Verarbeitung von Audioeingaben

  • Arbeitsabläufe für Spracherkennung und Transkription
  • Erkennung und Interpretation von Audioereignissen
  • Integration von Audio mit Text- und visuellen Eingaben

Video-Intelligenz und Szenenanalyse

  • Schliessen auf Videoebene framegenau und kontinuierlich
  • Erstellung von Zusammenfassungs- und Highlight-Extraktions-Tools
  • Videobasierte Automatisierung und Inhalts-Workflows

Gestaltung multimodaler Anwendungsarchitekturen

  • Kombination mehrerer Eingabetypen in einer einzelnen Pipeline
  • Berücksichtigung von Latenz, Kosten und Rechenleistung
  • Best Practices für skalierbare multimodale Systeme

Prototyping von multimodalen Anwendungen

  • Praktische Erstellung multimodaler Prototypen
  • Schnelle Iteration durch Prompt Engineering
  • Testen und Verfeinern der Benutzererlebnisflüsse

Einführung multimodaler Lösungen

  • Deploymentsstrategien und Umgebungssetup
  • Überwachung der Leistung in der Praxis
  • Sicherheits- und Compliance-Erwägungen

Zusammenfassung und nächste Schritte

Voraussetzungen

  • Grundlegendes Verständnis moderner KI-Konzepte
  • Erfahrung mit Python oder JavaScript
  • Vertrautheit mit REST-APIs

Zielgruppe

  • Designer
  • Inhalteersteller
  • Technische Produktteams
 14 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien