Vielen Dank für die Zusendung Ihrer Anfrage! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Vielen Dank, dass Sie Ihre Buchung abgeschickt haben! Eines unserer Teammitglieder wird Sie in Kürze kontaktieren.
Schulungsübersicht
Einführung in die Multimodalität von Gemini 3
- Fähigkeiten im Umgang mit Text, Bildern, Audio und Video
- Modellauswahl und Übersicht der Endpoints
- Wesentliche Konzepte im multimodalen Schliessen
Arbeit mit Text und strukturierten Eingaben
- Prompting-Strategien für die Textgenerierung
- Metadaten, Kontextfenster und Embeddings
- Textbasierte Orchestrierung multimodaler Aufgaben
Bildverständnis und visuelle Arbeitsabläufe
- Bildanalyse und -interpretation mit Gemini 3
- Erstellung von visuellen Such- und Tagging-Tools
- Aufbau von Bild-zu-Text- und Text-zu-Bild-Interaktionen
Verarbeitung von Audioeingaben
- Arbeitsabläufe für Spracherkennung und Transkription
- Erkennung und Interpretation von Audioereignissen
- Integration von Audio mit Text- und visuellen Eingaben
Video-Intelligenz und Szenenanalyse
- Schliessen auf Videoebene framegenau und kontinuierlich
- Erstellung von Zusammenfassungs- und Highlight-Extraktions-Tools
- Videobasierte Automatisierung und Inhalts-Workflows
Gestaltung multimodaler Anwendungsarchitekturen
- Kombination mehrerer Eingabetypen in einer einzelnen Pipeline
- Berücksichtigung von Latenz, Kosten und Rechenleistung
- Best Practices für skalierbare multimodale Systeme
Prototyping von multimodalen Anwendungen
- Praktische Erstellung multimodaler Prototypen
- Schnelle Iteration durch Prompt Engineering
- Testen und Verfeinern der Benutzererlebnisflüsse
Einführung multimodaler Lösungen
- Deploymentsstrategien und Umgebungssetup
- Überwachung der Leistung in der Praxis
- Sicherheits- und Compliance-Erwägungen
Zusammenfassung und nächste Schritte
Voraussetzungen
- Grundlegendes Verständnis moderner KI-Konzepte
- Erfahrung mit Python oder JavaScript
- Vertrautheit mit REST-APIs
Zielgruppe
- Designer
- Inhalteersteller
- Technische Produktteams
14 Stunden
Erfahrungsberichte (1)
Fluss, Vibe und Thema der Präsentation
Lukasz Kowalczyk - Allegro Sp. z o.o.
Kurs - Google Gemini AI for Data Analysis
Maschinelle Übersetzung