Tools· Medienproduktion

    claude-video

    Video Analyse Pipeline aus yt-dlp, ffmpeg und Whisper, die Videos herunterlädt, Frames extrahiert und Transkripte liefert, damit Claude gezielte Fragen zu einzelnen Szenen beantworten kann.

    analytischstrukturierendausführbarOpen Source
    Quellcode
    In Claude Code: /plugin marketplace add bradautomates/claude-video, danach /plugin install watch@claude-video. Andere Umgebungen: npx skills add bradautomates/claude-video -g. Voraussetzung: yt-dlp und ffmpeg, optional API Key für Groq oder OpenAI als Whisper Fallback.
    claude-video

    Beschreibung

    Stärken

    Breite Plattform-Unterstützung
    Über yt-dlp lassen sich URLs von YouTube, Loom, TikTok, X, Instagram und einigen hundert weiteren Quellen verarbeiten, ergänzt um lokale Dateien in den Formaten mp4, mov, mkv und webm.
    Captions zuerst
    In der Detailstufe transcript liefert yt-dlp vorhandene Untertitel ohne Video-Download, das deckt die Mehrheit öffentlicher Videos kostenlos und sofort ab.
    Frame-Deduplizierung
    Ein Vergleich jedes Frames gegen das zuletzt behaltene Bild verwirft nahezu identische Aufnahmen, etwa bei stehenden Folien oder statischen Screen-Recordings, sodass das Frame-Budget auf tatsächlich unterschiedliche Inhalte entfällt.
    Automatische Frame-Budgetierung
    Eine Auto-FPS-Logik verteilt das Bild-Budget über die Videolänge, mit dichterem Sampling in fokussierten Zeitfenstern, damit auch ein langes Video das Kontextfenster nicht sprengt.
    Mehrere Host-Umgebungen
    Neben Claude Code lässt sich der Skill über die Agent-Skills-CLI auch in Codex, Cursor, Copilot, Gemini CLI und über 50 weiteren Hosts installieren.

    Einschätzung

    KI-Funktionen

    • Multimodale Bildauswertung Claude liest die extrahierten JPEGs parallel als Bilder ein und beantwortet Fragen anhand dessen, was tatsächlich im Bild zu sehen ist, statt sich auf Titel oder Beschreibung zu verlassen.
    • Whisper-Transkription als Fallback Fehlen Untertitel, wird eine Mono-Audiospur extrahiert und an Groqs whisper-large-v3 oder OpenAIs whisper-1 geschickt, das Backend lässt sich über eine Option auch fest vorgeben.
    • Timestamp-gesteuerte Frame-Auswahl Nennt die Transkription einen konkreten Moment, etwa einen Hinweis wie schau hier, greift das Skript zusätzlich zum regulären Sampling gezielt ein Frame an dieser Stelle.
    • Szenenbasierte Frame-Erkennung In den Detailstufen balanced und token-burner wird das Video auf Szenenwechsel hin decodiert, aus denen anschließend gleichmäßig verteilte Frames ausgewählt werden.

    Wofür geeignet

    • Nutzer, die Videoinhalte inhaltlich auswerten wollen, ohne sich das gesamte Material manuell anzusehen
    • Analyse einzelner Frames oder Szenen, etwa zur Prüfung von Bildkomposition, Text Einblendungen oder Produktplatzierung
    • Transkription von Videos ohne vorhandene Untertitel über den Whisper Fallback
    • Teams, die Video Reviews oder Content Analysen in einen bestehenden Claude Code Workflow einbetten möchten

    Einschränkungen und Hinweise

    • Lokale Abhängigkeiten yt-dlp und ffmpeg müssen vorhanden sein, unter macOS richtet das Setup sie automatisch über brew ein, unter Linux und Windows werden die nötigen Befehle nur angezeigt und müssen manuell ausgeführt werden.
    • API-Key nur bei Bedarf Die Whisper-Transkription über Groq oder OpenAI greift nur, wenn ein Video keine Untertitel besitzt, das betrifft vor allem lokale Dateien, TikToks, manche Vimeo-Uploads und vereinzelte YouTube-Videos ohne Caption-Spur.
    • Frames dominieren den Tokenverbrauch Bei einem gemessenen 49-minütigen Testvideo kosten Frames in Standardbreite rund 197 Tokens pro Bild, eine Auflösung von 1024 Pixeln vervierfacht diesen Wert etwa.
    • Warnung bei token-burner Bei Videos mit vielen Szenenwechseln, im gemessenen Testfall 116 Schnitte, liefert der Modus token-burner alle Frames ungekappt und löst ab 250 Frames eine Warnung aus, während balanced auf 100 Frames einkürzt.

    Quick Start

    1. Installation je nach Umgebung wählen: In Claude Code mit /plugin marketplace add bradautomates/claude-video, danach /plugin install watch@claude-video, in anderen Hosts mit npx skills add bradautomates/claude-video -g.
    2. Beim ersten Aufruf von /watch prüft das Skript automatisch, ob yt-dlp und ffmpeg vorhanden sind, und richtet sie unter macOS über brew ein.
    3. Video und Frage übergeben, etwa /watch https://youtu.be/dQw4w9WgXcQ was passiert bei Sekunde 30.
    4. Bei Bedarf einen Zeitausschnitt mit --start und --end fokussieren, das erhöht die Frame-Dichte in diesem Fenster.
    5. Für den Whisper-Fallback optional einen API Key hinterlegen, GROQ_API_KEY wird bevorzugt, ersatzweise OPENAI_API_KEY in ~/.config/watch/.env.

    Tipps

    • --detail transcript nutzen, wenn nur der gesprochene Inhalt zählt, das spart den Frame-Download vollständig.
    • Bei Text im Bild, etwa Folien, Terminals oder Code, --resolution 1024 setzen, damit die Schrift lesbar bleibt.
    • --no-dedup nur einsetzen, wenn bewusst auch nahezu identische Frames erhalten bleiben sollen, im Regelfall spart die Deduplizierung Tokens ohne Informationsverlust.
    • Bei langen oder bewegungsreichen Videos zuerst --detail efficient probieren, das liefert oft schon in einem Bruchteil der Zeit ausreichend Frames.

    Zugang

    Stand: · Angaben zu Preisen, Tarifen und Funktionen sind eine Momentaufnahme. Vor einer Entscheidung lohnt der Blick auf die Anbieterseite.

    Im Workshop wird daraus Ihre Methode.

    Wer diesen Prozess einmal laufen sieht, will als Nächstes den Agenten dahinter. Das bauen wir im Workshop Vom Prozess zum Agenten.

    Workshops ansehen

    Gespräch statt Pitch

    Erst verstehen, dann entscheiden. Wir nehmen uns Zeit für ein erstes Gespräch, ohne Verkaufsdruck, ohne Verpflichtung.

    Gespräch vereinbaren