Beschreibung
Das Repository stellt einen Skill mit dem Befehl /watch bereit. Ein Video, sei es per URL oder als lokale Datei übergeben, wird mit yt-dlp heruntergeladen, ffmpeg extrahiert daraus automatisch skalierte Frames, und ein Transkript wird primär aus vorhandenen Untertiteln gezogen. Fehlen Untertitel, springt eine Whisper API von Groq oder OpenAI als Fallback ein. Eine automatische Frame Budgetierung sorgt dafür, dass auch längere Videos analysiert werden können, ohne das Token Budget zu sprengen.
Das Ergebnis ist ein durchsuchbarer Kontext aus Bildmaterial und Text, der Fragen zu konkreten Momenten eines Videos beantwortbar macht, etwa was auf einem bestimmten Frame zu sehen ist oder was an einer bestimmten Stelle gesagt wurde. Lokal vorausgesetzt werden yt-dlp und ffmpeg, für die Whisper Fallback Transkription zusätzlich ein API Key von Groq oder OpenAI.









