Verwandeln Sie jedes Video in einen fertigen Prompt. Die Vision-KI beschreibt jedes Bild, das Sprachmodell schreibt den Prompt — komplett auf Ihrem Gerät.
Deine Ideen und Prompts verlassen nie dein Gerät. Keine Uploads, keine Logs, niemand schaut zu. Bei jeder Generierung.
Das Modell läuft auf DEINER Hardware — niemand zahlt Server. Keine API-Keys, keine Quoten, keine Paywalls — 100 Prompts am Tag.
Nach dem einmaligen Download lebt das Modell im Browser-Cache. WLAN aus — es generiert trotzdem. Flugmodus, kein Problem.
Kein Konto, keine E-Mail, keine Analyse deiner Prompts. Das Modell weiß nicht, wer du bist — und sonst auch niemand.
Nein. Bilder werden vollständig in deinem Browser extrahiert und beschrieben. Nichts wird hochgeladen – es gibt keinen Server, der es empfangen könnte. Lade die Seite, aktiviere den Flugmodus, und alles funktioniert weiter.
Nein – es rekonstruiert einen Prompt aus dem Sichtbaren: Motiv, Aktionen, Kamera, Licht, Stil. Der ursprüngliche Prompt lässt sich aus einem Video nicht wiederherstellen; das Ergebnis ist eine ehrliche Interpretation.
Ja: ein kompaktes visuelles Modell beschreibt die Bilder – Standard (~560 MB) oder Hohe Präzision (~1,5 GB) – und das Textmodell, das du bereits nutzt, schreibt den finalen Prompt.
Jedes vom Browser abspielbare Format (MP4, WebM, MOV u. a.) — und ohne Größenlimit, denn das Video verlässt nie Ihr Gerät. Die Frames werden lokal extrahiert; ein längeres Video dauert nur etwas länger.
Die KI rekonstruiert einen Prompt aus dem sichtbaren Bildinhalt: Motiv, Handlung, Kamera, Licht, Stil. Den ursprünglichen Prompt der Videoproduktion kann sie nicht wiederherstellen — liefert aber eine ehrliche, einsatzbereite Interpretation zum Weiterverfeinern.