Skript, Voiceover, wortgenaue Untertitel, Bilder und Musik — aus einem einzigen Thema. Oder bring dein eigenes Video mit: untertiteln, in eine andere Sprache vertonen, in Clips schneiden und automatisch auf YouTube posten. Pro Video zahlen oder selbst hosten und nichts zahlen; ein Abo gibt es so oder so nicht.
@shortpulse
Why honey never spoils 🍯
original sound — shortpulse
Ungeschnittenes Ergebnis — KI-geschriebenes Skript, Piper-Sprecher, wortgenaue Untertitel, in allen neun Sprachen des Produkts. Sechzehn nutzen echtes Stockmaterial; das mit AI stills markierte hat der kostenpflichtige Modus gezeichnet. Zum Abspielen mit der Maus darüberfahren.
Footage from Pexels, filmed by Aaron Burden, Abdullah | 4K, Adventure Studio, Aleks Magnusson, Alexey Chudin, Ambareesh Sridhar Photography, Ana Sandu, Andre Moura, Andres Perez, Angela Roma, Anna Pou, Anna Shvets, Artem Podrez, aslı aydoğdu, Bahri Gün, Barbara Olsen, Bav Vadgama, Ben Prater, Canan İldeniz, cottonbro studio, Darina Belonogova, Deti riyanti, Ebahir, Emrah, Eyüp Can, Grigoriy Bunkov, Hale Ş, Hashim Suhimi, Iceberg San, Ilya Lyzhin, John Diez, Joolsmagools ®️, Juan Camilo Trujillo Botero 🇨🇴📸, JUN HO LEE, K, Kakada Chuon, Kevin Malik, khezez | خزاز, Koushalya Karthikeyan, LauraB, Lentes Bella, Luis Quintero, Marina Leonova, Masha Glazova, Matthias Groeneveld, Max Medyk, Michael Burrows, Mikhail Nilov, Mizuno K, Muhtelifane, Nadezhda Moryak, Nicola Narracci, Nikita Ryumshin, Nisasu, Pachon in Motion, Pavel Danilyuk, Photoviewx, Physical Pixel, RDNE Stock project, ROMAN ODINTSOV, Ron Lach, Sema, Shan Ali, Stefanie Jockschat, Thuan Pham, Tima Miroshnichenko, Timothy Fuller, Timur Weber, Toni.063371 - Antonio Sáez, Yuliya Duzhaya, Şahin Doğdu. The AI-stills clip has no footage to credit — every frame of it was generated.
Background music is “Airport Lounge” by Kevin MacLeod (incompetech.com), licensed CC BY 3.0 — the same royalty-free track the pipeline falls back to by default.
Starte mit einem Thema oder mit Material, das du schon hast. Das sind Bildschirme der App selbst — wähle einen Tab, um jeden Teil zu sehen.




Gib ein Thema ein. Die App schreibt das Skript, nimmt den Voiceover auf, findet Material oder erzeugt Bilder, timt jeden Untertitel und mischt Musik dazu — ein fertiges Hochkantvideo.
Leg einen Podcast oder Vortrag ab, wähl den Abschnitt, der gelesen werden soll — das Transkript sucht die Momente, die für sich stehen. Jeder landet mit Untertiteln in deiner Bibliothek, bereit zum Bearbeiten.
2 Credits · 3:30 gelesen
Gebaut auf quelloffener Software, die du prüfen kannst
Eine Zeile genügt — das Sprachmodell schreibt die Szenenaufteilung, den Einstieg und den Call-to-Action. Skript schon fertig? Einfügen, und die KI teilt es nur in Szenen auf.
Sprache, Länge, Bildengine und Untertitelstil. Die genauen Credit-Kosten und eine geschätzte Renderzeit stehen fest, bevor du dich festlegst.
Der Fortschritt läuft live über einen WebSocket, Stufe für Stufe. Heraus kommt ein 1080x1920-MP4 mit eingebrannten Untertiteln und abgesenkter Musik — zum Herunterladen, ohne Wasserzeichen.
Jedes Bild unten ist ein echter Render — dasselbe Modell, dieselben Einstellungen, dasselbe Motiv. Wir haben bewusst ein Motiv mit Gesicht und Händen gewählt, weil genau das am schwersten richtig hinzubekommen ist und der Grund, warum die meisten dieser Looks stilisiert sind.
Untertitel werden von faster-whisper pro Wort getimt, sodass das aktive Wort genau auf der gesprochenen Silbe hervorgehoben wird. Wähle, wie das aussieht — Größe, Farbe, Position und wie viele Wörter gleichzeitig zu sehen sind.
captions that land on the beat
Wenn ein Render fertig ist, bekommst du die gesamte Aufteilung neben dem Player — was die Stimme sagt, wie lang jede Szene läuft und wo sie in der Zeitleiste sitzt.
Hook: Honey, the ultimate superfood, is surprisingly eternal!
It's because of its unique acidity level.
Honey's pH level is naturally acidic, around 3.2 to 4.5.
This acidity creates an environment where mold and bacteria can't thrive.
Additionally, honey's sugar content is so high that it dehydrates any microorganisms.
Ollama (lokal) oder OpenAI zerlegt dein Thema in Szenen
Piper-Stimmen, vollständig lokal, 9 Sprachen
faster-whisper timt jedes Wort für das Einbrennen im Karaoke-Stil
KI-Stills oder kostenloses Stockmaterial; lokales Text-zu-Video, wenn du selbst hostest
FFmpeg mischt die abgesenkte Musik und rendert das finale .mp4
Ein Podcast oder Vortrag geht rein; das Transkript wählt die Momente, die sich lohnen, und jeder kommt untertitelt zurück. Bezahlt wird nach gelesenen Minuten, nicht pro Clip.
Dein eigenes Video, neu gesprochen in einer der neun Sprachen über dem Originalbild — mit passenden Untertiteln.
Verbinde einmal einen Kanal, und jedes fertige Rendering kann automatisch rausgehen. Instagram und Facebook kommen.
Selbst gehostet laufen Skript, Voiceover, Transkription, Bilder und Rendering vollständig lokal — nur das Stockmaterial geht ins Netz. Der gehostete Dienst gibt das bewusst auf: Er hat keine GPU, deshalb kommen Skript und KI-Stills von kostenpflichtigen APIs.
faster-whisper liefert Timing auf Wortebene, sodass Untertitel ein Wort nach dem anderen hervorheben statt eine ganze Zeile hinzuwerfen.
Skript, Voiceover und Untertitel entstehen direkt auf Englisch, Türkisch, Spanisch, Deutsch, Arabisch und mehr.
Die Hintergrundmusik wird per Sidechain automatisch unter dem Voiceover abgesenkt — kein manuelles Mischen.
Pro Szene ein RealVisXL-Still mit Ken-Burns-Fahrt darüber, oder ein passender Pexels-Clip. Selbst gehostet mit GPU kommt lokales Text-zu-Video dazu, das dieser Dienst nicht anbietet.
Eine optionale Abschlusskarte, lokal mit Pillow gerendert — das letzte Bild ist dein Call-to-Action, keine Vermutung eines Diffusionsmodells.
| ShortPulse | Typisches Abo-Tool | |
|---|---|---|
| Was du zahlst | Pro Video, selbst gehostet gar nichts | 20–50 $/Monat, ob gepostet oder nicht |
| Monate ohne Nutzung | Kosten nichts | Werden trotzdem berechnet |
| Quellcode | MIT, vollständig lesbar | Geschlossen |
| Wo es läuft | Auf deinem Rechner oder unserem | Nur auf deren Servern |
| Anpassbarkeit | Prompts bearbeiten, Modelle frei tauschen | An deren Pipeline gebunden |
| Ungenutzte Credits | Verfallen nie | Werden monatlich zurückgesetzt |
Credits sind einmalig und verfallen nie. Kein Abo verlängert sich, nichts bucht erneut ab, solange du nicht erneut kaufst — und alles steht weiterhin unter MIT, falls du es lieber selbst betreibst.
Jedes neue Konto, ohne Karte.
Zum Ausprobieren, ob das Posten zur Gewohnheit wird.
Betreib es selbst und der Preis ist null, für immer — Credits gibt es nur, weil die gehostete Instanz auf Hardware rendert, die jemand bezahlen muss.
1 Credit = Stockmaterial · 3 = AI stills · 10 = lokales Text-zu-Video, jeweils ×2 bei mittlerer und ×3 bei langer Länge. Die genauen Kosten siehst du, bevor ein Render startet.
Preise in USD. Karten aus jedem Land funktionieren — deine Bank rechnet zu ihrem eigenen Kurs um.
Marketingseiten verstecken die rauen Kanten. Unsere stehen vollständig im README — hier ein paar davon, damit du es weißt, bevor du klonst:
Ein 1080x1920-MP4, H.264/AAC, mit Voiceover, eingebrannten wortgenauen Untertiteln, unter der Stimme abgesenkter Hintergrundmusik und optionaler Abschlusskarte. Kein Wasserzeichen, in jedem Tarif — auch mit den Gratis-Credits.
In diesem Dienst dauert ein kurzes Video mit Stockmaterial etwa 45 Sekunden von Anfang bis Ende. KI-Stills brauchen ein bis zwei Minuten: Die Bilder kommen von einer gehosteten GPU mit rund 8 Sekunden pro Bild, aber das erste nach einer ruhigen Phase wartet auf das Laden des Modells. Selbst gehostet auf einem Apple Silicon der M-Serie sind die Stills deutlich langsamer — etwa 78 Sekunden pro Szene, also ~7 Minuten für ein kurzes Video — weil dein eigener Rechner die Diffusion übernimmt.
Neun: Englisch, Türkisch, Spanisch, Französisch, Deutsch, Portugiesisch, Arabisch, Russisch und Italienisch. Skript, Voiceover und Untertitel entstehen alle in der gewählten Sprache. Japanisch fehlt, weil Piper keine japanische Stimme mitbringt, die wir kommerziell nutzen dürfen.
Ja. Füge es ein, und das Sprachmodell teilt es nur in Szenen auf und schreibt die Bild-Prompts — deine Formulierung erreicht das Voiceover unverändert.
Nein. ShortPulse rendert die Datei und übergibt sie dir; das Veröffentlichen bleibt deine Aufgabe. Wenn automatisches Posten die Funktion ist, die du eigentlich willst, ist ein anderes Werkzeug heute besser für dich.
Ja. Lade es herunter und mach damit, was du willst. Wenn du den Stockmaterial-Modus nutzt, nenne die Videografen in deiner Beschreibung — die Projektseite sammelt Namen und Links für dich, und die Pexels-Lizenz verlangt es.
Credits, einmalig gekauft. Ein Render kostet 1 Credit mit Stockmaterial und 3 mit KI-Stills, bei mittlerer Länge verdoppelt und bei langer verdreifacht. Die genauen Kosten siehst du, bevor du startest. (Lokales Text-zu-Video kostet 10 und gilt nur beim Selbsthosten — hier wird es nicht angeboten.)
Nein. Nichts erneuert sich, nichts wird monatlich zurückgesetzt — das Konto kennt kein Ablaufdatum, Credits bleiben liegen, bis du sie ausgibst.
Die Credits kommen automatisch zurück. Erstattungen hängen am Projekt und können nur einmal erfolgen, sodass ein Fehlschlag dich nicht mit den Kosten für ein Video zurücklässt, das du nie bekommen hast.
5 Credits bei der Anmeldung, ohne Karte. Eines deiner Videos darf KI-Stills nutzen — das geht auf uns, damit du den bezahlten Modus siehst, bevor du dich entscheidest — der Rest des Guthabens rendert Videos mit Stockmaterial zu je 1 Credit. Eine Szene neu zu würfeln und weitere KI-Still-Renders brauchen ein Credit-Paket.
Ja, und es kostet nichts. Das Ganze ist MIT — klone es, richte es auf dein eigenes Ollama und deine GPU aus, und es gibt keine Konten, keine Credits und keine Limits. Credits existieren nur, weil die gehostete Instanz auf Hardware läuft, die jemand bezahlt.
Beim Selbsthosten ja: Skript, Voiceover, Transkription, Bildgenerierung und Rendering laufen alle auf deinem Rechner, und die einzige Stufe, die ins Netz geht, ist Stockmaterial von Pexels. Der gehostete Dienst ist der Kompromiss — er hat keine GPU, deshalb kommen Skripte von OpenAI und KI-Stills von Replicate. Voiceover, Untertitel und Rendering passieren weiterhin auf unserem Server, und der Code ist in beiden Fällen derselbe.
KI-Stills zeichnen Gesichter gut und Extremitäten schlecht — an Händen, Füßen und Ganzkörperaufnahmen zerfällt ein Bild — und lesbare Schrift liegt ganz außerhalb des Modells. Lokales Text-zu-Video braucht eine ernstzunehmende GPU, weshalb dieser Dienst es gar nicht anbietet. Kleine lokale Sprachmodelle liefern manchmal weniger Szenen als angefragt. Alles steht im Abschnitt Known limitations des README.