Open Source · selbst hosten oder gehostet nutzen

Aus einem Thema ein fertig postbares Hochformat-Video.

Skript, Voiceover, wortgenaue Untertitel, Bilder und Musik — aus einem einzigen Thema. Oder bring dein eigenes Video mit: untertiteln, in eine andere Sprache vertonen, in Clips schneiden und automatisch auf YouTube posten. Pro Video zahlen oder selbst hosten und nichts zahlen; ein Abo gibt es so oder so nicht.

Sprachen
9
Sprachen
Bildstile
6
Bildstile
Gratis-Credits
5
Gratis-Credits
lizenziert
MIT
lizenziert
FollowingFor You

@shortpulse

Why honey never spoils 🍯

original sound — shortpulse

SH
stock_media · en · 24s · real render
Echte Ergebnisse

Siebzehn Videos, die diese Pipeline tatsächlich gemacht hat

Ungeschnittenes Ergebnis — KI-geschriebenes Skript, Piper-Sprecher, wortgenaue Untertitel, in allen neun Sprachen des Produkts. Sechzehn nutzen echtes Stockmaterial; das mit AI stills markierte hat der kostenpflichtige Modus gezeichnet. Zum Abspielen mit der Maus darüberfahren.

English
Why honey never spoils24s · 5 scenes
Türkçe
Neden gece rüya görürüz?18s · 5 scenes
Français
Pourquoi la lune change-t-elle de forme ?25s · 6 scenes
English
Why the ocean is salty19s · 5 scenes
Deutsch
Warum färben sich Blätter im Herbst?20s · 5 scenes
Español
¿Por qué el cielo es azul?17s · 5 scenes
العربية
لماذا تخاف القطط من الماء؟21s · 5 scenes
English
How lightning actually forms23s · 5 scenes
Português
Por que bocejamos?26s · 5 scenes
English
Why coffee wakes you up24s · 5 scenes
Русский
Почему небо ночью тёмное?11s · 5 scenes
Türkçe
Kediler neden kutuları sever?22s · 5 scenes
Italiano
Perché il caffè ci sveglia?16s · 5 scenes
English
Why volcanoes erupt24s · 5 scenes
English
Why we get goosebumps18s · 5 scenes
English
A simple trick for better sleep19s · 5 scenes
EnglishAI stills
Why quiet people read the room24s · 8 scenes

Footage from Pexels, filmed by Aaron Burden, Abdullah | 4K, Adventure Studio, Aleks Magnusson, Alexey Chudin, Ambareesh Sridhar Photography, Ana Sandu, Andre Moura, Andres Perez, Angela Roma, Anna Pou, Anna Shvets, Artem Podrez, aslı aydoğdu, Bahri Gün, Barbara Olsen, Bav Vadgama, Ben Prater, Canan İldeniz, cottonbro studio, Darina Belonogova, Deti riyanti, Ebahir, Emrah, Eyüp Can, Grigoriy Bunkov, Hale Ş, Hashim Suhimi, Iceberg San, Ilya Lyzhin, John Diez, Joolsmagools ®️, Juan Camilo Trujillo Botero 🇨🇴📸, JUN HO LEE, K, Kakada Chuon, Kevin Malik, khezez | خزاز, Koushalya Karthikeyan, LauraB, Lentes Bella, Luis Quintero, Marina Leonova, Masha Glazova, Matthias Groeneveld, Max Medyk, Michael Burrows, Mikhail Nilov, Mizuno K, Muhtelifane, Nadezhda Moryak, Nicola Narracci, Nikita Ryumshin, Nisasu, Pachon in Motion, Pavel Danilyuk, Photoviewx, Physical Pixel, RDNE Stock project, ROMAN ODINTSOV, Ron Lach, Sema, Shan Ali, Stefanie Jockschat, Thuan Pham, Tima Miroshnichenko, Timothy Fuller, Timur Weber, Toni.063371 - Antonio Sáez, Yuliya Duzhaya, Şahin Doğdu. The AI-stills clip has no footage to credit — every frame of it was generated.

Background music is “Airport Lounge” by Kevin MacLeod (incompetech.com), licensed CC BY 3.0 — the same royalty-free track the pipeline falls back to by default.

Das ganze Studio

Fünf Aufgaben, ein Ort dafür

Starte mit einem Thema oder mit Material, das du schon hast. Das sind Bildschirme der App selbst — wähle einen Tab, um jeden Teil zu sehen.

Das Studio mit eingegebenem Thema, den Einstellungszeilen und einer Live-Vorschau der UntertitelDer Tab für Untertitel und Vertonung, auf Türkisch eingestellt, mit geöffneten Untertitel-VorlagenDie Bibliothek mit einem Quellvideo und den vier daraus geschnittenen ClipsDer Editor mit den Untertitelzeilen eines fertigen Videos neben seiner Vorschau

Gib ein Thema ein. Die App schreibt das Skript, nimmt den Voiceover auf, findet Material oder erzeugt Bilder, timt jeden Untertitel und mischt Musik dazu — ein fertiges Hochkantvideo.

Neu

Eine lange Aufnahme, mehrere Posts

Leg einen Podcast oder Vortrag ab, wähl den Abschnitt, der gelesen werden soll — das Transkript sucht die Momente, die für sich stehen. Jeder landet mit Untertiteln in deiner Bibliothek, bereit zum Bearbeiten.

Aus der Nähe: Untertitel leuchten Wort für Wort auf, im Takt der Stimme.
In Clips schneiden
Nicht — ganz lassen2 Clips3 Clips4 Clips5 Clips
Welcher Teil verwendet wird
4:00→7:308:00

2 Credits · 3:30 gelesen

Was dabei herauskam
Documentation Quality0:15 · 9:16Untertitelt
Speed and Clarity0:12 · 9:16Untertitelt
  • Das Transkript wählt die Momente — hier wurden drei angefragt, zwei waren da.
  • Nur der gewählte Abschnitt wird transkribiert; eine Stunde Aufnahme ist keine Stunde Arbeit.
  • Abgerechnet wird das Gelesene, nicht pro Clip: ein Credit je zwei Minuten.
  • Jeder Clip wird ein eigenes Projekt — mit Untertiteln, Format und Bearbeitung.

Gebaut auf quelloffener Software, die du prüfen kannst

Ollamalokale LLM-Laufzeit
Llama 3Szenenskript
Piperneuronales Voiceover
faster-whisperTiming auf Wortebene
Stable Diffusion XLBildgenerierung
RealVisXLfotorealistische Stills
LTX-VideoText-zu-Video
FFmpegZusammenbau & Encoding
libasseingebrannte Untertitel
PexelsStockmaterial
FastAPIRender-API
Next.jsdiese Oberfläche
So funktioniert es

Drei Entscheidungen, den Rest macht es selbst

1

Gib ihm ein Thema

Eine Zeile genügt — das Sprachmodell schreibt die Szenenaufteilung, den Einstieg und den Call-to-Action. Skript schon fertig? Einfügen, und die KI teilt es nur in Szenen auf.

2

Wähle, wie es aussieht

Sprache, Länge, Bildengine und Untertitelstil. Die genauen Credit-Kosten und eine geschätzte Renderzeit stehen fest, bevor du dich festlegst.

3

Zusehen, dann posten

Der Fortschritt läuft live über einen WebSocket, Stufe für Stufe. Heraus kommt ein 1080x1920-MP4 mit eingebrannten Untertiteln und abgesenkter Musik — zum Herunterladen, ohne Wasserzeichen.

Bildstile

Sechs Looks, einen Prompt entfernt

Jedes Bild unten ist ein echter Render — dasselbe Modell, dieselben Einstellungen, dasselbe Motiv. Wir haben bewusst ein Motiv mit Gesicht und Händen gewählt, weil genau das am schwersten richtig hinzubekommen ist und der Grund, warum die meisten dieser Looks stilisiert sind.

PhotorealLooks like footage.
AnimeCel shading, clean line art.
3D ToonBig-eyed animated-film look.
ComicInked outlines, halftone shading.
ClaymationPlasticine models.
Pixel ArtChunky 16-bit sprites.
Untertitelstile

Der Teil, der die Aufmerksamkeit wirklich hält

Untertitel werden von faster-whisper pro Wort getimt, sodass das aktive Wort genau auf der gesprochenen Silbe hervorgehoben wird. Wähle, wie das aussieht — Größe, Farbe, Position und wie viele Wörter gleichzeitig zu sehen sind.

captions that land on the beat

Der Editor

Jede Szene, aufgereiht neben dem Video

Wenn ein Render fertig ist, bekommst du die gesamte Aufteilung neben dem Player — was die Stimme sagt, wie lang jede Szene läuft und wo sie in der Zeitleiste sitzt.

Szenenaufteilung

Playing

Hook: Honey, the ultimate superfood, is surprisingly eternal!

Szene 14.0s

It's because of its unique acidity level.

Szene 24.0s

Honey's pH level is naturally acidic, around 3.2 to 4.5.

Szene 33.0s

This acidity creates an environment where mold and bacteria can't thrive.

Szene 44.0s

Additionally, honey's sugar content is so high that it dehydrates any microorganisms.

  • Auf eine Szene klicken, um das Video dorthin zu springen
  • Die laufende Szene hebt sich selbst hervor
  • Timing pro Szene, direkt aus dem Transkript auf Wortebene
  • Material-Credits für dich gesammelt, mit Kopierknopf
Pipeline

Fünf lokale Stufen, ein fertiges .mp4

01

Skript

Ollama (lokal) oder OpenAI zerlegt dein Thema in Szenen

02

Voiceover

Piper-Stimmen, vollständig lokal, 9 Sprachen

03

Untertitel

faster-whisper timt jedes Wort für das Einbrennen im Karaoke-Stil

04

Bilder

KI-Stills oder kostenloses Stockmaterial; lokales Text-zu-Video, wenn du selbst hostest

05

Zusammenbau

FFmpeg mischt die abgesenkte Musik und rendert das finale .mp4

Was eingebaut ist

Alles, was Kurzvideo braucht, und nichts davon hinter einer Schranke

Langes Video rein, Clips raus

Ein Podcast oder Vortrag geht rein; das Transkript wählt die Momente, die sich lohnen, und jeder kommt untertitelt zurück. Bezahlt wird nach gelesenen Minuten, nicht pro Clip.

In eine andere Sprache vertonen

Dein eigenes Video, neu gesprochen in einer der neun Sprachen über dem Originalbild — mit passenden Untertiteln.

Postet für dich auf YouTube

Verbinde einmal einen Kanal, und jedes fertige Rendering kann automatisch rausgehen. Instagram und Facebook kommen.

Läuft auf deinem Rechner

Selbst gehostet laufen Skript, Voiceover, Transkription, Bilder und Rendering vollständig lokal — nur das Stockmaterial geht ins Netz. Der gehostete Dienst gibt das bewusst auf: Er hat keine GPU, deshalb kommen Skript und KI-Stills von kostenpflichtigen APIs.

Wortgenaue Untertitel

faster-whisper liefert Timing auf Wortebene, sodass Untertitel ein Wort nach dem anderen hervorheben statt eine ganze Zeile hinzuwerfen.

9 Sprachen

Skript, Voiceover und Untertitel entstehen direkt auf Englisch, Türkisch, Spanisch, Deutsch, Arabisch und mehr.

Automatisch abgesenkte Musik

Die Hintergrundmusik wird per Sidechain automatisch unter dem Voiceover abgesenkt — kein manuelles Mischen.

Fotorealistische Stills oder echtes Material

Pro Szene ein RealVisXL-Still mit Ken-Burns-Fahrt darüber, oder ein passender Pexels-Clip. Selbst gehostet mit GPU kommt lokales Text-zu-Video dazu, das dieser Dienst nicht anbietet.

Abschlusskarte im eigenen Look

Eine optionale Abschlusskarte, lokal mit Pillow gerendert — das letzte Bild ist dein Call-to-Action, keine Vermutung eines Diffusionsmodells.

Warum kein Abo

Was sich ändert, wenn es lokal und offen ist

ShortPulseTypisches Abo-Tool
Was du zahlstPro Video, selbst gehostet gar nichts20–50 $/Monat, ob gepostet oder nicht
Monate ohne NutzungKosten nichtsWerden trotzdem berechnet
QuellcodeMIT, vollständig lesbarGeschlossen
Wo es läuftAuf deinem Rechner oder unseremNur auf deren Servern
AnpassbarkeitPrompts bearbeiten, Modelle frei tauschenAn deren Pipeline gebunden
Ungenutzte CreditsVerfallen nieWerden monatlich zurückgesetzt
Preise

Zahl für Videos, nicht für einen Monat, den du nicht genutzt hast

Credits sind einmalig und verfallen nie. Kein Abo verlängert sich, nichts bucht erneut ab, solange du nicht erneut kaufst — und alles steht weiterhin unter MIT, falls du es lieber selbst betreibst.

Kostenlos

Jedes neue Konto, ohne Karte.

$0
  • 5 Credits bei der Anmeldung
  • Dein erstes AI-Stills-Video gratis
  • Danach Videos mit Stockmaterial ab 1 Credit
  • Alle Sprachen
  • Kein Wasserzeichen

Starter

Zum Ausprobieren, ob das Posten zur Gewohnheit wird.

$9einmalig
  • 100 Credits
  • ~33 Standard-Videos
  • ~100 mit Stockmaterial
  • Verfallen nie
Am häufigsten gewählt

Creator

Täglich ein Short, mit Luft für Wiederholungen.

$29einmalig
  • 400 Credits
  • ~133 Standard-Videos
  • ~400 mit Stockmaterial
  • Verfallen nie

Studio

Mehrere Konten oder Arbeit für Kunden.

$79einmalig
  • 1200 Credits
  • ~400 Standard-Videos
  • ~1200 mit Stockmaterial
  • Verfallen nie

Oder zahl gar nichts

Betreib es selbst und der Preis ist null, für immer — Credits gibt es nur, weil die gehostete Instanz auf Hardware rendert, die jemand bezahlen muss.

1 Credit = Stockmaterial · 3 = AI stills · 10 = lokales Text-zu-Video, jeweils ×2 bei mittlerer und ×3 bei langer Länge. Die genauen Kosten siehst du, bevor ein Render startet.

Preise in USD. Karten aus jedem Land funktionieren — deine Bank rechnet zu ihrem eigenen Kurs um.

Gebaut, um einer Prüfung standzuhalten

Marketingseiten verstecken die rauen Kanten. Unsere stehen vollständig im README — hier ein paar davon, damit du es weißt, bevor du klonst:

  • KI-Stills zeichnen Gesichter überzeugend und Extremitäten schlecht — an Händen, Füßen und Ganzkörperaufnahmen zerfällt ein Bild, deshalb hält die Skript-Engine Personen in Nah- und Halbnah-Einstellungen. Lesbare Schrift liegt ganz außerhalb des Modells: Es kann kein Schild, kein Etikett und keinen Buchtitel schreiben.
  • ai_video (lokales Text-zu-Video) läuft nur, wenn du die GPU stellst. Im gehosteten Dienst gibt es das nicht: Eine GPU zu mieten kostet pro Video mehr, als der Modus kostet — dann lieber gar nicht anbieten als schlecht.
  • Kleine lokale Sprachmodelle zählen Szenen gelegentlich zu niedrig; die Skript-Engine versucht es erneut und verwirft fehlerhafte, statt den Render scheitern zu lassen.
  • Stockmaterial ist die nächstbeste Übereinstimmung, keine Garantie — Pexels-Clips können nur lose zur Szene passen.
FAQ

Die Fragen, die man zuerst stellen sollte

Videos

Was genau bekomme ich?

Ein 1080x1920-MP4, H.264/AAC, mit Voiceover, eingebrannten wortgenauen Untertiteln, unter der Stimme abgesenkter Hintergrundmusik und optionaler Abschlusskarte. Kein Wasserzeichen, in jedem Tarif — auch mit den Gratis-Credits.

Wie lange dauert ein Render?

In diesem Dienst dauert ein kurzes Video mit Stockmaterial etwa 45 Sekunden von Anfang bis Ende. KI-Stills brauchen ein bis zwei Minuten: Die Bilder kommen von einer gehosteten GPU mit rund 8 Sekunden pro Bild, aber das erste nach einer ruhigen Phase wartet auf das Laden des Modells. Selbst gehostet auf einem Apple Silicon der M-Serie sind die Stills deutlich langsamer — etwa 78 Sekunden pro Szene, also ~7 Minuten für ein kurzes Video — weil dein eigener Rechner die Diffusion übernimmt.

Welche Sprachen werden unterstützt?

Neun: Englisch, Türkisch, Spanisch, Französisch, Deutsch, Portugiesisch, Arabisch, Russisch und Italienisch. Skript, Voiceover und Untertitel entstehen alle in der gewählten Sprache. Japanisch fehlt, weil Piper keine japanische Stimme mitbringt, die wir kommerziell nutzen dürfen.

Kann ich mein eigenes Skript verwenden?

Ja. Füge es ein, und das Sprachmodell teilt es nur in Szenen auf und schreibt die Bild-Prompts — deine Formulierung erreicht das Voiceover unverändert.

Postet ihr für mich auf TikTok oder YouTube?

Nein. ShortPulse rendert die Datei und übergibt sie dir; das Veröffentlichen bleibt deine Aufgabe. Wenn automatisches Posten die Funktion ist, die du eigentlich willst, ist ein anderes Werkzeug heute besser für dich.

Gehört mir, was ich erstelle?

Ja. Lade es herunter und mach damit, was du willst. Wenn du den Stockmaterial-Modus nutzt, nenne die Videografen in deiner Beschreibung — die Projektseite sammelt Namen und Links für dich, und die Pexels-Lizenz verlangt es.

Credits & Abrechnung

Wie funktioniert die Abrechnung?

Credits, einmalig gekauft. Ein Render kostet 1 Credit mit Stockmaterial und 3 mit KI-Stills, bei mittlerer Länge verdoppelt und bei langer verdreifacht. Die genauen Kosten siehst du, bevor du startest. (Lokales Text-zu-Video kostet 10 und gilt nur beim Selbsthosten — hier wird es nicht angeboten.)

Verfallen Credits?

Nein. Nichts erneuert sich, nichts wird monatlich zurückgesetzt — das Konto kennt kein Ablaufdatum, Credits bleiben liegen, bis du sie ausgibst.

Was, wenn ein Render fehlschlägt?

Die Credits kommen automatisch zurück. Erstattungen hängen am Projekt und können nur einmal erfolgen, sodass ein Fehlschlag dich nicht mit den Kosten für ein Video zurücklässt, das du nie bekommen hast.

Gibt es wirklich ein kostenloses Kontingent?

5 Credits bei der Anmeldung, ohne Karte. Eines deiner Videos darf KI-Stills nutzen — das geht auf uns, damit du den bezahlten Modus siehst, bevor du dich entscheidest — der Rest des Guthabens rendert Videos mit Stockmaterial zu je 1 Credit. Eine Szene neu zu würfeln und weitere KI-Still-Renders brauchen ein Credit-Paket.

Selbst hosten

Kann ich das stattdessen selbst betreiben?

Ja, und es kostet nichts. Das Ganze ist MIT — klone es, richte es auf dein eigenes Ollama und deine GPU aus, und es gibt keine Konten, keine Credits und keine Limits. Credits existieren nur, weil die gehostete Instanz auf Hardware läuft, die jemand bezahlt.

Ist es wirklich lokal?

Beim Selbsthosten ja: Skript, Voiceover, Transkription, Bildgenerierung und Rendering laufen alle auf deinem Rechner, und die einzige Stufe, die ins Netz geht, ist Stockmaterial von Pexels. Der gehostete Dienst ist der Kompromiss — er hat keine GPU, deshalb kommen Skripte von OpenAI und KI-Stills von Replicate. Voiceover, Untertitel und Rendering passieren weiterhin auf unserem Server, und der Code ist in beiden Fällen derselbe.

Wo sind die rauen Kanten?

KI-Stills zeichnen Gesichter gut und Extremitäten schlecht — an Händen, Füßen und Ganzkörperaufnahmen zerfällt ein Bild — und lesbare Schrift liegt ganz außerhalb des Modells. Lokales Text-zu-Video braucht eine ernstzunehmende GPU, weshalb dieser Dienst es gar nicht anbietet. Kleine lokale Sprachmodelle liefern manchmal weniger Szenen als angefragt. Alles steht im Abschnitt Known limitations des README.

Starte mit 5 Credits. Keine Karte, kein Testzeitraum.

Genug, um es zu beurteilen. Kaufe mehr nur, wenn es sich lohnt — oder klone das Repository und lass alles kostenlos auf deiner eigenen Hardware laufen.