Das Schwierige ist nicht das Schreiben, sondern das Synchronisieren
Zu transkribieren, was in einem Video gesagt wird, geht verhältnismäßig schnell; jedem Satz die genaue Anfangs- und Endsekunde zu geben ist, was am meisten Zeit kostet. Zehn Minuten Video können leicht zweihundert Untertitel enthalten, jeder mit zwei Marken auf die Millisekunde.
Diese Synchronität kommt schon gelöst. Die Zeiten werden gegen das Audio der Datei selbst berechnet, also passen sie von selbst zusammen, sobald das SRT ans Video gehängt wird, ohne Drift und ohne globale Anpassungen von Hand.