Ils se distinguent d'une transcription automatique par trois choses : la découpe en unités de sens plutôt qu'en lignes, la synchronisation fine avec le débit, et un traitement typographique lisible sur petit écran.
Sur les formats verticaux, où une grande partie de la lecture se fait sans le son, ils conditionnent la compréhension. Leur conception est détaillée sur la page sous-titres de podcast.
Exemple concret
Sur un extrait de trente secondes, les sous-titres affichent trois à quatre mots à la fois, avec le mot clé de la phrase mis en couleur au moment où il est prononcé.