Wie wir arbeiten
Ein kontrollierter Workflow von der Übernahme bis zur Auslieferung — dokumentiert, überprüfbar und auf schwieriges Archivmaterial ausgerichtet.
Schwieriges Archivmaterial lässt sich nicht in einem einzelnen Verarbeitungsschritt zuverlässig erschließen. R2 Mechanics verbindet Quellensicherung, unabhängige Transkriptions- und Sprecheranalysen, fachliche Prüfung und strukturierte Auslieferung in einem nachvollziehbaren Workflow.
So entsteht aus dem ursprünglichen Audiomaterial ein validiertes und strukturiertes Ergebnis.
Schritt 1
Vor Beginn definieren wir Ausgangsmaterial, Anforderungen an die Handhabung, Vertraulichkeit, gewünschte Ausgaben und Projektumfang.
Jedes Projekt beginnt mit einem dokumentierten Umfang, der Verarbeitung und erwartete Ergebnisse eindeutig festlegt.
Schritt 2
Vom Ausgangsmaterial wird eine kontrollierte Arbeitskopie erstellt. Das Original bleibt unverändert und dient während des gesamten Projekts als Referenzquelle.
Arbeitskopien und Verarbeitungsschritte bleiben dokumentiert und nachvollziehbar.
Schritt 3
Das Material wird über mehrere unabhängige Transkriptions-, Alignment- und Sprecheranalyseverfahren untersucht. Jeder Analyseweg liefert Evidenz für das Gesamtergebnis und wird nicht automatisch als korrekt vorausgesetzt.
Übereinstimmungen zwischen unabhängigen Analysewegen stärken das Ergebnis. Abweichungen kennzeichnen Passagen, die gezielt geprüft werden und im Verarbeitungsprotokoll nachvollziehbar bleiben.
Die Sprecherzuordnung wird als eigenständige Analyse behandelt und nicht lediglich aus der Spracherkennung abgeleitet.
Diagnostische Ansichten machen schwierige Bereiche einer Aufnahme bereits früh im Workflow sichtbar. Zusätzliche Audioaufbereitung, erneute Analyse und menschliche Prüfung können dadurch gezielt auf die Passagen konzentriert werden, die sie tatsächlich benötigen.
Schritt 4
Die Ergebnisse der unabhängigen Analysewege werden miteinander verglichen und fachlich geprüft. Das am stärksten gestützte Ergebnis wird als validierte Projektgrundlage ausgewählt.
Die Auswahl bleibt nachvollziehbar und mit den zugrunde liegenden Analyse- und Verarbeitungsschritten verknüpft.
Schritt 5
Das validierte Transkript wird in strukturierte, navigierbare Projektausgaben mit Zeitmarken, Sprecherzuordnung und den vereinbarten Ausgabeformaten überführt. Ist eine redaktionelle Aufbereitung vorgesehen, erfolgt sie als getrennte Ebene. Die quellennah dokumentierte Ausgangsfassung bleibt unverändert erhalten.
Quellennahe und redaktionell bearbeitete Fassungen bleiben klar getrennt und über ihre Versionen miteinander verknüpft.
Architektur
R2 Mechanics behandelt Audio und Video als navigierbare Evidenz-Zeitachse und reduziert die Quelle nicht auf ein einzelnes Transkript. Das Original bleibt die Referenz. Sprecher-, Sprach- und Transkriptionsevidenz werden zuerst auf einer Zeitachse abgebildet; alles Optionale kommt darauf auf, nie an ihrer Stelle.
Sprecherbereiche, Sprachbereiche und die Herkunft des ausgewählten Textes werden entlang der Original-Zeitachse abgebildet, ebenso Passagen, die eine Prüfung verdienen. Jede Passage führt auf die genaue Stelle in der Quelle zurück.
Bei langen, mehrsprachigen oder schwer transkribierbaren Aufnahmen machen visuelle Maps diese Struktur auf einen Blick sichtbar. Prüfhinweise sind Navigationshilfen für menschliche Prüfer, keine Aussage über Korrektheit.
Mehrere unabhängige Transkriptionsperspektiven können auf dasselbe Material angewendet werden. Unterschiede werden verglichen und nachvollziehbar behandelt, und die Herkunft des ausgewählten Textes kann erhalten bleiben.
Schwierige Passagen müssen nicht unsichtbar im Endtext verschwinden.
Mehrere Sprachen in einer Aufnahme, auch bei schnellen Wechseln, werden auf einer Sprach-Zeitachse mit Sprachfiltern strukturiert. Für mehrsprachiges Material gibt es spezialisierte Workflows.
Die Übersetzung ist eine optionale, abgeleitete Zugangsebene. Das Transkript in der Quellsprache bleibt als Referenz erhalten, und im Archiv kann zwischen Quellsprach- und übersetzter Ansicht umgeschaltet werden.
Vorhandene Transkripte, PDFs, Scans und Archivdokumente können textuell erschlossen und bei Bedarf in einem unterstützenden Workflow per OCR verarbeitet werden. Der Vergleich mit dem medienbasierten Transkript kann Prüfung, Alignment und das Erkennen von Abweichungen unterstützen.
Originale Referenzdokumente bleiben unverändert; extrahierter oder per OCR gewonnener Text wird als abgeleitete Arbeitsrepräsentation behandelt. Die Medienquelle bleibt die primäre Referenz, und nichts im Transkript wird automatisch überschrieben. Dieser Zweig ist optional.
Kapitel, Zusammenfassungen, Entitäten, Kontexthinweise oder eine fokussierte Analyse können ergänzt werden, wenn ein Workflow sie verlangt.
Quellevidenz und Interpretation bleiben getrennt: Die LLM-Ebene ist nicht die Quelle des Transkripts und keine Quellautorität.
Für schnellen Zugang zu einer Aufnahme: synchronisierter Player, Transkript und Navigation, mit optionaler fokussierter Zusammenfassung und ohne die volle redaktionelle Kaskade.
Übersprungen wird die erweiterte optionale Analyse, nicht die Evidenz-Zeitachse. Die für das Material verfügbaren Maps und die Navigation bleiben nutzbar.
Unser Grundsatz
Die dokumentierte Grundlage steht an erster Stelle. Redaktion, Präsentation und Publikationsfassungen bauen darauf auf, ohne sie zu ersetzen.
Gemischtsprachige Aufnahmen erfordern mehr als mehrsprachige Spracherkennung. Sprecherwechsel, Sprachübergänge, Code-Switching und Aufnahmequalität müssen gemeinsam ausgewertet werden, damit die Struktur der Quelle erhalten bleibt.
Bei mehrsprachigen und gemischtsprachigen Sammlungen wird die Verarbeitungsstrategie an die tatsächlichen Sprach-, Sprecher- und Aufnahmebedingungen angepasst. Wir passen die Analyse an das Material an — nicht das Material an die Analyse.