Sarvam Vision 2.1: KI-Modell verarbeitet Dokumente in 22 Sprachen

Sarvam bietet sein Dokumentenmodell per API an; weitere Benchmark-Prüfungen sind geplant.

•

Das indische Technologieunternehmen Sarvam hat mit der Einführung von Vision 2.1 eine neue Version seines KI-Modells vorgestellt, die auf die automatisierte Verarbeitung von Dokumenten spezialisiert ist.

Wie aus Berichten vom 24. und 25. September 2026 hervorgeht, ist das System darauf ausgelegt, strukturierte Daten aus komplexen Quellen wie Formularen, Tabellen und handschriftlichen Aufzeichnungen zu extrahieren. Ein wesentliches Merkmal der Aktualisierung ist die breite sprachliche Unterstützung: Neben Englisch deckt das Modell insgesamt 22 indische Sprachen ab.

Optimierte Verarbeitung von Handschrift und komplexen Strukturen

Die technologische Entwicklung zielt primär darauf ab, Informationen aus Dokumenten in ein maschinenlesbares Format zu überführen. Vision 2.1 adressiert dabei insbesondere die Herausforderungen, die bei der Digitalisierung von handschriftlichen Inhalten und der Interpretation von Tabellenlayouts entstehen.

Laut Unternehmensangaben lag ein besonderer Schwerpunkt bei der Verfeinerung des Modells auf der Reduzierung von sogenannten Halluzinationen – also der Generierung von fehlerhaften oder erfundenen Informationen durch die KI. Das Ziel sei eine konsistente und verlässliche Extraktion von Datenpunkten über verschiedene Dokumententypen hinweg.

Anzeige

Die automatisierte Verarbeitung von Dokumenten durch KI unterliegt in der EU strengen regulatorischen Vorgaben. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen des EU AI Acts. EU AI Act in 5 Schritten verstehen

In internen Leistungsvergleichen und standardisierten Tests konnte das Modell bereits hohe Ergebnisse erzielen. Auf dem sogenannten olmOCR-Benchmark erreichte Vision 2.1 einen Score von 87,3. Ein noch geringfügig höheres Ergebnis von 87,39 wurde auf dem unternehmenseigenen Indic-Benchmark verzeichnet.

Sarvam bezeichnet diese Werte als aktuellen Stand der Technik (State-of-the-Art) im Bereich der multimodalen Dokumentenverarbeitung für die unterstützten Sprachregionen.

Technologische Basis und Training mit synthetischen Datensätzen

Die Architektur von Vision 2.1 basiert auf einer Kombination aus einem Vision-Language-Modell und ergänzenden Systemen, die speziell für die Erkennung von Layouts und die korrekte Lesereihenfolge entwickelt wurden. Ein entscheidender Faktor für die Leistungsfähigkeit des Modells liegt in der Zusammensetzung der Trainingsdaten. Das Unternehmen nutzte hierfür eine Mischung aus realen Dokumenten und synthetisch generierten Inhalten.

Zum Einsatz kamen unter anderem gedruckte und handschriftliche Formulare sowie künstlich erzeugte Web-Formulare. Ein besonderer Ansatz beim Training war die Einbeziehung von Handschriften aus Videomaterial.

Anzeige

Während neue KI-Systeme die Datenextraktion revolutionieren, müssen Unternehmen gleichzeitig die damit verbundenen Compliance-Risiken im Blick behalten. Erfahren Sie in diesem kostenlosen Report, welche KI-Systeme als Hochrisiko eingestuft werden und was Verantwortliche jetzt konkret tun müssen. Kostenlosen Report zur KI-Verordnung herunterladen

Nach der initialen Trainingsphase wurde das Modell mittels Supervised Fine-Tuning weiter optimiert. Den Abschluss des Entwicklungsprozesses bildete ein Reinforcement-Learning-Verfahren, das mit verifizierbaren Belohnungen (Rewards) arbeitet, um die Genauigkeit der Ausgaben sicherzustellen.

Wirtschaftliche Verfügbarkeit und zukünftige Validierung

Für den kommerziellen Einsatz wurde eine Schnittstelle (API) bereitgestellt, die für den produktiven Betrieb in Unternehmen optimiert ist. In den Berichten vom September 2026 wurde hervorgehoben, dass die Nutzung des Modells kosteneffizienter gestaltet werden konnte als ursprünglich kalkuliert. Dies soll den Zugang zur automatisierten Dokumentenverarbeitung für eine breitere Basis an Anwendern im indischen Markt ermöglichen.

Trotz der bereits veröffentlichten Leistungsdaten plant das Unternehmen für die Zukunft weitere Validierungen. So sollen zusätzliche Tests auf dem olmOCR-Benchmark sowie auf dem OmniDocBench durchgeführt werden, um die Leistungsfähigkeit des Systems kontinuierlich zu dokumentieren und mit anderen Marktlösungen vergleichbar zu machen.

Die Entwicklung unterstreicht den Trend zur Lokalisierung von KI-Modellen für Regionen mit hoher sprachlicher Diversität und komplexen administrativen Dokumentenstrukturen.