NVIDIA DIN Deploy: Open-Source-Samples bringen lokale KI auf Windows und Linux

Das Entwicklerpaket bündelt plattformübergreifende C++-Beispiele, mehrere KI-Anwendungen und einen dokumentierten GPU-CPU-Leistungsvergleich.

•

NVIDIA hat die Sammlung „Do Inference Now (DIN) Deploy“ als Open Source veröffentlicht. Das Paket enthält C++-Samples, die ONNX Runtime mit dem NVIDIA TensorRT RTX Execution Provider kombinieren und sowohl unter Windows als auch unter Linux mit identischer API über WinML 2.0 lauffähig sind, wie unter anderem nvidia.com und aidailypost.com berichteten.

Vom Checkpoint zur lauffähigen Anwendung

Kern des Angebots ist ein Workflow, der den Weg von einem trainierten Modell bis zur einsatzfähigen Anwendung verkürzen soll, ohne dass dafür eine modellspezifische Runtime notwendig ist. Ein Python-Exporter lädt dafür Checkpoints von Hugging Face und wandelt sie in das ONNX-Format um.

Die eigentliche Ausführung übernimmt anschließend eine native C++-Kommandozeilenanwendung, die auf den Session- und Tensor-APIs von ONNX Runtime aufsetzt. Laut aidailypost.com schließen die Samples damit eine Lücke in der lokalen KI-Entwicklung.

CUDA-spezifischer Code kommt dabei nur in optionalen, beschleunigten Pfaden zum Einsatz – die Grundarchitektur bleibt plattformunabhängig. Für den Build stehen CMake-Presets für Windows und Linux bereit, inklusive Unterstützung für Arm64. DirectX-Funktionalität ist dabei ausschließlich unter Windows verfügbar.

Beispielanwendungen aus mehreren KI-Domänen

Das DIN-Deploy-Paket umfasst konkrete Beispiele aus unterschiedlichen Bereichen der KI-Verarbeitung. Für Spracherkennung (ASR) liefert NVIDIA Samples zu OpenAI Whisper für den Offline-Betrieb sowie zu den eigenen Modellen Parakeet TDT und Nemotron ASR Streaming für Streaming-Anwendungen.

Anzeige

Wer KI-Systeme professionell entwickelt oder einsetzt, muss nicht nur technische, sondern auch neue regulatorische Hürden wie den EU AI Act meistern. Dieser kostenlose Umsetzungsleitfaden bietet Ihnen einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen für Unternehmen. EU AI Act in 5 Schritten verstehen

Im Bereich Bild- und Videoverarbeitung setzt die Sammlung auf Meta SAM 2.1 für interaktives Masking. Für die promptbasierte Bildgenerierung dient das Modell FLUX.2-klein-4B, das über eine Vulkan- und DirectX-Interop-Schnittstelle angebunden ist.

Laut aidailypost.com nutzt das FLUX.2-Sample dabei eine neuere Funktion der Graphics-Interop von ONNX Runtime. Zusätzlich erzeugt eine Post-Training-Quantisierung mit dem NVIDIA Model Optimizer ein quantisiertes ONNX-Modell, das sich ohne Codeänderung als Drop-in-Ersatz einsetzen lässt.

Leistungsvergleich auf DGX Spark

NVIDIA stellt in der Dokumentation eine Tabelle bereit, die GPU- gegenüber CPU-Performance für ausgewählte DIN-Deploy-Workloads auf der eigenen DGX-Spark-Plattform vergleicht. Konkrete Leistungswerte werden damit für Entwickler nachvollziehbar, die abschätzen wollen, welche Beschleunigungsgewinne sich beim Wechsel von CPU- auf GPU-Inferenz ergeben.

Anzeige

Die rechtssichere Implementierung von KI-Modellen wirft oft Fragen zur Einstufung von Risikoklassen auf, die über die reine Rechenleistung hinausgehen. Erfahren Sie in diesem kostenlosen Report, welche Systeme als Hochrisiko gelten und wie Sie die Compliance in Ihrer IT-Abteilung sicherstellen. Kostenlosen Report zu KI-Risikoklassen anfordern

Einordnung für Entwickler

Mit der Kombination aus plattformübergreifender API, Beispielen für mehrere gängige KI-Aufgaben und einem klaren Pfad vom Hugging-Face-Checkpoint zur lauffähigen Anwendung richtet sich das Paket an Entwickler, die KI-Modelle lokal – also ohne Cloud-Anbindung – auf Windows- und Linux-Systemen integrieren wollen.

Die Trennung zwischen plattformunabhängigem Kernpfad und optionalen CUDA-beschleunigten Routinen erlaubt es, dieselbe Codebasis auf unterschiedlicher Hardware einzusetzen, während leistungsstärkere NVIDIA-GPUs über die beschleunigten Pfade zusätzliche Performance liefern können.