NVIDIA hat einen Patentantrag veröffentlicht, der einen konversationellen Assistenten beschreibt, der Fragen zur Leistung von Programmen beantworten kann, die auf einer GPU ausgeführt werden. Das System kombiniert Sprachmodelle, Profiling-Berichte und Analysetools, damit ein Entwickler in natürlicher Sprache formulieren kann, warum eine Last langsamer läuft als erwartet, wo der Engpass liegt oder was sich zwischen zwei Kernel-Versionen geändert hat.
Die Dokumentation bezieht sich auf den US-amerikanischen Antrag US20260277953A1. Sein Inhalt deckt sich eng mit den Funktionen, die NVIDIA bereits über Nsight Copilot innerhalb von Nsight Compute bereitstellt, auch wenn in der Patentanmeldung dieser Handelsname nicht verwendet wird. Es wird auch kein neues Produkt angekündigt oder garantiert, dass alle beschriebenen Varianten in der öffentlichen Software erscheinen werden.
Der Assistent erzeugt Code, um Leistungsberichte abzurufen
Der Vorschlag beginnt mit einer schriftlichen oder gesprochenen Frage und optional einem damit verbundenen Profilierungsergebnis. Ein Router entscheidet, ob die Abfrage einen allgemeinen Agenten erfordert, der auf Dokumentation und Konzepte zur GPU-Architektur ausgerichtet ist, oder einen spezialisierten Agenten für die Berichtsdatensätze. Dieser zweite Agent kann Skripte erstellen und ausführen, um ausschließlich die notwendigen Metriken zu extrahieren, bevor eine Antwort verfasst wird.
Der Antrag sieht eine Python-basierte Berichtsoberfläche, einen Belegungsrechner, mathematische Werkzeuge und einen Profiler vor. Das Modell generiert Code, führt ihn aus und nutzt das Ergebnis als Grundlage für die Analyse. Zu den Beispielen gehören Fragen zur Auslastung der GPU, Hotspots, Engpässe bei der Auslastung, Metriken pro Instruktion und Geschwindigkeitsunterschiede zwischen zwei Kernel-Versionen.
Der Profiler könnte sich auch automatisch öffnen, um fehlende Daten zu erfassen. Anschließend würde der Agent problematische Bereiche lokalisieren und Bibliotheksfunktionen oder verfügbare Programmiermerkmale vorschlagen, um den Kernel zu verbessern.
RAG, technische Dokumentation und mehrere spezialisierte Agenten
Um erfundene Antworten zu reduzieren, setzt das Design auf Retrieval-Augmented Generation, bekannt als RAG. Der Assistent kann Dokumentationen des Profilers, Programmierleitfäden, API-Referenzen und Informationen über die Architektur von GPUs abrufen. Außerdem sieht er Webrecherchen vor, wenn eine Abfrage externen Kontext erfordert.
Der Ablauf kann die Arbeit auf mehrere Agenten verteilen. Einer bearbeitet allgemeine Fragen, ein anderer interpretiert die Berichte, und ein Vorgesetzter wählt aus, wer eingreifen soll. Das System könnte die Erklärung an das Niveau des Benutzers anpassen, indem es Metriken für Anfänger definiert oder einem Spezialisten direkter antwortet.
Die Antworten könnten mit manuellen Referenzergebnissen verglichen werden, die mithilfe des Profilers erstellt wurden. Die aktuelle Nsight Copilot-Dokumentation weist darauf hin, dass ein Sprachmodell Fehler machen kann, und bittet darum, jede Empfehlung zu überprüfen, bevor Code geändert wird.
Vertrauliche Informationen können lokal analysiert werden
Einer der Abschnitte beschreibt die lokale Ausführung der generierten Skripte. Der Prozessor kann die Berichte lesen und verarbeiten, ohne diese Dateien vollständig an einen externen Dienst zu senden. Diese Möglichkeit ist besonders relevant, wenn das Profil Informationen über noch nicht veröffentlichte Codezeilen oder interne Unternehmenslasten enthält.
Nsight Copilot verlangt, den Bericht auf der Festplatte zu speichern, um ihn als Kontext beizufügen, und benötigt, dass der Quellcode während des Profilings importiert wurde, wenn die Fragen konkrete Zeilen betreffen. NVIDIA erklärt, dass bestimmte Metriken und Zusammenfassungen an das Modell gesendet werden, während die komplette Datei nicht geladen wird.
Der Patentantrag eröffnet die Möglichkeit lokaler, ferngesteuerter oder hybrider Konfigurationen. Er verweist auf gespeicherte Verlaufshistorien, mehrere parallele Sitzungen, Verweise auf die verwendeten Dokumente und die Möglichkeit, die erstellten Skripte aufzubewahren. Das sind Elemente, die in unterschiedlichem Umfang in der dokumentierten Schnittstelle von Nsight Copilot erscheinen.
Passt zu Nsight Compute und unterscheidet sich von G-Assist
NVIDIA vertreibt Nsight Compute als Profiling-Tool für CUDA und OptiX. Es sammelt Hardware-Metriken, verknüpft Speicherprobleme mit Codezeilen und vergleicht Ergebnisse zwischen Durchläufen oder Architekturen. Nsight Copilot ergänzt das Tool um einen Chat, der Berichte als Kontext akzeptiert und Metriken sowie mögliche Optimierungen erklärt.
Das System des Patentantrags teilt dieses Ziel und mehrere Interface-Details, wie schrittweise übermittelte Antworten, der Knopf zum Wiederholen einer Abfrage, positive oder negative Bewertungen und die Speicherung des Verlaufs. Der Antrag liefert die technische Beschreibung der Arbeit hinter dem Gespräch, einschließlich der Generierung von Skripten und der Aufteilung der Fragen auf verschiedene Agenten.
Sein Ziel unterscheidet sich vom Project G-Assist der NVIDIA-Anwendung für GeForce-Nutzer. G-Assist liefert Informationen zu FPS, Stromverbrauch, Frequenzen und Auslastung und kann zudem Grafikeinstellungen oder Systemprofile ändern. Der in der Patentanmeldung beschriebene Assistent arbeitet mit Code, Kernel-Daten und Profiling-Berichten, die sich an Entwickler richten.
Der Antrag befindet sich noch in Bearbeitung und verleiht ihm keine endgültigen Rechte noch bestätigt er zukünftige Funktionen. NVIDIA hat darüber hinaus kein weiteres Produkt, keinen Preis oder Zeitplan angekündigt, basierend auf diesem Antrag. Das Dokument erläutert, wie ein Gespräch in ausführbare Abfragen über reale Leistungsdaten umgewandelt werden kann, um spezifische Empfehlungen für eine bestimmte Last und eine konkrete GPU zu liefern.