Genie Code mit AI Runtime verwenden

Important

Dieses Feature befindet sich in der Public Preview.

Genie Code hilft Ihnen, Deep-Learning-Workloads in Notebooks zu entwickeln und zu beheben, die mit AI Runtime verbunden sind. Es kann verteilten Trainingscode generieren, Umwelt- und Abhängigkeitsprobleme lösen und GPU-Workload-Ausfälle untersuchen.

Genie Code erstellt und führt eine verteilte CNN-Trainingsarbeitslast über acht H100-GPUs in einem KI-Runtime-Notebook aus.

Requirements

Um Genie Code mit KI-Laufzeit zu verwenden:

Erste Schritte

  1. Öffnen Sie ein Azure Databricks-Notebook.

  2. Verbinden Sie das Notizbuch mit AI Runtime. Siehe Connect to AI Runtime.

  3. Öffne den Genie-Code-Fenster.

  4. Beschreiben Sie die Arbeitsbelastung, die Sie entwickeln möchten, oder das Problem, das Sie lösen möchten.

  5. Überprüfen Sie den vorgeschlagenen Plan, die Änderungen des Kodex und die Maßnahmen, bevor Sie sie genehmigen.

    Important

    Der Genie-Code kann Fehler machen. Überprüfen Sie generierten Code, Umgebungsänderungen und andere vorgeschlagene Aktionen, bevor Sie sie ausführen. Für einige Diagnosen sind zusätzliche Logs oder Kontext zur Arbeitsauslastung erforderlich.

Wozu kann Genie Code beitragen?

Entwicklung verteilter Trainingsworkloads

Genie Code kann Trainingscode für AI Runtime generieren oder aktualisieren. Es kann Ihnen helfen, eine geeignete PyTorch-verteilte Strategie auszuwählen, die @distributed API aus dem serverless_gpu Paket zu nutzen und KI-Laufzeitmuster für Datenlade, Checkpoints und MLflow-Tracking anzuwenden. API-Details und Beispiele finden Sie unter Verteiltes Training in Notebooks.

Umwelt- und Abhängigkeitsprobleme lösen

Genie Code kann die aktuelle Umgebung inspizieren, Paketkompatibilitätsfehler von Code- oder API-Änderungen unterscheiden und gezielte Korrekturen empfehlen. Es kann Ihnen auch helfen, zwischen der Databricks-KI- und Standardumgebung basierend auf den Abhängigkeiten Ihrer Arbeitslast zu wählen. Informationen zu den verfügbaren Umgebungen finden Sie unter Einrichten Ihrer Umgebung.

GPU und verteilte Workloads debuggen

Genie Code kann Notebook-Ausgabe und verfügbare Logs nutzen, um verteilte Trainingsfehler, Kommunikationsfehler, hängengebliebene Trainingsprozesse und GPU-Speicherprobleme zu untersuchen. Es kann helfen, den ursprünglichen Fehler zu identifizieren und ihn von nachgelagerten Fehlern bei anderen Rängen zu unterscheiden. Informationen zum Betrachten verteilter Trainingsprotokolle finden Sie unter Experiment-Tracking und Observabilität.

Beispiel-Prompts

Entwicklung verteilter Trainingsworkloads

  • "Aktualisieren Sie dieses Notebook, um verteiltes Training auf allen acht H100-GPUs in AI Runtime auszuführen."
  • Überprüfe dieses Notebook für verteiltes Training und korrigiere die Verwendung von serverless_gpu und MLflow.
  • "Passe diese Trainingsarbeit für AI Runtime an und erkläre die wichtigen Änderungen."

Umwelt- und Abhängigkeitsprobleme lösen

  • "Dieses Notizbuch funktioniert nicht mehr, nachdem ich ein neues Paket installiert habe. Inspizieren Sie die Umgebung und stellen Sie fest, ob das Problem ein Abhängigkeitsproblem oder eine Änderung der Code-API ist."
  • "Sollte diese Arbeitslast die Databricks-KI oder die Standardumgebung verwenden? Überprüfe seine Abhängigkeiten und empfehle eine Umgebung, bevor du etwas änderst."
  • "Diagnostizieren Sie diesen Paketkompatibilitätsfehler und empfehlen Sie die kleinste geeignete Änderung."

GPU und verteilte Workloads debuggen

  • Analysiere diesen fehlgeschlagenen verteilten Trainingslauf anhand der verfügbaren Ausgaben aller Ränge und identifiziere die Grundursache.
  • "Warum hängt diese verteilte Arbeitslast? Nutze die Ausgabe des Notizbuchs, um den nächsten Debugging-Schritt zu empfehlen."
  • "Untersuche diesen GPU-Speicherausfall und empfehle einen evidenzbasierten nächsten Schritt."

Weitere Ressourcen