Was ist Foundry Local?

Foundry Local ist eine end-to-End-lokale KI-Lösung zum Versand von Anwendungen, die vollständig auf Ihrem Gerät ausgeführt werden. Verwenden Sie Foundry Local, wenn Sie KI lokal ausführen möchten, offline arbeiten, Latenz minimieren oder Daten privat halten möchten. Es bietet ein benutzerfreundliches SDK (C#, JavaScript, Rust und Python), einen kuratierten Katalog optimierter Modelle und eine automatische Hardwarebeschleunigung – alles in einem einfachen Paket.

Ihre Daten lassen das Gerät nie verlassen, die Antworten beginnen sofort mit null Netzwerklatenz, und Ihre App funktioniert offline. Es gibt keine Kosten pro Token und keine Back-End-Infrastruktur, die verwaltet werden soll.

Foundry Local wird auf den eigenen Geräten Ihrer Benutzer ausgeführt, sodass Ihre App offline funktioniert und Sie kein Azure-Abonnement benötigen. Wenn Sie stattdessen ki-orientierte KI-Rückschlüsse auf Ihre eigene Infrastruktur mit Kubernetes-nativen Vorgängen und Azure Arc Management benötigen, lesen Sie "Foundry Local on Azure Local".

Funktionen

  • Leichtgewichtige Laufzeit – Die Laufzeit übernimmt die Modellbeschaffung, Hardwarebeschleunigung, Modellverwaltung und Inferenz (über ONNX Runtime). Die Laufzeit fügt Ihrem Anwendungspaket ca. 20 MB hinzu, wodurch es praktisch ist, KI direkt in Anwendungen einzubetten, bei denen größe wichtig ist.

  • Kuratierter Modellkatalog – Ein Katalog mit hochwertigen Modellen, die für die Verwendung auf dem Gerät optimiert sind, über eine breite Palette von Consumerhardware hinweg. Der Katalog umfasst Chatabschlusse (z. B. GPT OSS, Qwen, DeepSeek, Mistral und Phi) und Audiotranskription (z. B. Whisper). Jedes Modell durchläuft umfangreiche Quantisierung und Komprimierung, um das beste Gleichgewicht zwischen Qualität und Leistung zu erzielen. Modelle sind versioniert, sodass Ihre Anwendung auf eine bestimmte Version festgelegt werden kann oder automatisch Updates erhält.

  • Automatische Hardwarebeschleunigung – Foundry Local erkennt die auf Ihrem Gerät verfügbare Hardware und wählt den besten Ausführungsanbieter aus. Sie beschleunigt die Rückschlüsse auf GPUs und NPUs, wenn sie verfügbar sind, und greift nahtlos auf die CPU zurück – kein Hardwareerkennungscode erforderlich. Ausführungsanbieter- und Treiberupdates werden automatisch verwaltet, um eine optimale Leistung in verschiedenen Hardwarekonfigurationen sicherzustellen.

  • Intelligente Modellverwaltung – Foundry Local behandelt den vollständigen Lebenszyklus von Modellen auf Ihrem Gerät. Modelle werden bei der ersten Verwendung automatisch heruntergeladen, für sofortige nachfolgende Starts lokal zwischengespeichert, und die leistungsstärkste Variante wird für Ihre spezifische Hardware ausgewählt.

  • OpenAI-kompatible API – Unterstützt OpenAI-Anforderungs- und Antwortformate, einschließlich des OpenAI-Antwort-API-Formats. Wenn Ihre Anwendung bereits das OpenAI SDK verwendet, richten Sie es auf einen lokalen Foundry-Endpunkt mit minimalen Codeänderungen.

  • Optionaler lokaler Server – Ein openAI-kompatibler Webserver für die Bereitstellung von Modellen für mehrere Prozesse, die Integration mit Tools wie LangChain oder das Experimentieren über REST-Aufrufe. Verwenden Sie für die meisten eingebetteten Anwendungsszenarien das SDK direkt – sie führt eine In-Process-Ableitung ohne den Aufwand eines separaten Servers aus.

Motivation für KI auf dem Gerät

Foundry Local ist ideal für Anwendungen, die:

  • Bewahren Sie vertrauliche Daten (Audio, Text, Bild und mehr) auf Ihrem Gerät auf.
  • Arbeiten Sie in eingeschränkten Konnektivitäts- oder Offlineumgebungen.
  • Reduzieren Sie die Kosten für die Cloud-Ableitung pro Token.
  • Liefern Sie KI-Antworten mit geringer Latenz für Echtzeitinteraktionen.

Auswählen des nächsten Schritts

Ich möchte... Gehe zu
Erstellen meiner ersten App Erste Schritte mit Foundry Local
Grundlegendes zur Laufzeit Übersicht über die lokale Architektur von Foundry
Erstellen eines Chatbots Erstellen eines Multi-Turn-Chat-Assistenten
Programmieren beginnen Verwenden von systemeigenen Chatabschlussen

Häufig gestellte Fragen

Ist Foundry Local ein Webserver- und CLI-Tool?

Nein. Foundry Local ist eine end-to-end lokale KI-Lösung , mit der Ihre Anwendung ausgeliefert wird. Sie verarbeitet Modellerfassung, Hardwarebeschleunigung und Inferenz innerhalb des App-Prozesses über das SDK. Der optionale Webserver und die CLI sind für Entwicklungsworkflows verfügbar, aber das Kernprodukt ist die lokale AI-Runtime und das SDK, die Sie direkt in Ihre Anwendung integrieren.

Warum unterstützt Foundry Local nicht jedes verfügbare Modell?

Foundry Local ist für Versandproduktionsanwendungen konzipiert, nicht für allgemeine Modellexperimente. Der Modellkatalog wird absichtlich zusammengestellt, um Modelle einzuschließen, die für bestimmte Anwendungsszenarien optimiert sind. Modelle werden auf einer Vielzahl von Consumer-Hardwarekonfigurationen getestet und sind klein genug, um an Endnutzer verteilt zu werden. Mit diesem Ansatz wird sichergestellt, dass jedes Modell im Katalog eine zuverlässige Leistung bietet, wenn sie in Ihre Anwendung eingebettet ist, anstatt eine breite Auswahl von Modellen mit unvorhersehbarem Verhalten auf dem Gerät anzubieten.

Kann Foundry Local auf einem Server ausgeführt werden?

Foundry Local ist für hardwarebeschränkte Geräte optimiert, bei denen ein einzelner Benutzer gleichzeitig auf das Modell zugreift. Sie können sie zwar technisch installieren und auf Serverhardware ausführen, sie ist jedoch nicht als Server-Ableitungsstapel konzipiert.

Serverorientierte Laufzeiten wie vLLM oder Triton Inference Server werden für Szenarien mit mehreren Benutzern entwickelt– sie verarbeiten gleichzeitige Anforderungswarteschlangen, kontinuierliche Batchverarbeitung und effiziente GPU-Freigabe über viele gleichzeitige Clients hinweg. Foundry Local bietet diese Funktionen nicht. Stattdessen konzentriert es sich auf einfache, einzelbenutzerinterne Ableitungen mit automatischer Hardwareerkennung, KV-Cache-Verwaltung und Modelllebenszyklusbehandlung, die für Clientanwendungen sinnvoll sind.

Wenn Sie Modelle für mehrere gleichzeitige Benutzer bereitstellen müssen, verwenden Sie ein dediziertes Server-Ableitungsframework. Verwenden Sie Foundry Local, wenn das Modell auf dem eigenen Gerät des Endbenutzers ausgeführt wird.

Sendet Foundry Local Eingabeaufforderungen oder Ausgaben an Microsoft?

Foundry Local führt die Rückschlüsse vollständig auf dem Gerät aus. Wenn Ihre Anwendung Aufforderungen an einen lokalen Endpunkt "Foundry Local" sendet, werden Aufforderungen und Modellausgaben lokal verarbeitet.

Foundry Local kann das Netzwerk weiterhin für Folgendes verwenden:

  • Modell- und Komponentendownloads – Wenn ein Modell zum ersten Mal ausgeführt wird, lädt Foundry Local die Modelldateien herunter und lädt möglicherweise auch Ausführungsanbieter für die Hardware des Benutzers herunter.
  • Optionale Diagnose – Wenn ein Benutzer ein Problem meldet, kann er sich für die Freigabe von Protokollen entscheiden.

Die Verwendung von Foundry Local unterliegt den Produktbedingungen und Lizenzen, die für die Software und die verwendeten Modelle gelten. Wenn die Bedingungen Microsoft das Sammeln von Diagnoseinformationen erlauben, werden die Details in diesen Bedingungen und in den datenschutzbestimmungen Microsoft beschrieben.

Ist ein Azure Abonnement erforderlich?

Nein. Foundry Local wird vollständig auf lokaler Hardware ausgeführt. Es ist kein Azure Abonnement erforderlich.

Welche Plattformen werden unterstützt?

Foundry Local unterstützt Windows, macOS (Apple Silicon) und Linux.