Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
O Foundry Local é uma solução de IA local de ponta a ponta para aplicativos de envio que são executados inteiramente em seu dispositivo. Use o Foundry Local quando quiser executar a IA localmente, trabalhar offline, minimizar a latência ou manter os dados privados. Ele fornece um SDK fácil de usar (C#, JavaScript, Rust e Python), um catálogo de modelos otimizados e aceleração automática de hardware, tudo em um pacote leve.
Seus dados nunca saem do dispositivo, as respostas começam imediatamente com zero latência de rede e seu aplicativo funciona offline. Não há custos por token e nenhuma infraestrutura de back-end a ser mantida.
O Foundry Local é executado nos próprios dispositivos dos usuários, portanto, seu aplicativo funciona offline e você não precisa de uma assinatura Azure. Se você precisar de inferência de IA em escala empresarial em sua própria infraestrutura com operações nativas do Kubernetes e gerenciamento de Azure Arc, consulte Foundry Local no Azure Local.
Características
Runtime leve – o runtime lida com aquisição de modelo, aceleração de hardware, gerenciamento de modelos e inferência (via ONNX Runtime). O runtime adiciona aproximadamente 20 MB ao pacote de aplicativos, tornando prático inserir a IA diretamente em aplicativos em que o tamanho é importante.
Catálogo selecionado de modelos — modelos de alta qualidade otimizados para execução no dispositivo em uma ampla variedade de hardware de consumo. O catálogo abrange sistemas de autocompletamento de chat (por exemplo, GPT OSS, Qwen, DeepSeek, Mistral e Phi) e transcrição de áudio (por exemplo, Whisper). Cada modelo passa por ampla quantização e compactação para proporcionar o melhor equilíbrio de qualidade e desempenho. Os modelos são versionados, de modo que seu aplicativo pode fixar-se em uma versão específica ou receber atualizações automaticamente.
Aceleração automática de hardware — o Foundry Local detecta o hardware disponível em seu dispositivo e seleciona o melhor provedor de execução. Ele acelera a inferência em GPUs e NPUs quando disponíveis e recorre automaticamente à CPU, sem necessidade de código de detecção de hardware. As atualizações do provedor de execução e do driver são gerenciadas automaticamente para garantir o desempenho ideal em diferentes configurações de hardware.
Gerenciamento de modelo inteligente — o Foundry Local manipula todo o ciclo de vida dos modelos em seu dispositivo. Os modelos são baixados automaticamente no primeiro uso, são armazenados em cache localmente para lançamentos subsequentes instantâneos e a variante de melhor desempenho é selecionada para seu hardware específico.
API compatível com a OpenAI — suporta formatos de solicitação e resposta da OpenAI, incluindo o formato da API Responses da OpenAI. Se o seu aplicativo já usa o SDK do OpenAI, configure-o para utilizar um endpoint local do Foundry com mínimas alterações de código.
Servidor local opcional — um servidor Web compatível com OpenAI para atender modelos a vários processos, integrando-se a ferramentas como LangChain ou experimentando por meio de chamadas REST. Para a maioria dos cenários de aplicativo inserido, use o SDK diretamente – ele executa inferência em processo sem a sobrecarga de um servidor separado.
Motivação para IA no dispositivo
O Foundry Local é ideal para aplicativos que precisam:
- Mantenha dados confidenciais (áudio, texto, imagem e muito mais) em seu dispositivo.
- Operar em ambientes offline ou de conectividade limitada.
- Reduza os custos de inferência de nuvem por token.
- Forneça respostas de IA de baixa latência para interações em tempo real.
Escolha sua próxima etapa
| Eu quero... | Ir para |
|---|---|
| Criar meu primeiro aplicativo | Comece com o Foundry Local |
| Entender o runtime | Visão geral da arquitetura local do Foundry |
| Criar um chatbot | Criar um assistente de chat de vários turnos |
| Iniciar codificação | Usar conclusões de chat nativas |
Perguntas frequentes
O Foundry Local é um servidor Web e uma ferramenta da CLI?
Não. O Foundry Local é uma solução de IA local de ponta a ponta com a qual seu aplicativo é fornecido. Ele lida com aquisição de modelo, aceleração de hardware e inferência dentro do processo do aplicativo por meio do SDK. O servidor Web opcional e a CLI estão disponíveis para fluxos de trabalho de desenvolvimento, mas o produto principal é o runtime de IA local e o SDK que você integra diretamente ao seu aplicativo.
Por que o Foundry Local não dá suporte a todos os modelos disponíveis?
O Foundry Local foi projetado para distribuir aplicativos de produção, não para experimentações gerais com modelos. O catálogo de modelos é intencionalmente coletado para incluir modelos otimizados para cenários de aplicativo específicos. Os modelos são testados em uma ampla gama de hardware de consumo e são pequenos o suficiente para serem distribuídos aos usuários finais. Essa abordagem garante que todos os modelos do catálogo ofereçam um desempenho confiável quando inseridos em seu aplicativo, em vez de oferecer uma ampla seleção de modelos com comportamento imprevisível no dispositivo.
O Foundry Local pode ser executado em um servidor?
O Foundry Local é otimizado para dispositivos com restrição de hardware em que um único usuário acessa o modelo de cada vez. Embora você possa instalá-lo e executá-lo no hardware do servidor, ele não é projetado como um stack de inferência de servidor.
Runtimes orientados para servidor, como vLLM ou Triton Inference Server , são criados para cenários multiusuários– eles lidam com enfileiramento de solicitações simultâneas, envio contínuo em lote e compartilhamento eficiente de GPU em vários clientes simultâneos. O Foundry Local não fornece esses recursos. Em vez disso, concentra-se na inferência leve para um único usuário, com detecção automática de hardware, gerenciamento de cache KV e gestão do ciclo de vida do modelo, recursos que atendem às necessidades das aplicações cliente.
Se você precisar fornecer modelos a vários usuários simultâneos, use uma estrutura de inferência de servidor dedicada. Use o Foundry Local quando o modelo for executado no próprio dispositivo do usuário final.
O Foundry Local envia prompts ou saídas para Microsoft?
O Foundry Local executa a inferência inteiramente no dispositivo. Quando seu aplicativo envia instruções para um ponto de extremidade local do Foundry, as instruções e os resultados do modelo são processados localmente.
O Foundry Local ainda pode usar a rede para:
- Downloads de modelos e componentes—Na primeira vez que um modelo é executado, o Foundry Local baixa os arquivos do modelo e também pode baixar provedores de execução para o hardware do usuário.
- Diagnóstico opcional: se um usuário relatar um problema, ele poderá optar por compartilhar logs.
O uso do Foundry Local é regido pelos termos e licenças do produto que se aplicam ao software e aos modelos em uso. Se os termos permitirem que Microsoft coletem informações de diagnóstico, os detalhes serão descritos nesses termos e na Política de Privacidade Microsoft.
Uma assinatura Azure é necessária?
Não. O Foundry Local é executado inteiramente em hardware local. Nenhuma assinatura de Azure é necessária.
Quais plataformas têm suporte?
O Foundry Local dá suporte a Windows, macOS (silício da Apple) e Linux.