Introdução ao Phi Silica

Importante

As APIs do Phi Silica fazem parte de um recurso de acesso limitado (consulte a classe LimitedAccessFeatures). Para obter mais informações ou solicitar um token de desbloqueio, use o Formulário de solicitação de token de acesso LAF.

Importante

A Phi Silica está a ser substituída pelo Aion Instruct, um novo modelo integrado no dispositivo. Comece a planear a sua transição agora:

Início de outubro de 2026 — Pacote portátil independente disponível para testes e treino LoRA. Descarregue o pacote, valide o Aion Instruct para a sua aplicação e volte a treinar as suas LoRAs usando o Foundry Toolkit.

Outubro de 2026 — O Aion Instruct começa a ser implementado nos dispositivos Windows Insider Preview. A Phi Silica mantém-se presente; o modelo ativo é controlado por um Windows Controlled Feature Rollout (CFR). Os programadores podem testar lado a lado através de uma chave de registo do Windows.

Novembro de 2026 — O Aion Instruct é lançado nos dispositivos de retalho e a Phi Silica é removida.

A Phi Silica é um poderoso modelo de linguagem local acelerado por hardware que oferece muitas funcionalidades encontradas em Grandes Modelos de Linguagem (LLMs). Em dispositivos equipados com NPU, o modelo utiliza uma técnica chamada decodificação especulativa para acelerar a geração de texto usando um modelo de rascunho mais pequeno que pode propor múltiplas sequências de tokens e ser validado em paralelo pelo modelo principal.

Observação

Os recursos da Phi Silica não estão disponíveis na China.

A Phi Silica está otimizada para eficiência e desempenho em Windows Copilot+ PCs (onde corre na NPU) e em dispositivos Windows 11 não-Copilot+ com uma GPU suportada, podendo ser integrada nas suas aplicações Windows através das APIs de IA Windows no SDK de Aplicações Windows.

Este nível de otimização não está disponível em outras versões do Phi.

Hardware suportado

A Phi Silica corre no seguinte hardware:

Hardware Situação Detalhes
NPU (Copilot+ PC) ✅ Disponível Melhor desempenho. Consulte Copilot+ PCs guia para desenvolvedores.
GPU — NVIDIA ✅ Disponível GeForce RTX série 30 e mais recentes com 6+ GB de vRAM.
GPU — AMD ✅ Disponível Radeon RX série 9060 e mais recentes com 6+ GB de vRAM.

Para requisitos de drivers de GPU, consulte requisitos de drivers de GPU.

Importante

Correr Phi Silica na GPU requer ativar o Modo Desenvolvedor . Vai a Definições>Sistema>para>programadores Modo Desenvolvedor.

Pré-requisitos para GPU:

  • Windows build: Programa Windows Insider Experimental Channel, build 26300.8553 ou posterior
  • SDK de Aplicações Windows: Versão 2.2.2-experimental9 (junho de 2026 Experimental) ou posterior

Requisitos do driver da GPU

Executar Phi Silica na GPU requer o controlador mais recente instalado diretamente a partir do fabricante da GPU. Os drivers predefinidos do Windows Update ou das instalações OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.

Descarregue o driver mais recente para o seu hardware:

Observação

Os drivers fornecidos por OEM (entregues através do Windows Update ou da ferramenta de atualização do fabricante do seu PC) podem sobrescrever os drivers IHV que instalou anteriormente. Se a Phi Silica deixar de funcionar na GPU após uma atualização do sistema, reinstale o driver mais recente dos links acima.

Diferenças nas funcionalidades da GPU

As seguintes funcionalidades comportam-se de forma diferente na GPU em comparação com a NPU:

  • Compressão de prompts: Disponível na NPU, mas não na GPU. As aplicações que dependem da compressão de prompts para janelas de contexto maiores devem ter isso em conta ao direcionar para dispositivos com GPU.
  • Decodificação especulativa: Disponível na NPU para geração acelerada de texto. Atualmente não está disponível na GPU, o que pode resultar numa taxa de transferência de tokens por segundo mais baixa.
  • Ajuste fino de LoRA: Os adaptadores LoRA devem ser treinados na cloud usando o Fine-Tuning Kit (FTK). A inferência com o seu adaptador treinado pode ser testada localmente usando a AI Dev Gallery. Este fluxo de trabalho é o mesmo tanto para NPU como para GPU.

Disponibilidade de modelos e download

Ao contrário do modelo NPU — que está pré-instalado no Copilot+ PCs — o modelo Phi Silica para GPU é não pré-instalado no dispositivo do utilizador. Em vez disso, o modelo é descarregado sob demanda na primeira vez que a sua aplicação liga para o EnsureReadyAsync. O download tem vários gigabytes e corre em segundo plano através do Windows Update.

Como o modelo da GPU Phi Silica é grande, mostre um diálogo de confirmação antes de chamar EnsureReadyAsync para que o utilizador possa consentir tanto com o custo de armazenamento como com o download em segundo plano. Um padrão típico:

  1. Chame GetReadyState e aja em conformidade com o AIFeatureReadyState devolvido:

    • Ready — o modelo é instalado; Prossiga.
    • NotReady — mostrar o seu diálogo de consentimento (ver abaixo), e depois ligar EnsureReadyAsync apenas se o utilizador concordar.
    • NotSupportedOnCurrentSystem — o hardware do utilizador não cumpre os requisitos em hardware suportado. Ofereça uma experiência de recuo e, quando apropriado, exponha os requisitos de hardware para que o utilizador possa tomar uma decisão informada de atualização.
  2. No seu diálogo de consentimento, explique:

    • Será descarregado um modelo de linguagem opcional (vários GB de armazenamento).
    • O download acontece em segundo plano através do Windows Update.
    • O utilizador pode monitorizar o progresso do download em Settings>Windows Update.
    • O utilizador pode posteriormente remover o modelo em Configurações>de Componentes de IA> se já não o quiser.

    Sugestão

    Em cadeias dirigidas ao utilizador (texto de diálogo, mensagens de estado), refere-se ao modelo como "modelo de linguagem" ou "modelo de IA opcional" em vez de "Phi Silica". A maioria dos utilizadores finais não está familiarizada com o nome da marca, e os termos genéricos comunicam o propósito de forma mais clara.

  3. Enquanto EnsureReadyAsync estiver em progresso, mostre um indicador de progresso na sua aplicação. A operação devolvida expõe uma opção de estado que gera uma interface de carregamento; ver Comece com Windows APIs de IA para mais detalhes.

Após a instalação do modelo

O modelo permanece no dispositivo até que o utilizador o remova. Os utilizadores gerem os modelos instalados na Settings>System>AI Components, onde o modelo da GPU Phi Silica aparece como "AI LanguageModel". Se o utilizador remover posteriormente o modelo, a chamada seguinte da sua aplicação para GetReadyState devolve NotReady e o fluxo de consentimento + download deve ser repetido.

Para obter detalhes da API, consulte:

Integrar Phi Silica

Com um modelo de idioma Phi Silica local, você pode gerar respostas de texto para solicitações do usuário. Primeiro, certifique-se de ter os pré-requisitos e modelos disponíveis em seu dispositivo, conforme descrito em Introdução às APIs de IA do Windows.

Especifique os namespaces necessários

Para usar o Phi Silica, verifique se você está usando os namespaces necessários:

using Microsoft.Windows.AI;
using Microsoft.Windows.AI.ContentSafety;
using Microsoft.Windows.AI.Text;
#include "winrt/Microsoft.Windows.AI.Text.h"
using namespace Microsoft::Windows::AI;
using namespace Microsoft::Windows::AI::Text;

Gerar uma resposta

Este exemplo mostra como gerar uma resposta a um prompt de perguntas e respostas. O separador C# também demonstra como aplicar opções personalizadas de moderação de conteúdos (ver Moderação de Conteúdos com as APIs de IA do Windows).

  1. Verifique se o modelo de idioma está disponível chamando o método GetReadyState e aguardando que o método EnsureReadyAsync retorne com êxito.

  2. Quando o modelo de linguagem estiver disponível, crie um objeto LanguageModel para fazer referência a ele.

  3. Envie um prompt de cadeia de caracteres para o modelo usando o método GenerateResponseAsync , que retorna o resultado completo.

if (LanguageModel.GetReadyState() == AIFeatureReadyState.NotReady) 
{ 
   var op = await LanguageModel.EnsureReadyAsync(); 
} 

using LanguageModel languageModel = await LanguageModel.CreateAsync();

string prompt = "Provide the molecular formula for glucose.";

LanguageModelOptions options = new LanguageModelOptions();
ContentFilterOptions filterOptions = new ContentFilterOptions();
filterOptions.PromptMaxAllowedSeverityLevel.Violent = SeverityLevel.Minimum;
options.ContentFilterOptions = filterOptions;

var result = await languageModel.GenerateResponseAsync(prompt, options);
 
Console.WriteLine(result.Text);
if (LanguageModel::GetReadyState() == AIFeatureReadyState::NotReady)
{
    auto op = LanguageModel::EnsureReadyAsync().get();
}

auto languageModel = LanguageModel::CreateAsync().get();

const winrt::hstring prompt = L"Provide the molecular formula for glucose.";

LanguageModelResponseResult result = languageModel.GenerateResponseAsync(prompt).get();
std::cout << result.Text().c_str() << std::endl;

A resposta gerada por este exemplo é:

C6H12O6

Habilidades de Inteligência de Texto

O Phi Silica inclui recursos integrados de transformação de texto (conhecidos como Habilidades de Inteligência de Texto) que podem fornecer respostas estruturadas, concisas e fáceis de usar por meio de formatação predefinida usando um modelo de idioma local.

As competências apoiadas incluem:

  • Conversão de texto em tabela: formata a resposta de prompt em um formato de tabela estruturada, quando apropriado.
  • Resumir: retorna um resumo conciso do texto do prompt.
  • Reescrever: reformula o texto do prompt para otimizar a clareza, a legibilidade e, quando especificado, o tom (ou estilo).

As etapas a seguir descrevem como usar as habilidades de inteligência de texto.

  1. Criar um objeto LanguageModel
    Este objeto faz referência ao modelo de linguagem Phi Silica local (lembre-se de confirmar que o modelo Phi Silica está disponível no dispositivo).

  2. Instanciar o objeto específico relativo à habilidade
    Escolha a classe apropriada com base na habilidade que você deseja aplicar e passe a instância LanguageModel como um parâmetro.

  3. Invoque o método para executar a competência
    Cada habilidade expõe um método assíncrono que processa a entrada e retorna um resultado formatado.

  4. Manipular a resposta
    O resultado é devolvido como um objeto tipado, que pode imprimir ou registar conforme necessário.

Este exemplo demonstra a habilidade de resumo de texto.

  1. Crie uma instância de LanguageModel (languageModel).
  2. Passe esse LanguageModel para o construtor TextSummarizer .
  3. Passe algum texto para o método SummarizeAsync e imprima o resultado.
using Microsoft.Windows.AI.Text;

using LanguageModel languageModel = await LanguageModel.CreateAsync();

var textSummarizer = new TextSummarizer(languageModel);
string text = @"This is a large amount of text I want to have summarized.";
var result = await textSummarizer.SummarizeAsync(text);

Console.WriteLine(result.Text); 
using namespace Microsoft::Windows::AI::Text;

auto languageModel = LanguageModel::CreateAsync().get();
auto textSummarizer = TextSummarizer(languageModel);
std::string prompt = "This is a large amount of text I want to have summarized.";
auto result = textSummarizer.SummarizeAsync(prompt);

std::wcout << result.get().Text() << std::endl;

IA responsável

Seguimos os princípios e práticas fundamentais descritos nos Microsoft Responsible AI Standards para garantir que estas APIs são fiáveis, seguras e construídas de forma responsável. Para mais detalhes sobre a implementação de funcionalidades de IA na sua aplicação, consulte Desenvolvimento Responsável de IA Generativa no Windows.

Notas sobre a transparência da GPU

Para obter informações detalhadas sobre as capacidades, limitações e utilização responsável do Phi Silica em PCs não Copilot+ (GPU), consulte a Nota de Transparência: Phi Silica em PCs não Copilot+.

Principais diferenças entre a execução da NPU e da GPU:

Fator Copilot+ PCs (NPU) PCs sem Copilot+ (GPU)
Latência de Inferência Otimizado; baixa latência através de aceleração por NPU e decodificação especulativa Maior latência; depende da geração da GPU, VRAM e carga atual da GPU
Consumo de energia A NPU é eficiente em termos energéticos, adequada para uso alimentado por baterias Maior consumo de energia; Pode afetar a duração da bateria nos portáteis
Compressão de prompts ✅ Disponível ❌ Não disponível na GPU
Decodificação Especulativa ✅ Disponível ❌ Não disponível na GPU
Opcionalidade de Modelo O modelo é gerido pelo sistema O modelo é transferido a pedido e pode ser removido em Definições>Sistema>Componentes de IA
Fatores Operacionais para PCs sem Copilot+
  • Diversidade de hardware: Os não-Copilot+ PCs abrangem uma vasta gama de configurações de GPU. O desempenho varia significativamente ao longo deste espectro de dispositivos.
  • Requisitos mínimos de hardware: Os dispositivos devem cumprir os requisitos mínimos de GPU e memória para executar Phi Silica.
  • Dependências de software: A execução não-Copilot+ PC requer o driver mais recente da GPU IHV instalado diretamente pelo fabricante da GPU (NVIDIA). Os drivers predefinidos do Windows Update ou das instalações OEM podem não ser suficientes e podem causar falhas ou desempenho degradado.

Desempenho do sistema

Compreender o desempenho em PCs sem Copilot+

A qualidade dos resultados da Phi Silica (precisão, coerência, relevância) é consistente nos PCs Copilot+ e nos PCs sem Copilot+, porque são utilizados os mesmos pesos e a mesma arquitetura do modelo. As principais diferenças estão na velocidade de inferência, no consumo de recursos e na capacidade de resposta da experiência do utilizador.

Os desenvolvedores devem:

  • Avaliação comparativa em hardware representativo: Efetue testes numa variedade de dispositivos não Copilot+ que reflitam a sua base de utilizadores pretendida, incluindo configurações mais modestas.
  • Defina as expectativas do utilizador: Comunique claramente que os tempos de resposta podem variar consoante o hardware do dispositivo. Considere mostrar indicadores de progresso ou transmitir resultados parciais.
  • Implemente tempos de espera e alternativas de contingência: Para cenários em que o tempo de resposta é crítico, implemente tempos de espera adequados e considere oferecer alternativas baseadas na nuvem (com o consentimento do utilizador).
  • Monitorizar o uso de recursos: Monitorizar a utilização da GPU, o consumo de VRAM e o uso de memória do sistema durante a inferência para identificar e corrigir gargalos de desempenho.

Ver também