Azure OpenAI API de Assistentes (Pré-visualização) (clássico)

Aplica-se apenas a:Portal Foundry (clássico). Este artigo não está disponível para o novo portal da Foundry. Saiba mais sobre o novo portal.

Nota

Os links neste artigo podem abrir conteúdo na nova documentação do Microsoft Foundry em vez da documentação do Foundry (clássico) que está a ver agora.

Nota

A API dos Assistentes está desativada. Use o serviço geralmente disponível Microsoft Foundry Agents. Para atualizar as suas cargas de trabalho, consulte o guia de migração. Saiba mais.

Os Assistentes, uma funcionalidade do Azure OpenAI nos Microsoft Foundry Models, foram concebidos para facilitar aos programadores a criação de aplicações com experiências sofisticadas semelhantes às de copilotos, capazes de analisar dados, sugerir soluções e automatizar tarefas.

  • Os assistentes podem chamar Azure models da OpenAI com instruções específicas para ajustar a sua personalidade e capacidades.
  • Os assistentes podem aceder a múltiplas ferramentas em paralelo. Podem ser tanto ferramentas hospedadas do Azure OpenAI como code interpreter e pesquisa de ficheiros, ou ferramentas que constróis, alojas e acedes através de chamadas de função.
  • Os assistentes podem aceder a Threads persistentes. Os threads simplificam o desenvolvimento de aplicações de IA ao armazenar o histórico de mensagens e truncá-lo quando a conversa se torna demasiado longa para o contexto do modelo. Crias um Thread uma vez e adicionas Mensagens a ele à medida que os teus utilizadores respondem.
  • Os assistentes podem aceder a ficheiros em vários formatos. Quer como parte da sua criação, quer como parte de Threads entre Assistentes e utilizadores. Ao utilizar ferramentas, os Assistentes também podem criar ficheiros (como imagens ou folhas de cálculo) e citar ficheiros que referenciam nas Mensagens que criam.

Visão geral

Anteriormente, construir assistentes de IA personalizados exigia um trabalho pesado mesmo para programadores experientes. Embora a API de completação de chat seja leve e poderosa, é inerentemente sem estado, o que significa que os programadores tiveram de gerir o estado da conversa e os threads de chat, integrações de ferramentas, recuperação de documentos e índices, e executar código manualmente.

A API dos Assistentes, enquanto evolução com estado da API de conclusão de chat, fornece uma solução para estes desafios. A API dos Assistentes suporta threads geridos automaticamente e persistentes. Isto significa que, como programador, já não precisa de desenvolver sistemas de gestão de estado de conversa nem de contornar as restrições da janela de contexto de um modelo. A API dos Assistentes gerirá automaticamente as otimizações para manter o thread abaixo da janela de contexto máximo do modelo escolhido. Depois de criar um Thread, pode adicionar novas mensagens à medida que os utilizadores respondem. Os assistentes também podem aceder a múltiplas ferramentas em paralelo, se necessário. Estas ferramentas incluem:

Dica

Não há preços ou quotas adicionais para usar Assistentes, a menos que utilize o interpretador de código ou ferramentas de pesquisa de ficheiros .

A API Assistants baseia-se nas mesmas capacidades que alimentam o produto GPT da OpenAI. Alguns possíveis casos de uso vão desde recomendador de produto alimentado por IA, aplicação de analista de vendas, assistente de programação, chatbot de perguntas e respostas com colaboradores, e muito mais. Começa a construir no playground no-code Assistants no portal Foundry ou começa a construir com a API.

Importante

Recuperar dados não confiáveis usando chamadas de função, Interpretador de Código ou pesquisa de ficheiros com entrada de dados, e funcionalidades de Threads do Assistente pode comprometer a segurança do seu Assistente ou da aplicação que o utiliza. Saiba aqui sobre abordagens de mitigação.

Utilização de assistentes

Para informações sobre a utilização de assistentes, consulte a seguinte documentação de referência.

Modelos disponíveis

Para ver uma lista de Azure modelos OpenAI que pode usar com assistentes, consulte o artigo Models.

Parque infantil dos assistentes

Antes de usar assistentes, precisa de:

Componentes de assistentes

Um diagrama que mostra os componentes de um assistente.

Componente Descrição
Assistente IA personalizada que utiliza modelos Azure OpenAI em conjunto com ferramentas.
Tópico Uma sessão de conversa entre um Assistente e um utilizador. Os Threads armazenam Mensagens e tratam automaticamente o truncamento para encaixar o conteúdo no contexto de um modelo.
Mensagem Uma mensagem criada por um Assistente ou um utilizador. As mensagens podem incluir texto, imagens e outros ficheiros. As mensagens são armazenadas como uma lista na Thread.
Corre Ativação de um Assistente para iniciar a execução com base no conteúdo do Tópico. O Assistente utiliza a sua configuração e as Mensagens do Thread para realizar tarefas, chamando modelos e ferramentas. Como parte de uma execução, o Assistente acrescenta mensagens ao thread.
Executar Passo Uma lista detalhada dos passos que o Assistente deu como parte de uma Corrida. Um Assistente pode chamar ferramentas ou criar Mensagens durante a execução. Examinar os passos de execução permite compreender como o Assistente está a alcançar os seus resultados finais.

Acesso a dados dos assistentes

Atualmente, assistentes, threads, mensagens e ficheiros criados para Assistentes estão definidos ao nível dos recursos do Azure OpenAI. Assim, qualquer pessoa com acesso ao recurso OpenAI do Azure ou à chave API pode ler/escrever assistentes, threads, mensagens e ficheiros.

Recomendamos fortemente os seguintes controlos de acesso aos dados:

  • Implementar a autorização. Antes de realizar leituras ou escritas em assistentes, threads, mensagens e ficheiros, certifique-se de que o utilizador final está autorizado a fazê-lo.
  • Restringa o acesso ao recurso e à chave API do Azure OpenAI. Considere cuidadosamente quem tem acesso aos recursos do Azure OpenAI onde os assistentes estão a ser usados e as chaves API associadas.
  • Audite rotineiramente quais contas/indivíduos têm acesso ao recurso Azure OpenAI. Chaves API e acesso ao nível de recursos permitem uma vasta gama de operações, incluindo a leitura e modificação de mensagens e ficheiros.
  • Ative as definições de diagnóstico para permitir o acompanhamento a longo prazo de certos aspetos do registo de atividades do recurso Azure OpenAI.

Parâmetros

A API dos Assistentes suporta vários parâmetros que permitem personalizar a saída dos Assistentes. O tool_choice parâmetro permite-te forçar o Assistente a usar uma ferramenta especificada. Também podes criar mensagens com o assistant papel para criar históricos de conversas personalizados nos Threads. temperature, top_p, response_format permite-te ajustar melhor as respostas. Para mais informações, consulte a documentação de referência .

Gestão de janelas de contexto

Os assistentes truncam automaticamente o texto para garantir que este se mantém dentro do comprimento máximo do contexto do modelo. Pode personalizar este comportamento especificando o número máximo de tokens que gostaria que uma corrida utilizasse e/ou o número máximo de mensagens recentes que gostaria de incluir numa sequência.

Tokens máximos de conclusão e prompt

Para controlar o uso de tokens numa única Execução, defina max_prompt_tokens e max_completion_tokens quando criar a Execução. Estes limites aplicam-se ao número total de tokens usados em todas as conclusãos ao longo do ciclo de vida da Run.

Por exemplo, iniciar uma Execução com max_prompt_tokens definido para 500 e max_completion_tokens definido para 1000 significa que a primeira conclusão truncará o thread para 500 tokens e limitará a saída a 1.000 tokens. Se na primeira conclusão forem usados apenas 200 tokens de prompt e 300 tokens de conclusão, a segunda conclusão terá limites disponíveis de 300 tokens de prompt e 700 tokens de conclusão.

Se uma conclusão atingir o max_completion_tokens limite, a execução terminará com o estado de incompleto, e os detalhes serão fornecidos no incomplete_details campo do objeto de execução.

Ao utilizar a ferramenta de Pesquisa de Ficheiros, recomendamos definir o max_prompt_tokens para não menos do que 20.000. Para conversas mais longas ou múltiplas interações com a Pesquisa de Ficheiros, considere aumentar este limite para 50.000 ou, idealmente, remover os max_prompt_tokens limites por completo para obter resultados da mais alta qualidade.

Estratégia de truncamento

Também pode especificar uma estratégia de truncamento para controlar como o seu thread deve ser renderizado na janela de contexto do modelo. Ao usar uma estratégia de truncamento do tipo auto, utilizar-se-á a estratégia de truncamento padrão da OpenAI. Usar uma estratégia de truncamento do tipo last_messages permitirá especificar o número das mensagens mais recentes a incluir na janela de contexto.

Ver também