Construir e treinar um modelo de classificação personalizado

Este conteúdo aplica-se a:🟩v4.0 (GA) | Versões anteriores:🟦v3.1 (GA)🟥v3.0 (descontinuada)

Modelos de classificação personalizados podem classificar cada página num ficheiro de entrada para identificar um ou mais documentos no seu interior. Os modelos classificadores também podem identificar múltiplos documentos ou múltiplas instâncias de um único documento no ficheiro de entrada. Os modelos personalizados de Inteligência de Documentos requerem apenas cinco documentos de formação por classe de documento para começar. Para começar a treinar um modelo de classificação personalizado, precisa de pelo menos cinco documentos para cada classe e duas classes de documentos.

Requisitos personalizados de entrada do modelo de classificação

Certifique-se de que o seu conjunto de dados de treino segue os requisitos de entrada para Inteligência de Documentos.

São suportados os seguintes formatos de ficheiro.

Modelo PDF Imagem:
JPEG/JPG, PNG, BMP, TIFF, HEIF
Microsoft Office:
Word (DOCX), Excel (XLSX), PowerPoint (PPTX), HTML
Leia
Disposição
Documento geral
Pré-fabricado
Extração personalizada
Classificação personalizada
  • Fotografias e digitalizações: Para melhores resultados, forneça uma foto clara ou uma digitalização de alta qualidade por documento.
  • PDFs e TIFFs: Para PDFs e TIFFs, podem ser processadas até 2.000 páginas. (Com uma subscrição gratuita, apenas as duas primeiras páginas são processadas.)
  • Tamanho do ficheiro: O tamanho do ficheiro para análise de documentos é de 500 MB para o nível pago (S0) e 4 MB para o nível gratuito (F0).
  • Dimensões da imagem: As dimensões devem estar entre 50 pixels x 50 píxeis e 10.000 píxeis x 10.000 píxeis.
  • Bloqueios por palavra-passe: Se os seus PDFs estiverem bloqueados por palavra-passe, deve remover o bloqueio antes da submissão.
  • Altura do texto: A altura mínima do texto a extrair é de 12 píxeis para uma imagem de 1024 x 768 píxeis. Esta dimensão corresponde a cerca de texto de 8 pontos a 150 pontos por polegada.
  • Treino de modelos personalizados: O número máximo de páginas para dados de treino é 500 para o modelo modelo personalizado e 50.000 para o modelo neural personalizado.
  • Treino personalizado do modelo de extração: O tamanho total dos dados de treino é de 50 MB para o modelo modelo e 1 GB para o modelo neural.
  • Treino personalizado do modelo de classificação: O tamanho total dos dados de treino é de 1 GB com um máximo de 10.000 páginas. Para 2024-11-30 (GA), o tamanho total dos dados de treino é de 2 GB com um máximo de 10.000 páginas.
  • Tipos de ficheiros Office (DOCX, XLSX, PPTX): O limite máximo de comprimento de string é de 8 milhões de caracteres.

Dicas de dados de formação

Siga estas dicas para otimizar ainda mais o seu conjunto de dados para treino:

  • Se possível, utilize documentos PDF baseados em texto em vez de documentos baseados em imagens. Os PDFs digitalizados são tratados como imagens.

  • Se as suas imagens de formulário forem de menor qualidade, use um conjunto de dados maior (10-15 imagens, por exemplo).

Carregue os seus dados de treino

Depois de montar o conjunto de formulários ou documentos para treino, precisa de o carregar para um contentor de armazenamento blob do Azure. Se não souber como criar uma conta de Armazenamento do Azure com um contentor, siga o guia de início rápido do Armazenamento do Azure para o portal do Azure. Podes usar o nível de preço gratuito (F0) para experimentar o serviço, e depois fazer um upgrade para um nível pago para produção. Se o seu conjunto de dados estiver organizado em pastas, mantenha essa estrutura, pois o Studio pode usar os nomes das suas pastas para etiquetas e assim simplificar o processo de rotulagem.

Criar um projeto de classificação no Estúdio de Inteligência Documental

O Document Intelligence Studio fornece e orquestra as chamadas API necessárias para completar o seu conjunto de dados e treinar o seu modelo.

  1. Comece por navegar até ao Document Intelligence Studio. Na primeira vez que usar o Studio, deve inicializar a sua subscrição, o grupo de recursos e o recurso. Depois, siga os pré-requisitos para projetos personalizados e configure o Studio para aceder ao seu conjunto de dados de treino.

  2. No Studio, selecione o mosaico Modelo de classificação personalizado , na secção de modelos personalizados da página e selecione o botão Criar um projeto .

    Captura de ecrã de como criar um projeto de classificador no Document Intelligence Studio.

    1. No diálogo Create Project, forneça um nome para o seu project, opcionalmente uma descrição, e selecione continuar.

    2. De seguida, escolha ou selecione a opção criar um recurso de Inteligência Documental antes de prosseguir.

    Captura de ecrã que mostra a janela de diálogo de configuração do projeto.

  3. De seguida, selecione a conta de armazenamento que usou para carregar o seu conjunto de dados personalizado de treino de modelos. O caminho da pasta deve estar vazio se os teus documentos de treino estiverem na raiz do contentor. Se os seus documentos estiverem numa subpasta, introduza o caminho relativo a partir da raiz do contentor no campo do caminho da Pasta . Depois de configurar a sua conta de armazenamento, selecione continuar.

    Importante

    Podes organizar o conjunto de dados de treino por pastas, onde o nome da pasta é o rótulo ou classe dos documentos. Alternativamente, pode criar uma lista plana de documentos aos quais pode atribuir uma etiqueta no Studio.

    Captura de ecrã que mostra como selecionar o recurso de Inteligência Documental.

  4. Treinar um classificador personalizado requer a saída do modelo Layout para cada documento do seu conjunto de dados. Execute o layout em todos os documentos antes do processo de treino do modelo.

  5. Por fim, reveja as suas definições de project e selecione Criar Project para criar um novo project. Agora deves estar na janela de rotulagem e ver os ficheiros no teu conjunto de dados listados.

Etiqueta os teus dados

No teu projeto, só precisas de rotular cada documento com o rótulo de classe apropriado.

Captura de ecrã a mostrar a escolha do recurso de Inteligência Documental.

Vês os ficheiros que carregaste para armazenamento na lista de ficheiros, prontos para serem rotulados. Tem algumas opções para rotular o seu conjunto de dados.

  1. Se os documentos estiverem organizados em pastas, o Studio pede-te para usares os nomes das pastas como etiquetas. Este passo simplifica a etiquetagem para uma única seleção.

  2. Para atribuir um rótulo a um documento, selecione o add label selection mark para atribuir um rótulo.

  3. Use o control-select para selecionar múltiplos documentos e atribuir a um rótulo.

Agora deves ter todos os documentos do teu conjunto de dados rotulados. Se olhares para a conta de armazenamento, encontras .ocr.json ficheiros que correspondem a cada documento do teu conjunto de dados de treino e um novo ficheiro class-name.jsonl para cada classe rotulado. Este conjunto de dados de treino é submetido para treinar o modelo.

Treina o teu modelo

Com o seu conjunto de dados rotulado, está agora pronto para treinar o seu modelo. Selecione o botão do comboio no canto superior direito.

  1. No diálogo do modelo de comboio, forneça um ID de classificador único e, opcionalmente, uma descrição. O identificador do classificador aceita um tipo de dados string.

  2. Selecione Treinar para iniciar o processo de formação.

  3. Os modelos classificadores treinam em poucos minutos.

  4. Navegue até ao menu Modelos para ver o estado da operação do comboio.

Testar o modelo

Depois de concluído o treino do modelo, pode testar o seu modelo selecionando o modelo na página da lista de modelos.

  1. Selecione o modelo e escolha o botão Testar .

  2. Adicione um novo ficheiro procurando um ficheiro ou colocando um ficheiro no seletor de documentos.

  3. Com um ficheiro selecionado, escolha o botão Analisar para testar o modelo.

  4. Os resultados do modelo são apresentados com a lista de documentos identificados, uma pontuação de confiança para cada documento identificado e o intervalo de páginas para cada um dos documentos identificados.

  5. Valide o seu modelo avaliando os resultados de cada documento identificado.

Treinar um classificador personalizado usando o SDK ou API

O Studio orquestra as chamadas de API para treinar um classificador personalizado. O conjunto de dados de treino do classificador requer a saída da API de layout que corresponda à versão da API para o seu modelo de treino. Usar resultados de layout de uma versão antiga da API pode resultar num modelo com menor precisão.

O Studio gera os resultados de layout para o seu conjunto de dados de treino se este não contiver resultados de layout. Ao usar a API ou SDK para treinar um classificador, é necessário adicionar os resultados do layout às pastas que contêm os documentos individuais. Os resultados do layout devem estar no formato da resposta da API ao chamar o layout diretamente. O modelo de objetos SDK é diferente. Certifique-se de que são layout results os resultados da API e não os SDK response.

Resolução de problemas

O modelo de classificação requer resultados do modelo de layout para cada documento de formação. Se não fornecer os resultados de layout, o Studio tenta executar o modelo de layout de cada documento antes de treinar o classificador. Este processo é regulado e pode resultar num código de resposta 429.

No Studio, antes de treinar com o modelo de classificação, execute o modelo de layout em cada documento e carregue-o para o mesmo local do documento original. Depois de adicionados os resultados do layout, pode treinar o modelo classificador com os seus documentos.

Próximos passos