Conceitos: ciência de dados e machine learning no Azure Databricks

A ciência de dados e o aprendizado de máquina (DS e ML) extraem insights e criam modelos preditivos de dados. DS e ML incluem exploração interativa e modelagem e sistemas de produção automatizados. O ML clássico inclui técnicas como classificação, regressão, detecção de anomalias, previsão e recomendação.

O aprendizado profundo moderno e os métodos de IA são tecnicamente tipos de ML. Esta seção aborda o aprendizado profundo. Para IA, consulte Conceitos: IA no Azure Databricks.

O ciclo de vida de ML

O ciclo de vida do aprendizado de máquina abrange toda a jornada, dos dados brutos a um modelo em produção, retornando por meio de monitoramento e reentreinamento. Os principais estágios incluem:

  1. Defina o escopo do caso de uso definindo a variável-alvo da previsão, as métricas de sucesso e os requisitos de produção.
  2. Execute a EDA (análise de dados exploratória) para entender distribuições de dados, sinais preditivos e problemas de qualidade de dados antes da modelagem.
  3. Preparar dados e recursos, gerenciados em um repositório de recursos.
  4. Treinar modelos e acompanhar experimentos, registrar metadados de experimento para análise e implantação.
  5. Avalie a qualidade do modelo em relação aos dados retidos e aos critérios dos stakeholders.
  6. Registrar, homologar e testar modelos antes de promovê-los para produção.
  7. Implantar em produção em pontos de extremidade em tempo real ou trabalhos de inferência em lote.
  8. Monitore e treine novamente para adaptar modelos à alteração de dados ou comportamento do usuário.

Consulte o ciclo de vida do Machine Learning para obter um guia para cada estágio.

Desenvolvimento e operações assistidos por IA

O Azure Databricks conta com o Genie Code, um assistente de IA integrado aos notebooks e ao espaço de trabalho. Use-o para desenvolvimento, depuração e operações em andamento, baseando-se em seu conhecimento especializado sobre seu contexto empresarial. Consulte Usar o Genie Code para ciência de dados.

Você pode usar o Genie Code em cada etapa do fluxo de trabalho:

Você também pode usar ferramentas de codificação de terceiros para desenvolver e manter pipelines de ML em Azure Databricks. Consulte as habilidades do Agente para assistentes de codificação de IA.

O que é uma plataforma ML?

Uma plataforma de ML é a camada combinada de infraestrutura, ferramentas e governança que dá suporte ao ciclo de vida de ML completo, desde dados brutos até modelos de produção. Uma plataforma de ML bem projetada conecta a engenharia de dados, a ciência de dados interativa e a ML de produção em um único sistema controlado.

Os componentes principais incluem:

  • Ativos de dados, tais como arquivos, tabelas, pipelines de processamento e repositórios de atributos
  • Ferramentas de experimentação, como notebooks e visualizações, com colaboração simples e assistência de IA
  • Infraestrutura de treinamento com ambientes personalizáveis e recursos de computação flexíveis
  • Infraestrutura de implantação e monitoramento para serviço em lotes e em tempo real, com painéis de produção e alertas
  • Ferramentas de MLOps e governança para orquestração, CI/CD, linhagem, gestão de acesso e registro de auditoria

Os principais recursos de governança incluem:

Consulte também os recursos de ciência de dados e de ML do Azure Databricks e a arquitetura do Azure Databricks.

ML vs. aprendizado profundo vs. IA

Os limites entre aprendizado de máquina (ML), DL (aprendizado profundo) e IA podem ser difusos. Este guia se concentra em ML e aprendizado profundo, mas os seguintes recursos de plataforma dão suporte a todos os três paradigmas:

  • O Model Serving dá suporte a ML clássico, aprendizado profundo e modelos de IA personalizados para inferência em tempo real e em lote.
  • ai_query dá suporte a consultas SQL e cargas de trabalho de inferência em lote para todos os três paradigmas.

Recursos adicionais