Grupos de disponibilidad de monitorización y resolución de problemas

Esta guía te ayuda a empezar a monitorizar grupos de disponibilidad y a solucionar algunos de los problemas comunes en los grupos de disponibilidad. Ofrece contenido original y una página de aterrización con información útil que se publica en otros lugares. Aunque esta guía no puede abordar completamente todos los problemas que pueden surgir en la gran cantidad de grupos de disponibilidad, puede orientarte en la dirección correcta para analizar la causa raíz y resolver problemas.

Dado que los grupos de disponibilidad son una tecnología integrada, muchos de los problemas que encuentres pueden ser síntomas de otros problemas en tu sistema de base de datos. Algunos problemas se deben a configuraciones dentro de un grupo de disponibilidad, como la suspensión de una base de datos de disponibilidad. Otros problemas pueden incluir problemas con otros aspectos de SQL Server, como la configuración de SQL Server, el despliegue de archivos de bases de datos y problemas sistémicos de rendimiento no relacionados con la disponibilidad. Otros problemas pueden existir fuera de SQL Server, como la E/S de red, TCP/IP, Active Directory y el clúster por conmutación por error de Windows Server (WSFC). A menudo, los problemas que surgen en un grupo de disponibilidad, réplica o base de datos requieren que pruebes varias tecnologías para identificar la causa raíz.

Escenarios de resolución de problemas

La siguiente tabla contiene enlaces a los escenarios comunes de solución de problemas para grupos de disponibilidad. Se categorizan según sus tipos de escenario, como configuración, conectividad del cliente, conmutación por error y rendimiento.

Escenario Tipo de escenario Description
Solucionar problemas de la configuración de grupos de disponibilidad siempre activos (SQL Server) Configuration Proporciona información para ayudarte a solucionar problemas típicos en la configuración de instancias de servidor para grupos de disponibilidad. Entre los problemas de configuración típicos se incluyen:

- los grupos de disponibilidad están deshabilitados
- las cuentas están configuradas incorrectamente
- el endpoint de espejo de base de datos no existe
- el endpoint es inaccesible (SQL Server Error 1418)
- el acceso a la red no existe
- falla un comando de unión a la base de datos (error de SQL Server 35250)
Solucionar el problema de una operación fallida de archivo de adición (Grupos de disponibilidad siempre activos) Configuration Una operación de añadir archivos provocó que la base de datos secundaria quedara suspendida y quedara en el estado de NO SINCRONIZACIÓN.
No se puede conectar al oyente del grupo de disponibilidad en un entorno multi-subred Conectividad de clientes Después de configurar el oyente del grupo de disponibilidad, no puedes pingar al oyente ni conectarte a él desde una aplicación.
Resolución de problemas fallidos en los fallos automáticos Failover Un conmutador automático no se completó con éxito.
Solución de problemas: el grupo de disponibilidad superó el RTO Performance Después de una conmutación por error automática o una manual planeada sin pérdida de datos, el tiempo de conmutación por error supera el RTO. O bien, al estimar el tiempo de conmutación por error de una réplica secundaria de confirmación sincrónica (por ejemplo, un asociado de conmutación automática por error), descubre que supera el RTO.
Solución de problemas: el grupo de disponibilidad superó el RPO Performance Después de realizar una conmutación por error manual forzada, la pérdida de datos supera la RPO. O bien, al calcular la posible pérdida de datos de una réplica secundaria de confirmación asincrónica, descubre que supera la RPO.
Solución de problemas: cambios en la réplica principal que no se reflejan en la réplica secundaria Performance La aplicación cliente completa correctamente una actualización en la réplica principal, pero la consulta de la réplica secundaria muestra que el cambio no se refleja.
Solución de problemas: Tipo de espera HADR_SYNC_COMMIT alta con grupos de disponibilidad siempre activos Performance Si HADR_SYNC_COMMIT es inusualmente largo, hay un problema de rendimiento en el flujo de movimiento de datos o en el endurecimiento de logarítmicas de réplicas secundarias.

Herramientas útiles para solucionar problemas

Al configurar o ejecutar grupos de disponibilidad, diferentes herramientas pueden ayudarte a diagnosticar distintos tipos de problemas. La siguiente tabla proporciona enlaces a información útil sobre las herramientas.

Tool Description
Usar el panel AlwaysOn (SQL Server Management Studio) Ofrece una vista rápida de la salud de tu grupo de disponibilidad en una interfaz fácil de usar.
Políticas de Always On Usado por el Panel de Control Siempre Activo.
Registro de errores de SQL Server (Grupos de disponibilidad siempre activos) Los registros registran eventos de transición de estado para grupos de disponibilidad, réplicas y bases de datos, estados de otros componentes Siempre Activados y errores de Siempre Activado.
UN DESASTRE. LOG (Grupos de disponibilidad siempre activos) Registran eventos de clúster, incluyendo transiciones de estado del recurso del grupo de disponibilidad, así como eventos y errores de la DLL de recursos de SQL Server.
Registro de diagnósticos de salud Always On Los registros SQL Server diagnósticos de salud según se reportan al clúster WSFC (DLL de SQL Server recursos) por sp_server_diagnostics (Transact-SQL).
Vistas de gestión dinámica y vistas de catálogo de sistemas (Grupos de disponibilidad siempre activos) Informa sobre los grupos de disponibilidad, como configuración, estado de salud y métricas de rendimiento.
Eventos extendidos Always On Proporciona diagnósticos detallados de los grupos de disponibilidad y es útil para el análisis de la causa raíz.
Tipos de espera siempre encendidos Proporciona estadísticas de espera específicas para grupos de disponibilidad y es útil para la optimización del rendimiento.
Contadores de rendimiento Always On La actividad de los grupos de disponibilidad de monitores se refleja en System Monitor y es útil para la optimización del rendimiento. Para más información, véase SQL Server, objeto Availability Replica y SQL Server, objeto Database Replica.
Buffers de anillo siempre activados Registrar alertas dentro del sistema SQL Server para diagnósticos internos y puede usarse para depurar problemas relacionados con los grupos de disponibilidad.

Grupos de disponibilidad de monitores

El momento ideal para solucionar problemas en un grupo de disponibilidad es antes de que un problema requiera un cambio por error, ya sea automático o manual. Esto se puede hacer monitorizando las métricas de rendimiento del grupo de disponibilidad y enviando alertas cuando las réplicas de disponibilidad están funcionando fuera de los límites de tu acuerdo de nivel de servicio (SLA). Por ejemplo, si una réplica secundaria síncrona tiene problemas de rendimiento que hacen que el tiempo estimado de conmutación por error aumente, no quieres esperar a que ocurra una conmutación automática y descubras que el tiempo de conmutación por error supera tu objetivo de tiempo de recuperación.

Dado que los grupos de disponibilidad son soluciones de alta disponibilidad y recuperación ante desastres, las métricas de rendimiento más importantes a monitorizar son el tiempo estimado de conmutación por error, que afecta a tu objetivo de tiempo de recuperación (RTO), y la posible pérdida de datos en un desastre, que afecta a tu objetivo de punto de recuperación (RPO). Puedes recopilar estas métricas a partir de los datos que SQL Server expone en cualquier momento, para que puedas recibir una alerta sobre un problema en las capacidades de alta disponibilidad y recuperación ante desastres (HADR) de tu sistema antes de que ocurran fallos reales. Por ello, es importante familiarizarse con el proceso de sincronización de datos de los grupos de disponibilidad y recopilar las métricas en consecuencia.

La siguiente tabla te indica artículos que pueden ayudarte a monitorizar la salud de la solución de tus grupos de disponibilidad.

Artículo Description
Monitorizar el rendimiento de los grupos de disponibilidad siempre activos Describe el proceso de sincronización de datos para grupos de disponibilidad, las compuertas de control de flujo y métricas útiles al monitorizar un grupo de disponibilidad; y también muestra cómo recopilar métricas de RTO y RPO.
Monitorización de grupos de disponibilidad (SQL Server) Proporciona información sobre herramientas para monitorizar un grupo de disponibilidad.
El modelo de salud Always On, parte 1: Arquitectura del modelo de salud Ofrece una visión general del modelo de salud Always On.
El modelo de salud Always On, parte 2: Ampliando el modelo de salud Muestra cómo personalizar el modelo de salud Siempre Activo y el Panel de Siempre Encendido para mostrar información extra.
Monitorización de la salud siempre activa con PowerShell, parte 1: Resumen básico del cmdlet Proporciona una visión general básica de los cmdlets Always On PowerShell que pueden usarse para monitorizar la salud de un grupo de disponibilidad.
Monitorización de la salud siempre activada con PowerShell, parte 2: Uso avanzado de cmdlets Proporciona información sobre el uso avanzado de los cmdlets Always On PowerShell para monitorizar la salud de un grupo de disponibilidad.
Monitorización de la salud siempre activada con PowerShell, parte 3: Una aplicación sencilla de monitorización Muestra cómo monitorizar automáticamente un grupo de disponibilidad con una aplicación.
Monitorización de la salud siempre activa con PowerShell, parte 4: Integración con Agente SQL Server Proporciona información sobre cómo integrar la monitorización de grupos de disponibilidad con Agente SQL Server y configurar notificaciones a las partes correspondientes cuando surjan problemas.