¿Qué regularizador debería utilizar realmente? Lecciones de 134.400 simulaciones

Autores: Ahsaas Bajaj y Benjamin S Knight

? Realizamos 134.400 simulaciones basadas en modelos de aprendizaje automático de producción real para descubrirlo. La respuesta depende de para qué esté optimizando y de un único diagnóstico que pueda calcular antes de ajustar un modelo.

Si alguna vez ha entrenado un modelo lineal en scikit-learn, se ha enfrentado a esta pregunta: ¿RidgeCV, LassoCV o ElasticNetCV? Tal vez hayas optado por lo que recomendó un tutorial. Quizás un colega tuvo una opinión firme. Tal vez probó los tres y eligió el que le dio la mejor puntuación de validación cruzada.

Queríamos reemplazar la intuición con la toma de decisiones empírica.

Realizamos 134.400 simulaciones en 960 configuraciones de un espacio de parámetros de 7 dimensiones, variando el tamaño de la muestra, las características, la multicolinealidad, la relación señal-ruido, la escasez de coeficientes y dos parámetros más. Comparamos cuatro marcos de regularización (Ridge, Lasso, ElasticNet y Post-Lasso OLS) en los tres objetivos:

Precisión predictiva (prueba RMSE) Selección de variables (puntaje F1 para recuperar el conjunto de características reales) Estimación de coeficientes (error L2 versus coeficientes verdaderos)

Nuestros rangos de simulación no son arbitrarios. Se basan en ocho modelos de aprendizaje automático de producción del mundo real de Instacart, que abarcan pronóstico de demanda, predicción de conversión e inteligencia de inventario. Los regímenes que probamos reflejan las condiciones que los MLE realmente encuentran en la práctica.

Esta publicación resume la guía práctica de nuestro estudio en un marco de decisión que puede utilizar en su próximo proyecto. Si es un científico de datos o un MLE y elige un regularizador, esto es para usted.

Los titulares

Antes de entrar en detalles:

Para la predicción, poco importa. Ridge, Lasso y ElasticNet difieren como máximo en un 0,3% en el RMSE medio. Ningún hiperparámetro logra ni siquiera un tamaño de efecto pequeño para las diferencias de RMSE entre ellos. Esto solo es válido con datos de entrenamiento adecuados (> 78 observaciones por característica). Para la selección de variables, esto es de enorme importancia, especialmente en condiciones de multicolinealidad. El retiro de Lasso colapsa a 0,18 bajo números de condición altos con señal baja, mientras que ElasticNet mantiene 0,93. En proporciones grandes de muestra a característica (n/p ≥ 78), los métodos se vuelven intercambiables. Utilice Ridge; es el más rápido. Se debe evitar OLS posterior a Lasso al optimizar para RMSE. Es el único método que constantemente tiene un rendimiento inferior y lo hace en todos los objetivos que medimos.

Qué probamos y por qué

Nuestro marco de simulación varía siete hiperparámetros simultáneamente:

Tabla 1: Simulamos un espacio de hiperparámetros de 960 configuraciones.

Ejecutamos cada uno de los 4 marcos de regularización contra 960 configuraciones de hiperparámetros, cada una usando 35 semillas aleatorias para un total de 134,400 simulaciones. Para cada simulación registramos el RMSE de la prueba, la puntuación F1 (precisión y recuperación para recuperar el soporte real de β) y el coeficiente de error L2.

Para medir qué impulsa las diferencias entre los métodos, utilizamos omega cuadrado (ω²) de ANOVA unidireccional, un tamaño del efecto que nos dice qué proporción de la varianza en las brechas de desempeño se explica por cada parámetro. Esto va más allá de preguntar “qué método gana” y comprende por qué gana y en qué condiciones.

Esto es lo que esto significa en la práctica: la mayoría de los parámetros que impulsan las diferencias de método son cosas que se pueden observar antes de ajustar un modelo. Ya conoces n y p. Puede calcular el número de condición κ con numpy.linalg.cond(X). Y el único parámetro latente importante, SNR, tiene un proxy de diagnóstico gratuito: la fuerza de regularización α que selecciona LassoCV. α alto indica señal baja; α bajo indica una señal fuerte. Volveremos a esto.

Hallazgo 1: para predecir, simplemente use Ridge

Este es el hallazgo más importante para el mayor número de profesionales.

Ridge, Lasso y ElasticNet son casi intercambiables para la predicción. En las 33.600 simulaciones por método, el RMSE de prueba medio difiere como máximo en un 0,3%. Nuestro análisis de omega cuadrado confirma esto: ningún hiperparámetro logra ni siquiera un tamaño de efecto pequeño (ω² ≥ 0,01) para las diferencias de RMSE entre estos tres métodos. Cada comparación por pares es insignificante (todas < 0,02).

Para los profesionales que sólo se preocupan por la precisión, la casi equivalencia es en sí misma el hallazgo. La elección del regularizador importa mucho menos que el tamaño de la muestra.

Figura 1: Las diferencias en la prueba RMSE se vuelven triviales dado un tamaño de muestra suficiente.

Entonces, ¿por qué Ridge? Eficiencia computacional. Ridge tiene una solución de forma cerrada para cada candidato α, lo que la hace dramáticamente más rápida que las alternativas (compare el tiempo de ejecución promedio de Ridge de 6 segundos con el tiempo de ejecución promedio de Lasso de 9 segundos y el tiempo de ejecución promedio de ElasticNet de 48 segundos).

Figura 2: Los usuarios deben esperar un aumento mínimo de 5 veces en los tiempos de ejecución al optar por ElasticNet en lugar de Ridge o Lasso.

La sobrecarga de ElasticNet surge de su búsqueda conjunta de cuadrícula sobre α y la relación L1 ρ. La sobrecarga media de 167 a 219 × que medimos es específica de nuestra cuadrícula de relación L1 de 8 valores. Una cuadrícula de 3 valores más gruesa reduciría esto proporcionalmente. Peor aún, cuando la distribución de coeficientes es aproximadamente uniforme, Lasso puede tardar más de una hora en converger (consulte el lado derecho de la distribución bimodal). Estos gastos generales le permiten obtener una mejora media del RMSE de sólo el 0,04 % con respecto a Ridge, un margen que es insignificante en la práctica.

Advertencias

Con el tamaño de muestra más pequeño que probamos (n = 100), ElasticNet puede superar a Ridge entre un 5% y un 15% en casos muy específicos: cuando la SNR es alta (~1,0). Con una SNR baja, Ridge es en realidad ligeramente mejor. Estas son observaciones localizadas en el extremo de nuestra cuadrícula de simulación, no tendencias sistemáticas.

Una nota más: LassoLars no fue parte de nuestro diseño de investigación, pero el algoritmo LARS calcula analíticamente toda la ruta de regularización de Lasso en una sola pasada (O(np²)), lo que potencialmente iguala la ventaja de velocidad de forma cerrada de Ridge. Sin embargo, se sabe que LARS es numéricamente inestable en condiciones de alta colinealidad (κ > 10⁴) que caracterizan a la mayoría de los conjuntos de características de ML de producción. Éste es precisamente el régimen en el que se aplican nuestros hallazgos más sólidos.

Conclusión para la predicción: predeterminado en RidgeCV. El tamaño de la muestra importa mucho más que la elección del regularizador. Pero la predicción no es el único objetivo que vale la pena optimizar. Cuando la selección de variables o la precisión de los coeficientes son importantes, especialmente en condiciones de multicolinealidad, la historia cambia dramáticamente.

Hallazgo 2: Para la selección de variables, ElasticNet es el valor predeterminado seguro

Aquí la elección del método realmente importa. La selección de variables, la tarea de identificar qué características realmente contribuyen al resultado, es el objetivo más sensible para el regularizador, y equivocarse conlleva el mayor costo.

¿Qué impulsa las diferencias?

De nuestra descomposición ANOVA de diferencias F1 por pares:

Tabla 2: El tamaño de la muestra es el predictor más destacado de las diferencias en la puntuación F1.

El tamaño de la muestra domina abrumadoramente. Pero una vez que estás en el régimen de n pequeño (n/p < 78), el número de condición y la SNR se convierten en los principales diferenciadores.

Alta multicolinealidad (κ > ~10⁴): no utilice Lasso

Este es uno de los hallazgos más sólidos de todo el estudio y es directamente relevante para el ML de producción. Siete de los ocho modelos que encuestamos operan en el régimen de κ alto. Si sus características están incluso moderadamente correlacionadas (lo que es casi seguro que lo están en cualquier conjunto de características diseñado), este hallazgo se aplica a usted.

Con κ alta y SNR baja:

Recuperación de Lasso: 0,18 (omite el 82 % de las características reales) Recuperación de ElasticNet: 0,93 (capta el 93 % de las características reales)

Esa es una ventaja de recuperación de 5 veces para ElasticNet. El mecanismo es bien conocido. Cuando las características están altamente correlacionadas, Lasso elige arbitrariamente una de cada grupo correlacionado y pone a cero el resto. El componente de penalización L2 de ElasticNet, el “efecto de agrupación” descrito por Zou y Hastie (2005), mantiene juntas las características correlacionadas.

Nuestras simulaciones muestran que este no es un caso de esquina. Las diferencias más fuertes de F1 (ΔF1 de 0,50 a 0,75) se concentran directamente en las columnas de alto κ en n = 100 y n = 1000. Este es el caso común en la producción.

Baja multicolinealidad (κ < ~10²): todavía predeterminado en ElasticNet

Se podría esperar que Lasso finalmente brille con un κ bajo. No es así, al menos no universalmente. Incluso con κ baja, la recuperación de Lasso es muy sensible a la relación señal-ruido (ver más abajo).

Figura 3: El uso de la norma L2 por parte de ElasticNet protege contra el colapso de la recuperación que puede ocurrir con Lasso.

ElasticNet mantiene una recuperación ≥ 0,91 independientemente de la SNR, incluso con κ baja. Lasso sólo es competitivo cuando la SNR es alta y el modelo real es realmente escaso. Como normalmente no se conoce la SNR de antemano, ElasticNet es la apuesta más segura.

La sorpresa de la cresta

No esperábamos esto: Ridge frecuentemente logra los puntajes F1 más altos en n pequeño, a pesar de nunca realizar una selección explícita de variables. ¿Cómo? La recuperación de Ridge es siempre 1.0, porque conserva todas las características, y esa recuperación perfecta supera la ventaja de precisión de los métodos dispersos cuando la recuperación de esos métodos colapsa con una SNR baja.

Pero ésta no es una auténtica selección de variables. Ridge le ofrece un coeficiente distinto de cero para cada característica. Si necesita un modelo explícitamente disperso, Ridge no ayuda. Combinar Ridge con la importancia de la permutación post-hoc es una extensión natural, pero no la evaluamos aquí.

Selección de variables: resumen

Figura 4: ElasticNet es la opción segura cuando el investigador no puede inferir de manera confiable la SNR.

En pocas palabras para la selección de variables: ElasticNetCV es el valor predeterminado seguro. Lasso solo gana su lugar cuando κ es bajo, SNR es alto y tiene razones de dominio para creer que el modelo verdadero es escaso.

Hallazgo 3: Para la estimación de coeficientes, ramifique en κ

Cuando el objetivo es recuperar valores de coeficientes precisos, para interpretabilidad o inferencia causal, el número de condición κ se convierte en la variable de ramificación clave. Lo ideal sería basarnos en la distribución de los coeficientes 𝛽 verdaderos, pero no podemos observarlo. Por el contrario, κ se puede medir directamente. En κ alto, ElasticNet domina independientemente de la escasez. Con κ baja, el método óptimo depende de si el modelo verdadero es disperso o denso. El tamaño de la muestra cambia la magnitud de las diferencias pero no su dirección.

Alto κ (> ~10⁴): Utilice ElasticNet. Logra un error de coeficiente L2 entre un 20% y un 40% menor que Lasso y mantiene una ventaja constante sobre Ridge independientemente del nivel de escasez.

κ baja (< ~10²): amplíe su conocimiento de dominio sobre la escasez.

Dominio disperso (genómica, clasificación de texto, conjuntos de sensores): Lasso o ElasticNet Dominio denso (conjuntos de características diseñadas, pronóstico de demanda, modelos de conversión): Ridge

Figura 5: La ventaja de rendimiento de Ridge sobre Lasso/ElasticNet se desvanece rápidamente a medida que aumenta la relación n/p, mientras que un espacio propio bien acondicionado beneficia aún más a Lasso/ElasticNet.

Todos los regímenes: Evite el OLS Post-Lasso. Muestra un coeficiente de error L2 más alto que el Lasso estándar en toda la cuadrícula de simulación. El reajuste de OLS no penalizado amplifica los errores de selección de la primera etapa. Este es el escenario en el que uno esperaría que el procedimiento de dos etapas ayude, pero no es así.

Figura 6: Cuando el objetivo es la estimación de coeficientes, Ridge se vuelve más especializado.

Conclusión para la estimación de coeficientes: ElasticNet en κ alto, dependiente del dominio en κ bajo, nunca Post-Lasso OLS.

Una guía de decisiones para profesionales

Todos los hallazgos anteriores se resumen en un marco de decisión que se ramifica exclusivamente en cantidades que se pueden calcular antes de ajustar un solo modelo: la relación muestra-característica n/p, el número de condición κ (a través de numpy.linalg.cond(X)), y cuando se necesita una discriminación más fina, la fuerza de regularización α elegida mediante una ejecución rápida de LassoCV como proxy de la SNR latente.

El diagrama de flujo completo está disponible en nuestro artículo (Figura 7). Aquí, analizamos la lógica como un árbol de decisión.

El régimen indeterminado

Si su recuento de funciones excede el tamaño de su muestra, se encuentra en el régimen infradeterminado. Aquí, el α de Lasso se satura con frecuencia en el límite superior de la cuadrícula de búsqueda y su recuperación colapsa. Utilice Ridge o ElasticNet de forma predeterminada para todos los objetivos y proceda con precaución.

El régimen de muestra grande

Si n/p ≥ 78, estás en el régimen de muestra grande donde todos los métodos convergen. Las brechas de desempeño desaparecen simultáneamente en la predicción, la selección de variables y la estimación de coeficientes.

Utilice RidgeCV. Es el método más rápido con diferencia y no hay penalización en la precisión. Si necesita específicamente un modelo disperso para la interpretabilidad, ElasticNetCV o LassoCV están perfectamente bien en esta proporción. La elección entre ellos es irrelevante.

El régimen donde la elección importa

Por debajo de n/p = 78 es donde la elección del método es más importante. El regularizador adecuado depende de para qué esté optimizando.

Si la predicción es su prioridad: utilice RidgeCV. Las diferencias de RMSE entre los tres métodos principales son demasiado pequeñas para justificar una complejidad o cálculo adicional. Una excepción estrecha: en n ≈ 100 con SNR alta (~1,0), ElasticNet ofrece una ventaja detectable del 5 al 15 % independientemente de κ; en n ≈ 100 con una SNR muy baja, se prefiere marginalmente Ridge. En cualquier caso, el margen es modesto en relación con la mejora disponible al aumentar el tamaño de la muestra.

Si la selección de variables es su prioridad: bifurque en el número de condición.

κ > ~10⁴ (alta multicolinealidad): utilice ElasticNetCV. Esta es una de las recomendaciones más sólidas del estudio. Un matiz: con una SNR de moderada a alta (o n ≥ 1000), se prefiere claramente ElasticNet, con ventajas de F1 sobre Lasso que alcanzan un ΔF1 de +0,75. Con una SNR muy baja con n ≈ 100 (diagnosticada por un α saturado elegido por CV), Ridge logra la F1 más alta, pero solo a través de una recuperación perfecta (conservando todas las características), no de una selección de variables genuina. Si necesita un modelo explícitamente disperso incluso en este rincón, ElasticNet sigue siendo la opción menos mala y aún supera ampliamente a Lasso. κ < ~10² (bien acondicionado): Primero, una precaución importante: no utilice Lasso de forma predeterminada, incluso con κ bajo. La recuperación de Lasso cae drásticamente en niveles SNR más bajos independientemente de la multicolinealidad, mientras que ElasticNet mantiene una recuperación ≥ 0,91 en todos los niveles de SNR. ElasticNet es el valor predeterminado seguro aquí. Para refinar aún más, ejecute un LassoCV rápido e inspeccione el α elegido. Si α es alto o está saturado en el límite, estás en un régimen de SNR baja. Ridge ofrece la mejor F1 (aunque no mediante una auténtica escasez). Si α es moderado, quédese con ElasticNet. Si α es bajo y la experiencia en el dominio sugiere escasez, Lasso se vuelve viable.

Si la estimación del coeficiente es su prioridad: bifurque en el número de condición.

κ > ~10⁴: ElasticNetCV domina independientemente de la escasez. κ < ~10²: Utilice el conocimiento del dominio. Modelo disperso → Lazo. Modelo denso → Cresta.

El diagnóstico α: un proxy SNR gratuito

El único parámetro latente que importa para decisiones detalladas, la relación señal-ruido, se puede aproximar sin costo adicional. Cuando LassoCV de scikit-learn se ajusta a sus datos, informa el α elegido. Este valor está inversamente relacionado con la SNR subyacente: α alto indica una señal débil, α bajo indica una señal fuerte.

Nuestras simulaciones proporcionan una confirmación empírica directa: los valores α elegidos más altos (que se acercan a 10⁴–10⁵) se concentran exclusivamente en configuraciones de n pequeño y baja SNR.

Figura 7: El parámetro de regularización α puede ser un proxy útil para la SNR.

Estos umbrales son heurísticas aproximadas derivadas de nuestra cuadrícula de simulación; variarán según la escala de características y las características del conjunto de datos. Trátelos como pautas, no como límites tajantes.

En todos los casos inciertos

Cuando no está seguro de la SNR, de la escasez o de operar en el rango de κ intermedio, no lo probamos directamente: ElasticNet es el valor predeterminado que no lo quemará y se debe evitar Post-Lasso OLS.

El metahallazgo: el tamaño de la muestra lo supera todo

Una conclusión es más importante que cualquier orientación a nivel de método: aumentar la relación muestra-función hace más para cada objetivo que cualquier elección de regularizador.

El tamaño de la muestra es el factor dominante de las diferencias de desempeño en las tres métricas (ω² = 0,308 para F1, un efecto grande). La interacción n × SNR es la interacción bidireccional más fuerte en todas las comparaciones (F = 569, p <0,001). La relación señal-ruido importa más precisamente cuando las muestras son escasas. Y en n/p ≥ 78, la elección del método se vuelve completamente irrelevante.

Si pasas días ajustando tu regularizador cuando podrías aumentar tu conjunto de entrenamiento, estás optimizando algo equivocado.

Referencia rápida

Tabla 3: El regularizador más apropiado está determinado tanto por la naturaleza de los datos de características como por el objetivo de la investigación.

Poniéndolo en práctica

El marco de simulación es un arnés reutilizable. Limitamos los tamaños de muestra a 100.000 observaciones por razones informáticas, pero la cuadrícula aún abarca el punto de inflexión n/p donde cambia el rendimiento del regularizador. Lo estamos ampliando ahora a regularizadores más nuevos (Adaptive Lasso, SCAD, MCP) y niveles κ intermedios.

Para aplicar este marco a su próximo proyecto, calcule tres cantidades antes de ajustar algo: la relación muestra-característica (n/p), el número de condición (κ) y, si está en el régimen de n pequeño, un LassoCV α rápido como su proxy SNR. Siga la guía de decisiones anterior según su objetivo principal.

Si n/p ≥ 78, use Ridge y gaste su presupuesto de ajuste en otra parte. Si n/p < 78 y κ es alto, use ElasticNet y no lo dude. El único escenario en el que la elección requiere una reflexión real es un κ bajo con n pequeño, e incluso allí, ElasticNet nunca es una mala respuesta.

El documento completo, incluidas todas las figuras del apéndice, las tablas ANOVA y el diagrama de flujo de decisión consolidado, está disponible en ArXiv.

Ahsaas Bajaj es líder tecnológico de aprendizaje automático en Instacart. Benjamin S Knight es científico de datos del personal de Instacart.

Todas las imágenes fueron creadas por los autores.