LácteosPreciosImportación y exportaciónOferta y demanda

Transformar el mercado de materias primas con la inferencia causal

Vesper no solo muestra datos en tiempo real del mercado de materias primas: también usa aprendizaje automático para predecir precios, producción y existencias…

Megan Hidden
Megan HiddenCoordinadora de marketing
Publicado 27 de junio de 2022 · Actualizado 12 de noviembre de 202414 min de lectura

Vesper no solo muestra información en tiempo real sobre el mercado de materias primas, sino que además utiliza aprendizaje automático para predecir los precios, la producción y los niveles de existencias de distintas materias primas agrícolas (por ejemplo, lácteos, aceites vegetales o azúcar). Para ayudar a sus usuarios a entender qué variables hacen que los precios, la producción y los niveles de existencias cambien, en este artículo Vesper investiga cómo el análisis de inferencia causal puede ayudar a cuantificar el efecto de esas variables. Además, esto podría ayudar a nuestros usuarios a entender y anticipar el impacto de grandes acontecimientos inesperados, como la COVID-19 o la guerra en curso en Ucrania.

En general, la inferencia causal puede utilizarse para analizar y cuantificar distintas relaciones causales. Por lo tanto, en este artículo cuantificaremos y compararemos los efectos causales de las importaciones de mantequilla, las exportaciones de mantequilla y la producción de mantequilla sobre los precios de la mantequilla. Este artículo se estructura de la siguiente manera:

- En primer lugar, profundizaremos un poco más en qué es exactamente la inferencia causal. - En segundo lugar, analizaremos la estructura de mercado subyacente que se utiliza para hallar la relación causal entre las importaciones de mantequilla, las exportaciones de mantequilla, la producción de mantequilla y los precios de la mantequilla, y cómo la identificación de relaciones causales puede beneficiar a los usuarios de Vesper. - Por último, abordaremos la parte de aprendizaje automático de la inferencia causal con la biblioteca Microsoft DoWhy, incluidos los resultados de inferencia causal.

¿Qué es exactamente la inferencia causal?

La inferencia causal se define como un proceso que identifica relaciones causales entre datos y estima el efecto de un acontecimiento concreto (Eichler, 2012). Para responder a preguntas como «¿Cómo valoraría un usuario una película determinada si se la mostráramos?» y «¿Qué hizo que cambiara el precio de esta materia prima?», hay que medir y comparar el efecto de distintas variables (Moraffah et al., 2021). Como ejemplo, tomemos los modelos de recomendación de Netflix, como las filas de películas recomendadas de forma personalizada que aparecen en la pantalla de inicio de un usuario. El sistema de recomendación tradicional intenta responder a una pregunta sencilla: «¿Cómo valoraría el usuario esta película?». El problema es que los usuarios verán sus películas favoritas sin importar lo que el sistema les recomiende. La inferencia causal permite a Netflix analizar y cuantificar el efecto de distintas recomendaciones de películas, lo que da lugar a una mejor comprensión de sus usuarios y a un mayor rendimiento de los modelos de recomendación actuales. Desde la perspectiva de Vesper, la inferencia causal puede realizarse para entender mejor qué hace que los precios de las materias primas se muevan en una dirección concreta, al alza o a la baja. Los resultados de nuestra inferencia causal sobre materias primas pueden ayudar a nuestros clientes a anticipar mejor y más rápido los cambios en condiciones de mercado concretas.

¡La correlación no implica causalidad!

La mayoría de los modelos o algoritmos de aprendizaje automático que se utilizan para predecir los precios de las acciones o de las materias primas dependen de correlaciones entre variables. Sin embargo, para obtener información sobre los factores que impulsan las predicciones, resulta muy peligroso basarse únicamente en la correlación. En términos sencillos, la correlación es una medida que describe el tamaño y la dirección (positiva o negativa) de la relación entre variables. Fijarse solo en la correlación puede llevarnos a creer que el consumo de margarina y la tasa de divorcios en Maine guardan una relación causal (véase la figura de abajo). El gráfico muestra con claridad que ambos fenómenos están muy correlacionados. Sin embargo, eso no implica que comer menos margarina vaya a dar lugar a un matrimonio más sano. La correlación no es causalidad: la causalidad indica si existe una relación causal entre dos acontecimientos, y la inferencia causal comprueba si esa relación de causa a efecto existe realmente.

Captura de pantalla 2022-06-28 a las 15.09.05

Estructura del mercado

Para la inferencia causal es necesario tener una visión clara de los distintos factores que afectan al mercado de la mantequilla. Esto se hace en forma de grafo causal (es decir, un modelo gráfico probabilístico que sirve para codificar los supuestos sobre el proceso que genera los datos). Los expertos en inteligencia de mercado de Vesper crearon un grafo con todos los factores que podrían incidir en el ciclo de producción y de fijación de precios de la mantequilla, que se muestra a continuación. El grafo presenta distintas relaciones entre múltiples factores, todos ellos con una relación (in)directa con las importaciones y exportaciones de mantequilla, la producción de mantequilla o los precios de la mantequilla. El precio de la mantequilla es la variable de interés, ya que realizamos la inferencia causal para ver el efecto causal de las importaciones de mantequilla, las exportaciones de mantequilla y la producción de mantequilla sobre los precios de la mantequilla. Las flechas del diagrama representan una relación directa entre dos variables. Como puede ver, suponemos que no existe una relación directa entre la producción de leche y los precios de la mantequilla. Sin embargo, eso no implica automáticamente que no exista una relación indirecta. Podemos sostener que producir más leche puede hacer que aumente la producción de mantequilla debido a una valorización favorable de los productos, lo que reduce indirectamente el precio de la mantequilla. Mediante la inferencia causal se puede cuantificar la relación causal entre dos o más variables relacionadas de forma indirecta.

La valorización de los productos es una de las variables más importantes. Puede describirse mejor como la asignación óptima de recursos para generar el mayor retorno posible. Vesper calcula qué producto, incluidos los subproductos, ofrece el mayor retorno para 10.000 L de leche, dados los precios actuales de las distintas materias primas lácteas. Cuando los precios de la mantequilla son extremadamente altos, es probable que la herramienta de valorización aconseje producir más mantequilla, ya que resulta más rentable que producir otros productos, como el queso. Por lo tanto, tanto la producción de leche como la valorización inciden en la producción de mantequilla. Los precios de la mantequilla, por su parte, afectan a los resultados del modelo de valorización de hoy. Además de la valorización, y por lo tanto de la cantidad de leche que se destina a la producción de mantequilla, la producción de mantequilla también se ve afectada por la importación y la exportación de mantequilla, el consumo y los niveles de existencias.

0_o2GIJUXuOkAccQBI

Intersección entre la inteligencia de mercado y la ciencia de datos

A primera vista, la ciencia de datos y la inteligencia de mercado parecen dos campos de trabajo distintos. Las competencias necesarias y las funciones prácticas varían, mientras que el objetivo final suele ser el mismo: buscar información que mejore la toma de decisiones dentro de la empresa o del mercado. Para realizar inferencia causal sobre los precios de las materias primas, debemos comprender la mecánica de todo el mercado y, además, contar con la capacidad técnica para integrar un modelo de inferencia causal. La inteligencia de mercado desempeña un papel importante en la creación del grafo causal, al identificar todos los factores que contribuyen a la relación entre dos acontecimientos. Dicho de otro modo, hay que determinar la estructura del mercado antes de que el equipo de ciencia de datos pueda integrar el modelo de inferencia causal. Sin las competencias técnicas o el conocimiento del mercado necesarios, resulta casi imposible entender los resultados de la inferencia causal para los precios de las materias primas. Por lo tanto, una buena colaboración entre ambos campos es muy importante, y eso es precisamente lo que define a Vesper.

La inferencia causal para los usuarios de Vesper

¿Por qué nos interesa tanto la inferencia causal en Vesper? Nos ayuda a entender mejor los mercados de materias primas y a crear más valor para nuestros clientes. Nos permite combinar los avances más recientes en IA con la experiencia de mercado de nuestro equipo. Y algo fundamental: el razonamiento causal automatizado y cuantitativo puede dar lugar a una inteligencia de negocio más sólida, estratégica, completa y flexible. En la siguiente parte se explican las principales ventajas de la inferencia causal y cómo puede ayudar a nuestros usuarios.

Los últimos años nos enseñaron hasta qué punto los acontecimientos inesperados pueden afectar a las empresas. Las guerras comerciales, las olas de la pandemia, las guerras propiamente dichas, las condiciones meteorológicas extremas y la creciente inestabilidad política volvieron las cadenas de suministro y las intrincadas redes de importación y exportación más frágiles que nunca. La inferencia causal nos permite preparar a nuestros clientes para lo inesperado. Ningún algoritmo de aprendizaje automático puede predecir el tamaño exacto de la próxima disrupción del mercado. Sin embargo, podemos estar mejor preparados ante los acontecimientos inesperados si entendemos qué efecto tienen sobre el mercado en su conjunto las variables que ese acontecimiento modifica. Por ejemplo, si un gran exportador de materias primas queda fuera del mercado internacional por sanciones o por una guerra comercial, cualquier predicción de mercado basada en precios históricos queda obsoleta. Sin embargo, entender el efecto que la caída de las exportaciones tiene sobre el mercado ayuda a comprender mejor cuál será el efecto de las sanciones. La inferencia causal nos permite usar los datos junto con nuestro conocimiento de la dinámica del mercado para responder a preguntas como «¿Qué pasará si las importaciones de un determinado país caen a cero?», aunque eso nunca haya ocurrido antes. De este modo, la inferencia causal complementa a las predicciones al aportar una comprensión más sólida y resiliente del comportamiento del mercado.

Entender y estimar causas y efectos puede ayudar en la toma de decisiones estratégicas. Si una empresa quiere aumentar de forma significativa la producción de un bien, tiene que tener en cuenta el cambio de precios que eso provocará. Por lo general, una decisión así no queda recogida en las predicciones, ya que estas se basan únicamente en datos históricos del mercado. Es cierto que probablemente eso no sea un problema para las empresas pequeñas, con un impacto limitado en el mercado. Pero los grandes actores necesitan saber cómo influyen sus acciones en el mercado en su conjunto. La inferencia causal lo hace posible. Si conocemos el efecto de un aumento de la producción sobre los precios de mercado, podemos estimar mejor los resultados de la decisión de una empresa. Así, mediante modelos de inferencia causal, podemos aprovechar la potencia de la IA para la planificación y la estrategia corporativas.

Por último, la inferencia causal permite una mayor flexibilidad en la planificación. Podría permitir a nuestros clientes considerar distintos escenarios y ver cómo repercuten en los mercados. Por ejemplo, si hay incertidumbre sobre el tiempo de los próximos meses, una empresa puede consultar los efectos habituales de distintas condiciones meteorológicas sobre los precios de la leche y planificar en consecuencia. O bien, si una empresa cree que su competidor podría aumentar rápidamente la importación de mantequilla por la firma de una nueva alianza, puede prepararse estimando los efectos que ese movimiento tendrá sobre los precios de la mantequilla. De este modo, el análisis causal puede complementar a las predicciones para ofrecer información de mercado más adaptada a cada caso.

El paquete DoWhy para la inferencia causal

Para desarrollar un motor de inferencia causal completo, utilizamos una biblioteca de Python de código abierto creada por Microsoft: DoWhy (Sharma, Kiciman, 2020). Tal como la describen sus autores: al igual que las bibliotecas de aprendizaje automático han hecho con la predicción, «DoWhy» es una biblioteca de Python que aspira a impulsar el pensamiento y el análisis causales. La biblioteca ofrece un marco para estimar efectos causales y efectos causales condicionales. Combina enfoques de la causalidad desarrollados en el aprendizaje automático, la estadística y la economía, lo que permite una mayor flexibilidad. La biblioteca todavía está en fase beta, pero ya cuenta con un conjunto impresionante de funcionalidades.

El enfoque DoWhy de la inferencia causal consta de cuatro pasos:

- Modelar el problema - Identificar la relación causal - Estimar la magnitud de la relación - Refutar los resultados

El primer paso es sencillo: para realizar el análisis causal necesitamos tener codificado un grafo causal, de modo que la biblioteca pueda interpretarlo. Además, tenemos que elegir las variables de resultado y de tratamiento. En nuestro caso: los precios de la mantequilla y la producción de mantequilla.

En el segundo paso, DoWhy utiliza el do-calculus para encontrar los posibles factores de confusión: variables que podrían interferir en la relación causal entre la variable de tratamiento (la producción de mantequilla) y la de resultado (los precios de la mantequilla). Un factor de confusión podría ser una causa común: por ejemplo, el nivel de existencias de mantequilla puede influir tanto en la producción como en los precios, así que tenemos que tenerlo en cuenta. El do-calculus es un sistema formal que, dado un grafo causal, permite al algoritmo encontrar todos esos factores de confusión. Está demostrado que, con el do-calculus, el programa siempre puede determinar si, con los datos de que disponemos, la relación causal de interés puede identificarse. Gracias a eso, en este paso podemos confiar plenamente en la biblioteca DoWhy.

El tercer paso, la estimación de la relación causal, es el que más trabajo exige al programador. Cuando conocemos todas las variables que debemos tener en cuenta (controlar), todavía nos queda elegir un modelo estadístico para estimar la magnitud de esa relación. Entre los modelos más populares están la regresión lineal simple, las regresiones de contracción como LASSO (Tibshirani, 1996) o Ridge (Hoerl, Kennard, 1970), los modelos de double machine learning (Chernozhukov et al., 2016) y los causal forests (Wager, Athey, 2018). Los dos últimos nos permiten estimar no solo el efecto causal medio, sino también el efecto causal condicionado al valor de alguna otra variable. Por ejemplo, ¿cuál es el impacto esperado de producir más mantequilla sobre el precio de la mantequilla para distintos niveles de existencias de mantequilla? Este paso es similar al ejercicio de predicción habitual, familiar para todos los ingenieros de aprendizaje automático y los científicos de datos. Gracias a eso, las competencias ya desarrolladas para las predicciones pueden reutilizarse para implementar herramientas de inferencia causal.

Por último, DoWhy integra una herramienta completa para comprobar y refutar las estimaciones causales. Por ejemplo, se puede añadir al modelo un factor de confusión aleatorio y ver si los resultados son robustos. Gracias a eso, se puede asegurar que los resultados obtenidos son válidos, sólidos y fiables. DoWhy hace que el desarrollo de nuestras herramientas de inferencia causal sea más fácil y rápido, y nos permite ofrecer información mejor, más completa y más flexible sobre el mercado de materias primas.

Resultados de la inferencia causal

Utilizamos el grafo de la estructura del mercado para estimar los efectos causales de la producción, la importación y la exportación de mantequilla sobre los precios de la mantequilla. Es razonable esperar que la producción y la importación reduzcan los precios, mientras que la exportación los aumente. Sin embargo, con eso no basta. Para tomar decisiones precisas y bien fundamentadas es necesario conocer el tamaño de esos efectos. ¿Reduce la importación los precios más de lo que lo hace la producción? ¿Son similares en magnitud los efectos de la importación y de la exportación sobre los precios? Para responder a estas preguntas necesitamos datos de alta calidad e inferencia causal.

Estimamos que la producción de una tonelada adicional de mantequilla reduce el precio de una tonelada de mantequilla en 0,0046 euros. Es decir, producir 1.000 t de mantequilla reduce el precio en 4,6 euros. El efecto de la importación va en la misma dirección, pero es mucho mayor. Importar 1.000 t de mantequilla reduce el precio de una tonelada de mantequilla hasta en 16,8 euros. Exportar 1.000 t de mantequilla, en cambio, aumenta el precio de una tonelada de mantequilla en 6,2 euros. Los efectos operan en la dirección esperada y son sustanciales y significativos. De todos ellos, la importación tiene el efecto más sustancial, muy superior al de la exportación y al de la producción.

El motor de inferencia causal de Vesper también nos permite estimar los efectos causales esperados condicionados a otras variables. Conocemos los efectos medios de la producción de mantequilla, pero ¿cómo dependen del nivel de existencias de mantequilla? Para responder a esta pregunta, estimamos y representamos un modelo con efectos causales heterogéneos en función de las existencias de mantequilla para los tres factores que nos interesan: la producción, la importación y la exportación de mantequilla.

Los efectos de la producción de mantequilla sobre los precios son más pronunciados y significativos cuando los niveles de existencias de mantequilla son bajos. Si las existencias están por debajo de 100.000 t, el efecto de producir 1.000 t adicionales de mantequilla puede llegar a 7 euros. Los efectos se hacen menores a medida que aumentan los niveles de existencias de mantequilla y son estadísticamente indistinguibles de cero para niveles de existencias superiores a 150.000 t. Esto muestra que un nivel elevado de existencias de mantequilla puede tener un efecto amortiguador sobre el mercado, al reducir cualquier efecto inmediato de la producción adicional.

Captura de pantalla 2022-06-28 a las 15.04.55

Vemos una historia distinta en el caso de las importaciones de mantequilla. El efecto causal de importar más mantequilla no depende del nivel de existencias de mantequilla, y la tendencia que se aprecia levemente no es estadísticamente significativa. Importar más mantequilla tiene efectos negativos fuertes sobre los precios sea cual sea el nivel de existencias, aunque los efectos estimados en el caso de un nivel de existencias alto son bastante imprecisos.

Captura de pantalla 2022-06-28 a las 15.05.43

Por último, los efectos de la exportación son, al igual que los de la producción, sensibles al nivel de existencias. Los mayores efectos positivos sobre los precios se aprecian cuando las existencias son escasas. En ese caso, exportar 1.000 t de mantequilla puede aumentar el precio por tonelada hasta en 14 euros. Ese efecto disminuye con fuerza y deja de ser significativo para niveles de existencias superiores a 140.000 t. Esto muestra que la exportación tiene un impacto real sobre los precios solo cuando la mantequilla no es demasiado abundante. Para niveles de existencias muy altos, la exportación se convierte en una necesidad más que en una estrategia, y su impacto causal sobre los precios se desvanece.

Captura de pantalla 2022-06-28 a las 15.08.00

Conclusiones clave

La información mencionada arriba ayuda a compradores, vendedores y traders del mercado de materias primas agrícolas a tomar decisiones más fundamentadas. Si esta información le resulta útil y quiere saber qué más puede ofrecerle Vesper, solicite una demo con Yannick Aink: Yannick@vespertool.com.

Referencias

  • Eichler, Michael. Causal inference in time series analysis. na, 2012.
  • Moraffah, Raha, et al. “Causal inference for time series analysis: Problems, methods and evaluation.” Knowledge and Information Systems (2021): 1–45.
  • Blog, Netflix Technology. “A Survey of Causal Inference Applications at Netflix.” Medium, Netflix TechBlog, 6 June 2022, https://netflixtechblog.com/a-survey-of-causal-inference-applications-at-netflix-b62d25175e6f.
  • Amit Sharma, Emre Kiciman. DoWhy: An End-to-End Library for Causal Inference. 2020. https://arxiv.org/abs/2011.04216
  • Tibshirani, Robert. “Regression shrinkage and selection via the lasso.” Journal of the Royal Statistical Society: Series B (Methodological) 58.1 (1996): 267–288.
  • Hoerl, Arthur E., and Robert W. Kennard. “Ridge regression: Biased estimation for nonorthogonal problems.” Technometrics 12.1 (1970): 55–67.
  • Chernozhukov, Victor, et al. “Double/debiased machine learning for treatment and causal parameters.” arXiv preprint arXiv:1608.00060 (2016).
  • Wager, Stefan, and Susan Athey. “Estimation and inference of heterogeneous treatment effects using random forests.” Journal of the American Statistical Association 113.523 (2018): 1228–1242.

Visite medium.com/vespertool para leer más artículos sobre ciencia de datos y desarrollo en Vesper.