Kukuri · MétodoEcommerce & D2C

La ficha técnica.

↓   14 bloquesMétodo · modelo · datos · validación

En /metodo lo decimos así: «si un día te hablamos de un modelo, será con su nombre». Esta página es ese día. La ficha técnica de lo que montamos para ecommerce y D2C — qué modelos, sobre qué datos, con qué stack y cómo se valida cada pieza. Sin adornos.

Capítulo 00
Infraestructura base

Común a todo lo que sigue.

Fuentes: Shopify Admin API (orders, customers, products, checkouts vía bulk operations), Klaviyo API, Meta Marketing API + Conversions API, Google Ads API, GA4 export a BigQuery.

Ingesta: Fivetran o Airbyte. Almacén: BigQuery o Snowflake. Transformación: dbt (modelos versionados, tests de calidad).

Activación (reverse ETL): Hightouch o Census para empujar segmentos/scores a Klaviyo, Meta Custom Audiences y Google Customer Match.

Cómputo: Python — pandas, scikit-learn, lightgbm/xgboost, lifetimes, PyMC, mlxtend, implicit, statsmodels. Orquestación: cron/Airflow/Dagster. Visualización: Metabase, Looker o Power BI.

El almacén y el cómputo viven en la cuenta del propio cliente — su BigQuery o su Snowflake, su proyecto de cloud —, no en infraestructura de Kukuri. «Tus datos se quedan en tu casa» también aquí.
Capítulo 01
Incrementalidad de publicidad

Geo-experiments con control sintético.

Método: geo-experiments con control sintético. Partición del territorio en grupos test/control, manipulación del gasto (on/off o scale), estimación del contrafactual con el paquete GeoLift (Meta, R/Python, basado en synthetic control de Abadie-Gardeazabal).

Requisitos previos: análisis de potencia (nº mínimo de geos, duración, MDE — minimum detectable effect), datos de ventas y gasto por región.

Alternativa user-level: conversion lift / ghost ads (PSA holdout).

Output: iROAS (ROAS incremental) e intervalo de confianza por canal.

Validación: el propio diseño experimental es la validación (grupo de control).

Capítulo 02
Value-based bidding (pLTV)

Pujar por el valor futuro del cliente, no por el lead.

Modelo de valor: (a) probabilístico BG/NBD para frecuencia futura + Gamma-Gamma para valor monetario (librería lifetimes), o (b) regresión/clasificación con LightGBM sobre features tempranas (recencia/frecuencia/monetario del primer ciclo, categoría de primer producto, fuente de adquisición, señales de sesión).

Target: pLTV a 6-12 meses o clasificación high-value (binaria por percentil).

Activación: inyección del valor en Meta CAPI (parámetro value del evento Purchase), Google Enhanced Conversions / offline conversion import con el pLTV como valor de conversión, y value rules.

Validación: holdout de campaña (A/B de estrategia de puja) durante 60-120 días.

Dependencia crítica: tracking server-side robusto (bloque 03).

Capítulo 03
Tracking server-side

La señal fiable de la que depende todo lo demás.

Stack: GTM server-side container + Meta CAPI + GA4 Measurement Protocol. Deduplicación cliente/servidor con event_id compartido.

Matching: maximización de EMQ (Event Match Quality): hash SHA-256 de email/teléfono/nombre en parámetros de matching.

Cumplimiento: Consent Mode v2 para RGPD (modelado de conversiones bajo no-consentimiento).

Métricas de control: match rate, event coverage, deduplication rate.

Capítulo 04
Elasticidad de precios

Curva de demanda por SKU y detección de inelásticos.

Estimación: regresión log-log (ln Q ~ ln P + controles de estacionalidad/promoción/tendencia) sobre histórico para elasticidad-precio por SKU o categoría; donde el histórico no tiene variación de precio suficiente, price A/B testing con asignación de variante ligada al checkout (no solo front-end). Inferencia bayesiana (PyMC) con priors informativos cuando hay pocos datos.

Criterio: SKU inelástico = |elasticidad| < 1 con volumen estable. Significancia calculada sobre margen de contribución, no sobre tasa de conversión.

Output: curva de demanda por SKU, elasticidad puntual, precio óptimo de margen.

Validación: test A/B de precio confirmatorio post-modelo.

Capítulo 05
Optimización de promociones

Separar venta incremental de canibalizada y adelantada.

Método: uplift modeling de promociones (medición incremental con holdout de exposición) para descomponer venta en incremental / canibalizada / adelantada (pull-forward). Análisis de solapamiento estacional (deseasonalizar antes de medir lift).

Métricas: incrementalidad de la promo, ROI promocional, tasa de canibalización entre SKU.

Validación: grupo de control no expuesto.

Capítulo 06
Cross-sell / market basket

Qué recomendar a quién, ponderado por margen.

Reglas de asociación: Apriori o FP-Growth (mlxtend) sobre cestas → soporte, confianza, lift por itemset.

Recomendación personalizada: filtrado colaborativo implícito (factorización matricial ALS, librería implicit) o item2vec (embeddings de co-ocurrencia con word2vec sobre secuencias de compra).

Ranking de next-best-product: score = P(compra | cliente) × margen × lift, no solo popularidad.

Activación: API de recomendación en web + inyección de producto en flujos Klaviyo.

Validación: A/B del widget/flujo (grupo con vs sin recomendación).

Capítulo 07
AOV, bundles y umbrales

El umbral de envío gratis que maximiza margen, no ventas.

Bundles: diseño desde matriz de afinidad (lift) ponderada por margen.

Umbral de envío gratis: cálculo sobre la distribución de valor de pedido del punto que maximiza margen total (trade-off entre lift de AOV y coste de envío absorbido).

Capa de activación: order bumps/upsell post-compra (herramientas de terceros), no como modelo.

Validación: A/B del umbral y de la composición del bundle.

Capítulo 08
Churn · CLV · RFM

Quién sigue vivo, cuánto vale y cuándo vuelve (no-contractual).

Modelo probabilístico: BG/NBD para P(vivo) y frecuencia esperada + Gamma-Gamma para valor → CLV predictivo (lifetimes).

Modelo ML paralelo: clasificador de churn (LightGBM/XGBoost) con features de RFM, decaimiento de engagement (Δ días desde última interacción / cadencia esperada del cliente), tenure, categoría, canal de adquisición; explicabilidad con SHAP.

Fecha de próxima compra: modelos de supervivencia (Cox, o Weibull AFT) / hazard, o el propio BG/NBD.

Capa de acción base: segmentación RFM por quantiles (5×5×5 o cuantiles adaptados).

Output: score de riesgo + P(vivo) + CLV + fecha esperada por cliente, escritos a Klaviyo vía reverse ETL.

Validación: backtest temporal (train en t, evaluar en t+n), AUC/precision-recall, calibración.

Capítulo 09
Winback y segunda compra

Uplift: no se targetea al probable, se targetea al influenciable.

Modelo: uplift/CATE (two-model, class transformation, o uplift trees / causal forests, librerías causalml / scikit-uplift) para identificar persuadables — segmentación en persuadables / sure things / lost causes / do-not-disturbs.

Diferencia con propensión: no se targetea al probable, se targetea al influenciable.

Aplicación: winback de dormidos (definición de dormido por cadencia individual, no umbral fijo) y flujo de segunda compra (ventana óptima por producto derivada de la distribución de intercompra).

Validación: campaña con holdout, medición de uplift incremental real vs control.

Capítulo 10
Suscripción

Qué SKU, a qué descuento, sin destruir margen.

Modelado: curvas de retención por cohorte de suscripción, LTV/breakeven por SKU y nivel de descuento, proyección de churn de suscripción.

Diseño económico: qué SKU y a qué descuento sin destruir margen (simulación de escenarios sobre curva de churn).

Dunning: lógica de reintentos de pago (recuperación de baja involuntaria por fallo de tarjeta).

Activación: apps de suscripción (Recharge/Appstle/Stay) como capa de ejecución.

Validación: cohortes reales post-lanzamiento.

Capítulo 11
Cuadro de mando · single customer view

La infraestructura que alimenta todos los modelos anteriores.

Pipeline: ELT (Fivetran/Airbyte) → warehouse → modelado dbt → capa de métricas.

Resolución de identidad: unificación de pedidos/eventos por email/teléfono/device_id en un customer_id único (deterministic matching; probabilístico solo con cautela RGPD).

Métricas modeladas: LTV, CAC, contribución de margen por canal, MER (marketing efficiency ratio), cohortes de retención, repeat rate, AOV, inventario.

Salida: panel con refresco programado.

Capítulo 12
CRO · experimentación de web

Potencia estadística antes que opiniones.

Diseño: cálculo de tamaño muestral y potencia (MDE, α, β), frecuentista o bayesiano (posterior de probabilidad de que B>A, para lectura temprana sin inflar falso positivo).

Reducción de varianza: CUPED (Controlled-experiment Using Pre-Experiment Data) con covariables pre-test → detecta efectos con menos tráfico. Corrección de tests secuenciales / alpha spending.

Research previo: heatmaps y session recordings (Microsoft Clarity), encuestas on-site, análisis de embudo en GA4.

Restricción: requiere volumen de tráfico para potencia estadística.

Validación: es el propio experimento.

Capítulo 13
Previsión de demanda · inventario

Del forecast por SKU a la política de reposición.

Forecasting: LightGBM con features de lags, medias móviles, estacionalidad (Fourier), calendario, promociones y precio (suele superar a Prophet/ARIMA en retail con drivers); forecasting jerárquico con reconciliación (SKU→categoría→total, MinT); Croston / SBA para demanda intermitente.

Derivados: punto de pedido (reorder point), stock de seguridad (función del error de forecast y lead time), modelo del newsvendor para cantidad óptima de compra.

Métricas: MAE/MAPE/WMAPE, bias, fill rate.

Output: forecast por SKU + política de reposición.

Capítulo 14
Reducción de devoluciones

Probabilidad de devolución por pedido y causa raíz.

Modelo: clasificador de probabilidad de devolución por pedido/línea (LightGBM) con features de talla/fit, historial de devoluciones del cliente, combinación de productos en la cesta, categoría, descuento aplicado; drivers con SHAP para atacar causa raíz.

Aplicación: intervención sobre pedidos de alto riesgo (guía de talla, contacto proactivo) y ajuste de catálogo/fichas.

Validación: A/B de la intervención.

Capítulo 15
Principio transversal

El foso no es la herramienta: es la decisión y la medición.

Todo es inferencia causal (diseño experimental: geo-tests, holdouts, A/B) + modelado predictivo (BG/NBD, gradient boosting, uplift, survival, forecasting) sobre datos transaccionales propios, con activación vía reverse ETL.

El foso frente a las herramientas de mercado: ellas ejecutan la acción; el modelo que decide a quién/qué/cuándo y la medición incremental honesta de si funcionó, no.

Sin promesas. Tu número sobre la mesa.