Saltar al contenido
Volver al inicioINVESTIGACIÓN

Investigación · datos abiertos

Inclusión financiera y crecimiento regional en Colombia

Un warehouse abierto de fuentes públicas, un índice por dimensiones, dos paneles anuales, un atlas de los 1.123 municipios y una batería econométrica que responde la pregunta con su N, sus clústeres y sus pruebas.

Tesis de Maestría en Economía · Pontificia Universidad Javeriana

Warehouse, índice, atlas y estimaciones publicados · siguen el anexo de desagregación temporal y el manuscrito

Resumen

¿La inclusión financiera predice el crecimiento económico de los departamentos colombianos una vez descontadas las tendencias nacionales que los mueven a todos a la vez? Para responderla, el proyecto descarga diecinueve fuentes públicas con un manifiesto verificable, resuelve cada serie al código municipal DIVIPOLA, las modela en un esquema estrella con vintages sobre dbt y DuckDB, y construye un índice de inclusión financiera por dimensiones con pesos congelados y publicados por variable. Encima van dos paneles anuales, departamental y municipal, un atlas interactivo y una batería econométrica de efectos fijos de dos vías, diagnósticos de dependencia transversal y espacial, cuatro diseños que no dependen de la exogeneidad del índice, y una inferencia hecha para 33 clústeres. La respuesta se publica con su especificación, su N y sus pruebas, sea cual sea el signo.

Atlas

El índice sobre el mapa, por departamento y por municipio

Tres vistas de los mismos datos. Plano, con las métricas alrededor; relieve, para levantar un departamento y verlo aparte; y municipios, para bajar a las 1.123 unidades. Al fijar un departamento se puede descender a sus municipios desde el propio mapa, y elegir una región acerca el encuadre a esa selección dejando los vecinos sangrando por el borde.

Vista

Cargando el mapa y sus series…

  • Un territorio sin color no vale cero: es un territorio del que ninguna entidad vigilada reportó operaciones ese año.
  • La altura de los bloques es constante y no codifica nada. Una altura que dependiera del valor haría que las unidades de adelante taparan a las de atrás, y el dato de una unidad no debe depender de dónde cae en el mapa.
  • El archipiélago de San Andrés va como ficha fuera de escala: está a 700 km del continente y mide 26 km², de modo que dentro del encuadre encogía el mapa una quinta parte para pintar un punto.
  • Dos de los 1.123 municipios del panel no tienen polígono en el Marco Geoestadístico 2024: aparecen en el ranking y en las cifras, pero no en el mapa.

Datos

Diecinueve fuentes públicas, con la huella de cada descarga

Adquisición con manifiesto

Un descargador propio pagina las API de datos abiertos, verifica el conteo contra la fuente, tipa cada columna con los metadatos del portal y guarda Parquet particionado por año. Cada descarga deja fecha de la fuente, filas, bytes y sha256 en un manifiesto versionado.

Claves geográficas resueltas

Las tablas de la Superintendencia no declaran el código DIVIPOLA, pero lo llevan implícito en la columna de renglón. Resolverlo da cobertura del 100 % en los 34 cortes trimestrales y evita el cruce por nombre, que falla con acentos y alias.

Warehouse dimensional con dbt

Esquema estrella con hechos por vintage sobre DuckDB: dimensiones de departamento, municipio, periodo y las 98 variables de la Superintendencia con su regla de anualización; la inclusión en formato largo por bloque de producto.

El empalme, medido

La tabla vigente sustituye a la anterior en 2021Q1, y ese trimestre existe en las dos: es una prueba natural del empalme. La diferencia mediana por departamento es del 0,02 % y el peor caso llega al 1,8 %; una prueba de dbt falla si esos umbrales se rompen.

Frecuencia anual, dos paneles

El PIB subnacional es anual: ningún valor anual se repite en cuatro trimestres. El panel departamental cubre 2018 a 2025 con 231 observaciones de crecimiento y ninguna repetida; el municipal, 2018 a 2024 sobre el valor agregado municipal del DANE.

Un cero no es un dato

Los ceros de la Superintendencia y del Ministerio de Educación son ausencias, no valores: fuera del bloque de producto de cada fila desaparecen por construcción. En el mapa, un territorio sin color es un territorio del que nadie reportó, y eso no es lo mismo que cero.

El índice

Se mide el supuesto antes de elegir el método

Ocho variables, tres dimensiones

Acceso, uso y profundidad, cada una con sus variables normalizadas por adultos o por producto y estandarizadas en la ventana de calibración. Dieciocho candidatas quedaron fuera, cada una con su motivo escrito.

El PCA se descartó midiéndolo

La medida de adecuación muestral da 0,314 en acceso y 0,404 en uso, por debajo del umbral de 0,5 que hace falta para factorizar. Forzarlo produce pesos implícitos negativos en microcrédito, que es un índice que dice que más crédito es menos inclusión.

Pesos iguales, congelados y publicados

Dentro de cada dimensión los pesos son iguales, se fijan en la ventana 2018–2019 y no se vuelven a tocar. Los pesos implícitos por variable se publican siempre, y ninguno puede ser negativo.

Sensibilidad a la vista

El PCA y el índice de distancia de Sarma se calculan igual y se publican como alternativas, con la correlación de rangos entre las tres versiones. Ninguna se esconde.

Cero es un promedio, no una ausencia

El índice está estandarizado contra el promedio de los departamentos en la ventana de calibración. Un valor de 2 son dos desviaciones por encima de aquel promedio, no “el doble de inclusión”.

Resultados

Con efectos de entidad y tiempo, el coeficiente es cero

La inclusión financiera no predice el crecimiento departamental una vez descontada la tendencia nacional.

β = +0,0007 · p = 0,90

Treinta y tres departamentos, 2019 a 2025, 228 observaciones. Con efectos fijos de entidad y de tiempo, el índice compuesto no mueve el crecimiento del PIB real per cápita: el bootstrap salvaje por clúster da p = 0,89 y el placebo por permutación p = 0,68. Sin efectos de tiempo el mismo coeficiente vale +0,024 con p < 0,001. Esa distancia es exactamente lo que valía la tendencia nacional: el índice sube en todos los departamentos a la vez, y cualquier variable que también suba con los años se le parece.

EspecificaciónβEEpN
Efectos de entidad y tiempo (base)+0,00070,00600,90228
Base con errores de Driscoll-Kraay+0,00070,00370,84228
Solo efectos de entidad+0,02420,0050< 0,001228
En cambios del índice−0,00710,00510,16226
CCE, cargas heterogéneas por departamento+0,00140,00860,87228
SLX, rezago espacial del índice+0,00460,00660,49221
Shift-share, exposición 2018 × adopción nacional+0,01820,00670,007223
0,89
p del bootstrap salvaje por clúster

999 réplicas de Rademacher con la nula impuesta sobre 33 departamentos

0,68
p del placebo por permutación

499 barajados del índice dentro de cada año; el coeficiente real cae en el centro de la nube

2,46
CD de Pesaran sobre los residuos

dependencia transversal débil pero presente (p = 0,014); por eso Driscoll-Kraay acompaña al clúster

  • 1Las tres dimensiones por separado, la especificación en cambios, el CCE, el SLX y los dos índices alternativos dan lo mismo: cero.
  • 2El único diseño con señal es el shift-share. Sobrevive al ingreso inicial como placebo, pero la urbanización inicial produce una pendiente igual de significativa (+0,051, p = 0,013): recoge que los departamentos más urbanos, que son también los más incluidos, crecieron más rápido en el periodo. Es una pendiente diferencial, no un efecto del índice, y se publica así.
  • 3El estudio de eventos alrededor de 2020 no puede contrastar tendencias previas —la dependiente empieza en 2019 y el choque es 2020— y se publica con esa limitación escrita.

Decisiones

Cada decisión de valor está escrita antes del código

Las decisiones que cambian un resultado —la frecuencia, el modelo de datos, el método del índice, el diseño econométrico— van a un registro de decisión con sus alternativas, su coste y cómo revertirla. Las constantes viven en un solo sitio y ninguna cifra publicada existe sin la prueba que la sostiene.

Frecuencia anual, dos paneles

El producto subnacional es anual y ningún valor anual se reparte en cuatro trimestres. La desagregación temporal queda como anexo, con sus advertencias.

Esquema estrella con vintages

Claves naturales, hechos por descarga y un empalme de esquema medido en el trimestre que existe en las dos fuentes.

Índice por dimensiones con supuesto medido

Adecuación muestral antes de factorizar; pesos iguales, congelados y publicados; alternativas visibles.

Diseño econométrico

Efectos fijos de dos vías, diagnósticos medidos y no supuestos, cuatro diseños contra la exogeneidad, y bootstrap salvaje porque 33 clústeres no bastan para la asintótica.

Datos derivados con la licencia de la fuente

Lo que sale de la Superintendencia, MinTIC y el Ministerio de Educación se publica CC BY-SA 4.0, con atribución.

Reproducir

Un comando levanta todo el proyecto

  1. uv sync

    Dependencias exactas desde el archivo de bloqueo. Nada se instala fuera de él.

  2. uv run iif acquire all

    Descarga las diecinueve fuentes, verifica el conteo contra cada API y escribe el manifiesto con sha256.

  3. make check

    Ruff, 91 pruebas de Python, 250 modelos y pruebas de dbt sobre DuckDB, y el render del sitio. Sale en cero o no hay commit.

  4. uv run iif econ

    Corre la batería econométrica completa en menos de medio minuto y escribe el archivo del que sale cada cifra de esta página.

  5. uv run iif atlas

    Genera la geometría y las series que consume este mapa, dentro del presupuesto de 3 MB que fija el contrato.

El motor local y de integración continua es DuckDB. BigQuery queda como objetivo alternativo con tope de coste por consulta, y Snowflake como demostración posterior; nada del proyecto depende de que ninguno de los dos siga vivo.

Qué hay y qué llega

El proyecto se publica por fases

  1. 1Publicado: las diecinueve fuentes con manifiesto, el warehouse completo en dbt, el índice por dimensiones con sus pesos, los dos paneles anuales, el atlas y la batería econométrica con sus resultados.
  2. 2Después: el anexo de desagregación temporal (Chow-Lin, Denton y Fernández con el indicador trimestral del DANE) y el manuscrito.
  3. 3Todo el código, los datos derivados y las decisiones están en el repositorio, versionados.