Investigación · datos abiertos
Inclusión financiera y crecimiento regional en Colombia
Un warehouse abierto de fuentes públicas, un índice por dimensiones, dos paneles anuales, un atlas de los 1.123 municipios y una batería econométrica que responde la pregunta con su N, sus clústeres y sus pruebas.
Tesis de Maestría en Economía · Pontificia Universidad Javeriana
Warehouse, índice, atlas y estimaciones publicados · siguen el anexo de desagregación temporal y el manuscrito
- 19fuentes públicas con manifiesto y sha256
Superintendencia Financiera, DANE, MinTIC, MEN y el Marco Geoestadístico
- 2018–2025de panel anual sin un solo valor repetido
264 filas departamentales y 231 crecimientos, ninguno duplicado
- 1.123municipios en el panel, 1.121 con polígono
2018–2024 · 7.861 filas municipales
- 15especificaciones publicadas, cada una con su N y su p
cuatro diseños contra la exogeneidad, bootstrap salvaje y placebo
Resumen
¿La inclusión financiera predice el crecimiento económico de los departamentos colombianos una vez descontadas las tendencias nacionales que los mueven a todos a la vez? Para responderla, el proyecto descarga diecinueve fuentes públicas con un manifiesto verificable, resuelve cada serie al código municipal DIVIPOLA, las modela en un esquema estrella con vintages sobre dbt y DuckDB, y construye un índice de inclusión financiera por dimensiones con pesos congelados y publicados por variable. Encima van dos paneles anuales, departamental y municipal, un atlas interactivo y una batería econométrica de efectos fijos de dos vías, diagnósticos de dependencia transversal y espacial, cuatro diseños que no dependen de la exogeneidad del índice, y una inferencia hecha para 33 clústeres. La respuesta se publica con su especificación, su N y sus pruebas, sea cual sea el signo.
Atlas
El índice sobre el mapa, por departamento y por municipio
Tres vistas de los mismos datos. Plano, con las métricas alrededor; relieve, para levantar un departamento y verlo aparte; y municipios, para bajar a las 1.123 unidades. Al fijar un departamento se puede descender a sus municipios desde el propio mapa, y elegir una región acerca el encuadre a esa selección dejando los vecinos sangrando por el borde.
Cargando el mapa y sus series…
- Un territorio sin color no vale cero: es un territorio del que ninguna entidad vigilada reportó operaciones ese año.
- La altura de los bloques es constante y no codifica nada. Una altura que dependiera del valor haría que las unidades de adelante taparan a las de atrás, y el dato de una unidad no debe depender de dónde cae en el mapa.
- El archipiélago de San Andrés va como ficha fuera de escala: está a 700 km del continente y mide 26 km², de modo que dentro del encuadre encogía el mapa una quinta parte para pintar un punto.
- Dos de los 1.123 municipios del panel no tienen polígono en el Marco Geoestadístico 2024: aparecen en el ranking y en las cifras, pero no en el mapa.
Datos
Diecinueve fuentes públicas, con la huella de cada descarga
Adquisición con manifiesto
Un descargador propio pagina las API de datos abiertos, verifica el conteo contra la fuente, tipa cada columna con los metadatos del portal y guarda Parquet particionado por año. Cada descarga deja fecha de la fuente, filas, bytes y sha256 en un manifiesto versionado.
Claves geográficas resueltas
Las tablas de la Superintendencia no declaran el código DIVIPOLA, pero lo llevan implícito en la columna de renglón. Resolverlo da cobertura del 100 % en los 34 cortes trimestrales y evita el cruce por nombre, que falla con acentos y alias.
Warehouse dimensional con dbt
Esquema estrella con hechos por vintage sobre DuckDB: dimensiones de departamento, municipio, periodo y las 98 variables de la Superintendencia con su regla de anualización; la inclusión en formato largo por bloque de producto.
El empalme, medido
La tabla vigente sustituye a la anterior en 2021Q1, y ese trimestre existe en las dos: es una prueba natural del empalme. La diferencia mediana por departamento es del 0,02 % y el peor caso llega al 1,8 %; una prueba de dbt falla si esos umbrales se rompen.
Frecuencia anual, dos paneles
El PIB subnacional es anual: ningún valor anual se repite en cuatro trimestres. El panel departamental cubre 2018 a 2025 con 231 observaciones de crecimiento y ninguna repetida; el municipal, 2018 a 2024 sobre el valor agregado municipal del DANE.
Un cero no es un dato
Los ceros de la Superintendencia y del Ministerio de Educación son ausencias, no valores: fuera del bloque de producto de cada fila desaparecen por construcción. En el mapa, un territorio sin color es un territorio del que nadie reportó, y eso no es lo mismo que cero.
El índice
Se mide el supuesto antes de elegir el método
Ocho variables, tres dimensiones
Acceso, uso y profundidad, cada una con sus variables normalizadas por adultos o por producto y estandarizadas en la ventana de calibración. Dieciocho candidatas quedaron fuera, cada una con su motivo escrito.
El PCA se descartó midiéndolo
La medida de adecuación muestral da 0,314 en acceso y 0,404 en uso, por debajo del umbral de 0,5 que hace falta para factorizar. Forzarlo produce pesos implícitos negativos en microcrédito, que es un índice que dice que más crédito es menos inclusión.
Pesos iguales, congelados y publicados
Dentro de cada dimensión los pesos son iguales, se fijan en la ventana 2018–2019 y no se vuelven a tocar. Los pesos implícitos por variable se publican siempre, y ninguno puede ser negativo.
Sensibilidad a la vista
El PCA y el índice de distancia de Sarma se calculan igual y se publican como alternativas, con la correlación de rangos entre las tres versiones. Ninguna se esconde.
Cero es un promedio, no una ausencia
El índice está estandarizado contra el promedio de los departamentos en la ventana de calibración. Un valor de 2 son dos desviaciones por encima de aquel promedio, no “el doble de inclusión”.
Resultados
Con efectos de entidad y tiempo, el coeficiente es cero
La inclusión financiera no predice el crecimiento departamental una vez descontada la tendencia nacional.
β = +0,0007 · p = 0,90
Treinta y tres departamentos, 2019 a 2025, 228 observaciones. Con efectos fijos de entidad y de tiempo, el índice compuesto no mueve el crecimiento del PIB real per cápita: el bootstrap salvaje por clúster da p = 0,89 y el placebo por permutación p = 0,68. Sin efectos de tiempo el mismo coeficiente vale +0,024 con p < 0,001. Esa distancia es exactamente lo que valía la tendencia nacional: el índice sube en todos los departamentos a la vez, y cualquier variable que también suba con los años se le parece.
| Especificación | β | EE | p | N |
|---|---|---|---|---|
| Efectos de entidad y tiempo (base) | +0,0007 | 0,0060 | 0,90 | 228 |
| Base con errores de Driscoll-Kraay | +0,0007 | 0,0037 | 0,84 | 228 |
| Solo efectos de entidad | +0,0242 | 0,0050 | < 0,001 | 228 |
| En cambios del índice | −0,0071 | 0,0051 | 0,16 | 226 |
| CCE, cargas heterogéneas por departamento | +0,0014 | 0,0086 | 0,87 | 228 |
| SLX, rezago espacial del índice | +0,0046 | 0,0066 | 0,49 | 221 |
| Shift-share, exposición 2018 × adopción nacional | +0,0182 | 0,0067 | 0,007 | 223 |
- 0,89
- p del bootstrap salvaje por clúster
- 0,68
- p del placebo por permutación
- 2,46
- CD de Pesaran sobre los residuos
999 réplicas de Rademacher con la nula impuesta sobre 33 departamentos
499 barajados del índice dentro de cada año; el coeficiente real cae en el centro de la nube
dependencia transversal débil pero presente (p = 0,014); por eso Driscoll-Kraay acompaña al clúster
- 1Las tres dimensiones por separado, la especificación en cambios, el CCE, el SLX y los dos índices alternativos dan lo mismo: cero.
- 2El único diseño con señal es el shift-share. Sobrevive al ingreso inicial como placebo, pero la urbanización inicial produce una pendiente igual de significativa (+0,051, p = 0,013): recoge que los departamentos más urbanos, que son también los más incluidos, crecieron más rápido en el periodo. Es una pendiente diferencial, no un efecto del índice, y se publica así.
- 3El estudio de eventos alrededor de 2020 no puede contrastar tendencias previas —la dependiente empieza en 2019 y el choque es 2020— y se publica con esa limitación escrita.
Decisiones
Cada decisión de valor está escrita antes del código
Las decisiones que cambian un resultado —la frecuencia, el modelo de datos, el método del índice, el diseño econométrico— van a un registro de decisión con sus alternativas, su coste y cómo revertirla. Las constantes viven en un solo sitio y ninguna cifra publicada existe sin la prueba que la sostiene.
Frecuencia anual, dos paneles
El producto subnacional es anual y ningún valor anual se reparte en cuatro trimestres. La desagregación temporal queda como anexo, con sus advertencias.
Esquema estrella con vintages
Claves naturales, hechos por descarga y un empalme de esquema medido en el trimestre que existe en las dos fuentes.
Índice por dimensiones con supuesto medido
Adecuación muestral antes de factorizar; pesos iguales, congelados y publicados; alternativas visibles.
Diseño econométrico
Efectos fijos de dos vías, diagnósticos medidos y no supuestos, cuatro diseños contra la exogeneidad, y bootstrap salvaje porque 33 clústeres no bastan para la asintótica.
Datos derivados con la licencia de la fuente
Lo que sale de la Superintendencia, MinTIC y el Ministerio de Educación se publica CC BY-SA 4.0, con atribución.
Reproducir
Un comando levanta todo el proyecto
uv syncDependencias exactas desde el archivo de bloqueo. Nada se instala fuera de él.
uv run iif acquire allDescarga las diecinueve fuentes, verifica el conteo contra cada API y escribe el manifiesto con sha256.
make checkRuff, 91 pruebas de Python, 250 modelos y pruebas de dbt sobre DuckDB, y el render del sitio. Sale en cero o no hay commit.
uv run iif econCorre la batería econométrica completa en menos de medio minuto y escribe el archivo del que sale cada cifra de esta página.
uv run iif atlasGenera la geometría y las series que consume este mapa, dentro del presupuesto de 3 MB que fija el contrato.
El motor local y de integración continua es DuckDB. BigQuery queda como objetivo alternativo con tope de coste por consulta, y Snowflake como demostración posterior; nada del proyecto depende de que ninguno de los dos siga vivo.
Qué hay y qué llega
El proyecto se publica por fases
- 1Publicado: las diecinueve fuentes con manifiesto, el warehouse completo en dbt, el índice por dimensiones con sus pesos, los dos paneles anuales, el atlas y la batería econométrica con sus resultados.
- 2Después: el anexo de desagregación temporal (Chow-Lin, Denton y Fernández con el indicador trimestral del DANE) y el manuscrito.
- 3Todo el código, los datos derivados y las decisiones están en el repositorio, versionados.