brasil-cli: los microdatos públicos de Brasil, listos para que un agente de IA los consulte en segundos
Lanzamos brasil-cli 0.4.0 en PyPI: PNADC, Censo 2022, TSE y BCB/IPCA con estimaciones ponderadas, intervalos de confianza por bootstrap y SQL de solo lectura, pensado para agentes LLM.
Pasé dos décadas construyendo motores de búsqueda para encontrar cosas que ya existían pero estaban enterradas — vacantes en Catho, productos en un gran retailer de e-commerce, noticias en G1. El problema nunca fue la falta de datos. Era la fricción entre el dato y quien lo necesitaba.
Brasil tiene, probablemente, el aparato estadístico más sofisticado de América Latina. La encuesta continua de hogares (PNADC), el Censo, los datos electorales del TSE, las series del banco central — todo eso producido con rigor metodológico real, por gente seria, y publicado abiertamente. El problema aparece justo después: descargar un microdato del IBGE, entender el diccionario de variables, aplicar el peso muestral correcto, calcular el error estándar sin cometer un error clásico de diseño muestral. Eso hoy consume días de un analista entrenado — y es demasiado opaco como para que un agente de IA siquiera lo intente.
Por eso lanzamos brasil-cli, ahora en la versión 0.4.0 en PyPI.
Qué hace
pip install brasil-cli te da acceso, vía terminal o SQL de solo lectura, a los microdatos oficiales:
- PNADC (encuesta continua de hogares de Brasil) — empleo, ingreso, fuerza laboral
- Censo 2022
- TSE — datos electorales
- BCB/IPCA — series del Banco Central de Brasil
La diferencia no es solo “tener acceso a los datos”. Es tener acceso a ellos con el rigor estadístico incorporado: estimaciones ponderadas por el diseño muestral, intervalo de confianza calculado vía bootstrap con 200 réplicas, y un sello de auditoría estadística que muestra exactamente qué metodología se aplicó en cada consulta. Nada de tomar un promedio simple de una muestra estratificada y darlo por bueno — ese es el tipo de error que produce un resultado “estadísticamente inválido pero visualmente convincente”, el peor tipo de error que existe.
Construido para agentes, no solo para analistas
brasil-cli fue diseñado desde el primer commit para ser consultado por agentes LLM, no solo por humanos escribiendo comandos. Eso significa una interfaz predecible, salidas estructuradas, SQL de solo lectura para que un agente pueda explorar sin riesgo de corromper nada, y una metodología expuesta en vez de escondida en una caja negra.
Esto importa porque la próxima ola de productos de datos no van a ser dashboards. Va a ser un agente preguntando “¿cuál fue el cambio real de ingreso en el Nordeste rural entre 2019 y 2023, con intervalo de confianza?” y recibiendo una respuesta auditable — no una alucinación con números que parecen plausibles. Construí búsqueda enterprise toda mi carrera sabiendo que relevancia sin precisión es basura bien presentada. Un dato estadístico sin rigor muestral es la misma trampa, solo que más peligrosa, porque parece más confiable.
El límite que respetamos
brasil-cli no es una herramienta oficial del IBGE ni del TSE. Es una capa de acceso y cálculo sobre datos públicos que esas instituciones ya publican. No estamos afiliados, no reemplazamos la fuente primaria, y recomendamos citar siempre al IBGE, al TSE y al Banco Central como las fuentes originales de los microdatos. Lo que hacemos es remover la fricción entre el dato público y quien lo necesita — analista, periodista, investigador o agente.
Esa frase resume por qué existe el proyecto: Brasil se saca fotografías excelentes de sí mismo; la fricción es lo que esconde al país de sí mismo.
Lo que sigue
brasil-cli está en vivo en brasil.arvor.co, y el código es abierto. Es parte de una tesis más amplia de Arvor: los sistemas de conocimiento confiables no nacen de más datos, nacen de menos fricción entre el dato que ya existe y quien necesita razonar sobre él — sea un analista humano o un agente autónomo.
Si tu empresa trata los datos públicos brasileños como insumo — política, crédito, mercado laboral, elecciones — y quiere tenerlos disponibles para que sus propios agentes internos los consulten con seguridad estadística, es exactamente el tipo de sistema que construimos en la consultoría agéntica de Arvor. Escríbenos en /es/contacto.