Curación de Catálogo Arancelario
Budget: $30 – $250 USD
Título del trabajo
Curación y validación de catálogo arancelario estructurado (arancel_aduanas_structured_v1.json) contra PDF oficial DIAN
Objetivo
Pulir y corregir el contenido de un archivo.json para que quede 1:1 con la fuente oficial PDF del arancel.
Qué debe hacer (alcance exacto)
Corregir estructura y contenido de capítulos, notas de sección/capítulo/subpartida y grilla arancelaria.
Corregir jerarquía de grid_rows:
row_type correcto (heading|subheading|leaf|label_only)
indent_level coherente
parent_row_id correcto (sin hijos mal colgados)
hs_code, text, scope_hint correctos
Corregir casos de texto mezclado o arrastrado entre filas (ej: “Machos Búfalos” cuando son filas separadas).
Asegurar que no se corten estructuras por página (continuaciones correctamente unidas).
Mantener consistencia entre grid_rows y grid_tree (si cambia uno, actualizar el otro).
Reglas de calidad (obligatorias)
No inventar contenido: todo debe salir del PDF.
No perder información normativa.
No duplicar filas/notas.
Si hay ambigüedad real del PDF, marcarla en reporte, no “adivinar”.
Mantener formato JSON válido y estable.
Entregables obligatorios
JSON corregido final.
Reporte de cambios (por capítulo) con:
filas corregidas
notas corregidas
jerarquías parent/hijo ajustadas
ambigüedades detectadas
Evidencia de validación:
conteo total de capítulos procesados
lista de capítulos 100% revisados
lista de pendientes (si existieran)
Criterios de aceptación (te pagan contra esto)
Muestreo QA sobre capítulos críticos (ej. 01, 02, 27, 39, 48, 87) sin errores de jerarquía/texto.
Cero errores de formato JSON.
Cero parent_row_id inválidos.
Cero leaf con hs_code vacío.
Cero mezcla de filas por OCR mal pegado en los capítulos revisados.
Forma de trabajo recomendada
Entrega por lotes (ej. 10 capítulos por lote).
Cada lote se aprueba con QA antes de pasar al siguiente.
Pago por hito/lote aprobado (no todo al final).
Qué NO debe hacer
No cambiar esquema del JSON sin autorización.
No “optimizar” ni refactorizar: solo curación de contenido.
Curación y validación de catálogo arancelario estructurado (arancel_aduanas_structured_v1.json) contra PDF oficial DIAN
Objetivo
Pulir y corregir el contenido de un archivo.json para que quede 1:1 con la fuente oficial PDF del arancel.
Qué debe hacer (alcance exacto)
Corregir estructura y contenido de capítulos, notas de sección/capítulo/subpartida y grilla arancelaria.
Corregir jerarquía de grid_rows:
row_type correcto (heading|subheading|leaf|label_only)
indent_level coherente
parent_row_id correcto (sin hijos mal colgados)
hs_code, text, scope_hint correctos
Corregir casos de texto mezclado o arrastrado entre filas (ej: “Machos Búfalos” cuando son filas separadas).
Asegurar que no se corten estructuras por página (continuaciones correctamente unidas).
Mantener consistencia entre grid_rows y grid_tree (si cambia uno, actualizar el otro).
Reglas de calidad (obligatorias)
No inventar contenido: todo debe salir del PDF.
No perder información normativa.
No duplicar filas/notas.
Si hay ambigüedad real del PDF, marcarla en reporte, no “adivinar”.
Mantener formato JSON válido y estable.
Entregables obligatorios
JSON corregido final.
Reporte de cambios (por capítulo) con:
filas corregidas
notas corregidas
jerarquías parent/hijo ajustadas
ambigüedades detectadas
Evidencia de validación:
conteo total de capítulos procesados
lista de capítulos 100% revisados
lista de pendientes (si existieran)
Criterios de aceptación (te pagan contra esto)
Muestreo QA sobre capítulos críticos (ej. 01, 02, 27, 39, 48, 87) sin errores de jerarquía/texto.
Cero errores de formato JSON.
Cero parent_row_id inválidos.
Cero leaf con hs_code vacío.
Cero mezcla de filas por OCR mal pegado en los capítulos revisados.
Forma de trabajo recomendada
Entrega por lotes (ej. 10 capítulos por lote).
Cada lote se aprueba con QA antes de pasar al siguiente.
Pago por hito/lote aprobado (no todo al final).
Qué NO debe hacer
No cambiar esquema del JSON sin autorización.
No “optimizar” ni refactorizar: solo curación de contenido.
Related categories:
Data Processing
Data Entry
JSON
Data Cleansing
Data Analysis
Data Integration
Data Governance
Data Management