○ planned · proyecto
Otorga nivel a: Data Version Control · Reproducibility
Usa: Reproducibility · Docker · CD · github · Data Version Control
Ramón Valles introduce DVC (Data Version Control), herramienta open source para versionar datos, pipelines y experimentos de ML, enmarcada en la crisis de replicabilidad y comparada con Git, makefiles y Docker.
Hallazgos clave
- Crisis de replicabilidad: datasets que cambian, versiones de software, procesos manuales (‘versión_final_final’).
- Prácticas: versionado de código+datos+modelos, pipelines como DAG, bitácora de métricas, ambientes contenerizados.
- DVC funciona sobre Git: versiona metadatos (.dvc en YAML) y el contenido grande vive en storage content-addressable (S3/GCS).
- Comandos espejo de Git: dvc add, dvc checkout, dvc push/pull, dvc run.
- Duplicación de archivos grandes (un cambio re-sube todo) se mitiga con deduplicación por chunks (checksums).
Módulos
- Crisis de replicabilidad — definición y factores.
- Prácticas de gestión de ML — versionado, DAG, bitácora.
- Git y archivos grandes — LFS, Git Annex, CAS.
- DVC en detalle — comandos, .dvc, pipelines, experiments.
- Ecosistema Iterative AI — CML, DVC Live, vs MLflow.
Fuente: https://www.youtube.com/watch?v=XHpE4vYdHfs · Transcript local: data/cursos/datapub-dvc/dvc.srt
Enlaces
Otorga nivel a: Data Version Control · Reproducibility Usa: Reproducibility · Docker · CD · github · Data Version Control