○ planned · proyecto

Otorga nivel a: Data Version Control · Reproducibility

Usa: Reproducibility · Docker · CD · github · Data Version Control

Ramón Valles introduce DVC (Data Version Control), herramienta open source para versionar datos, pipelines y experimentos de ML, enmarcada en la crisis de replicabilidad y comparada con Git, makefiles y Docker.

Hallazgos clave

  • Crisis de replicabilidad: datasets que cambian, versiones de software, procesos manuales (‘versión_final_final’).
  • Prácticas: versionado de código+datos+modelos, pipelines como DAG, bitácora de métricas, ambientes contenerizados.
  • DVC funciona sobre Git: versiona metadatos (.dvc en YAML) y el contenido grande vive en storage content-addressable (S3/GCS).
  • Comandos espejo de Git: dvc add, dvc checkout, dvc push/pull, dvc run.
  • Duplicación de archivos grandes (un cambio re-sube todo) se mitiga con deduplicación por chunks (checksums).

Módulos

  1. Crisis de replicabilidad — definición y factores.
  2. Prácticas de gestión de ML — versionado, DAG, bitácora.
  3. Git y archivos grandes — LFS, Git Annex, CAS.
  4. DVC en detalle — comandos, .dvc, pipelines, experiments.
  5. Ecosistema Iterative AI — CML, DVC Live, vs MLflow.

Fuente: https://www.youtube.com/watch?v=XHpE4vYdHfs · Transcript local: data/cursos/datapub-dvc/dvc.srt

Enlaces

Otorga nivel a: Data Version Control · Reproducibility Usa: Reproducibility · Docker · CD · github · Data Version Control