Syllabus Data Engineer + ML/DS — Mercado Chino de Ecommerce 2026 (basado en InfoQ)

Contexto: guía completa derivada de la sesión con PDFs de InfoQ (syllabi de certificación) y transcripts/artículos/podcasts de infoq.com/ai-ml-data-eng + /presentations. Objetivo: posicionarse como data engineer con experiencia en ML/DS para competir en el mercado chino de data science / ecommerce en 2026. Fecha: 2026-09-04.


0. Cómo usar esta guía

  • El syllabus es la columna vertebral (5 módulos, 16 semanas).
  • El mapa temático (sección 1) cruza cada tema con los textos de InfoQ que lo tratan.
  • La lista de fuentes (sección 3) es el inventario completo de recursos, con lo que se pudo extraer y lo que quedó pendiente.
  • El plan de lectura (sección 4) ordena la lectura por semana.
  • La guía para la siguiente sesión (sección 7) es dónde retomar.

1. Mapa temático exhaustivo (temas × módulos)

Temas transversales (aparecen en todos los módulos)

TemaTextos InfoQRelevancia para el objetivo
Comprensión del sistema como característica arquitectural”Comprehension as an Architectural Characteristic” (minibook AI-Assisted Development 2025); “Comprehension at AI Speed: Building a Context Store for Evolutionary Architecture” (minibook Architecture as a Socio-Technical Craft)En datos/DS la debilidad crónica es que nadie entiende el pipeline completo; sin comprensión, la evolución segura es imposible
Contexto como capa de datos”Context is the Key to the Agentic Architecture Revolution” (Baruch Sadogursky, infra-ai-agent-development); eMag Agentic AI Architecture (Adi Polak); DoorDash “From Models to Agents”El contexto (usuario, catálogo, agente, modelo) es una capa de datos a diseñar, versionar y mantener
Observabilidad y evaluación multicapa”Building Evals for AI Adoption” (Mallika Rao); eMag Agentic AI Architecture (Mallika Rao, “From Microservice to Agents: Failure Modes”); “AI Operational Excellence” (AI Engineering semana 5)Competir en ecommerce = medir impacto real, no solo accuracy
Agentic compute como capa de infra”Why Agentic Compute is the Missing Layer” (Arun Joseph, LMOS/Deutsche Telekom); eMag Agentic AI Architecture (Natarajan + Ponnusamy)Los agents (soporte, recomendación, operaciones) son una capa de primera clase
Determinista vs. no determinista”Architecting the Data Layer for AI Agents” (Fabiane Nardo) — fórmula: precisión × seguridad × costoQué lógica (pricing, fraude, recomendación) va a código y cuál a modelos/agents

Módulo 1 — Data Engineering para ML en Ecommerce

Ingesta y pipelines a escala

  • CDC y pipelines incrementales: “Write-Ahead Intent Log: a Foundation for Efficient CDC at Scale” (Vinay Chella, jun 2026)
  • Data lakes a petabyte y lag más allá de offset: “Beyond Offset Lag: Computing Time in Queue for Apache Hudi Data Lake Pipelines at Petabyte Scale” (Srikanth Mamidala, ago 2026)
  • RocketMQ (ecosistema chino, alta disponibilidad): relevante si operas en infra Alibaba/JD/PDD

Feature stores y datos para ML

  • Data mesh como base para data products: “Architecting the Data Layer for AI Agents” (Fabiane Nardo) — cada herramienta MCP como data product con dueño, contrato, SLA
  • Point-in-time correct joins y evitar leakage (prerequisito de cualquier recomendador serio; sin presentación InfoQ exacta)
  • Feature drift, staleness SLAs, validación de features en producción

Observabilidad de datos y data health

  • “Sensor suite”: AI-Assisted Engineering (semanas 2–4) — lint rules, architecture-fitness tests, drift sensors, background cleanup agents
  • Lineage de datos para trazabilidad de modelos
  • SLAs de datos como prerequisito de SLAs de modelo

Módulo 2 — MLOps y Modelos en Producción

Recomendación y ranking para ecommerce

  • Two-tower embeddings, learning-to-rank (LightGBM/XGBoost/deep ranking); Sudeep Das (DoorDash) menciona embeddings asimétricos two-tower en ML tradicional como puente a lo agentic
  • Swiggy: 350+ features, multi-task MLP para LTV (Lela Kumili, sep 2026) — feature engineering a escala
  • A/B testing, observabilidad de impacto, métricas de negocio vs. de modelo

MLOps — versionado, entrenamiento, despliegue

  • GenOS de Intuit: plataforma que habilita 3,500+ experimentos (“Powering the Future: Building Your GenAI Infrastructure Stack”, Merrin Kurian)
  • Layer protocol strategy con A2A y MCP para MLOps multi-agente (“Architecting Agentic MLOps”, minibook AI-Assisted Development 2025)
  • CI/CD para ML: performance gates, fairness checks, rollback

Evaluación multicapa en producción

  • “Building Evals for AI Adoption” (Mallika Rao) — 5 capas: statistical, system, user behavior, business impact, fairness/sesgo
  • LLM-as-a-judge (Merrin Kurian, GenOS)
  • Evaluación de agents con AST-based LLM grading (Bonnie Xu, Kepler/OpenAI, jun 2026)

Módulo 3 — IA Generativa, RAG y Agents

RAG y context engineering

  • eMag Agentic AI Architecture (Adi Polak) — ephemeral vs. durable context, knowledge layer
  • “Beyond Prompting: Context Engineering for Production-Grade AI” (Ricardo Ferreira, sep 2026) — Redis, long/short-term memory, token limits, context rot, semantic caching, cost control
  • “Architecting the Data Layer for AI Agents” (Fabiane Nardo) — semantic ontologies, MCP tool selection dinámico, data mesh

Semantic IDs y representación de catálogo

  • RQ-VAE semantic IDs — Sudeep Das (DoorDash): representar productos con IDs semánticos que un LLM manipula para recomendación (“si vio SID1-3, ¿qué SID4?“)
  • Aplicación a catálogo: título/descripción/atributos → embeddings → semantic IDs

Agents de soporte y operaciones

  • Tool inventory, fail modes, escape hatches (AI Engineering semana 3)
  • “What I Learned Building Multi-Agent Systems from Scratch” (Paulo Arruda, Shopify) — chat simple → swarm, fragmentación de contexto, filesystem adapters (llm-fuse), memoria/Defrag, agentic search vs. AST navigation
  • Claude Swarm / SwarmSDK (1.4k+ GitHub stars)
  • “Agentic Compute” (Arun Joseph) — ephemeral agents, ADL, compute como agent-making machine

Agentic recommendations y consumer memory

  • DoorDash “From Models to Agents” — consumer memory como embeddings interrogables, agentic recommendations, rubric multi-dimensional (communication helpfulness, shopping execution success), agentic harness engineering

Infra para desarrollo de agents

  • “Powering the Future” (Merrin Kurian) — fixed/flexible/free, genOS, AI Workbench, self-serve onboarding, prompt management/versioning/templating, RAG self-serve
  • GenRuntime, GenUX, model family routing

Agentes de datos y análisis

  • Kepler (OpenAI) — agente de análisis sobre 600PB (Bonnie Xu)
  • “Automating the Web with MCP” (Paul Klein) — Firecracker para seguridad de entornos Chromium cloud-hosted

Módulo 4 — Seguridad, Privacidad y Gobernanza

Privacidad y datos en flujos ML/IA

  • PIPL, FSML (Ley de Seguridad de Datos), MLPS — InfoQ NO cubre esto (occidental); requiere fuentes chinas/regulatorias (CAC, estándares GB/T)
  • Data localization, anonimización/pseudonimización, differential privacy, federated learning
  • AI Security & Privacy Engineering (PDF): semanas 1–2 — sensitive data flows, LINDDUN, Plot4AI, red teaming de LLM

Threat modeling, red teaming, guardrails

  • AI Security & Privacy Engineering (PDF): semanas 2–3 — threat modeling, red teaming, guardrails, flow sanitization, sandboxes
  • “Securing MCP in Production: Defense-in-Depth beyond the Gateway” (Nik Kale, jul 2026)
  • OWASP Top 10 LLM Risks (aparece en contexto de central proxy gateways para GPU workloads)

Observabilidad de seguridad y gobernanza

  • AI Security & Privacy Engineering (PDF): semana 4 — observabilidad privacy/security, Arize Phoenix
  • “Virtual panel: Security in the Machine Age” (Claudio Masolo et al., jun 2026)
  • “Multi-Agent AI for Production Security Operations: A2A and MCP in a 5G Core” (Willem Berroubache, jul 2026) — MTTR −40%, trabajo humano −12x
  • AI Security & Privacy (PDF): semana 5 — gobernanza, roles, auditing

Módulo 5 — Liderazgo Técnico, Estrategia, Ética

Estrategia técnica y socio-técnica

  • “Technical Strategy” (Engineering Leadership, semana 2)
  • “An Evolutionary Architecture Pattern for Managing AI’s Pace of Change” (Joe Price et al., jul 2026) — agentic AI rompe suposiciones de API gateways; centralizar guardrails, model routing, agent identity, action policy, semantic audit
  • “Agentic AI Architecture Framework for Enterprises” (Natarajan + Ponnusamy) — three-tier framework

Medición, accountability, operaciones

  • “Measurement and Accountability” (Engineering Leadership, semana 4) — Goodhart’s law, sampling cualitativo, participation/knowledge/behavior/outcomes
  • “Leadership in AI-Assisted Engineering” (Justin Reock) — Cobra Effect en métricas, throughput vs. instabilidad vs. confianza
  • “AI Operational Excellence: Evals, Trust & Reliability” (AI Engineering semana 5)

Ética, sesgos, responsabilidad

  • “The Next Generation of AI Products” (Hilary Mason) — mentalidad probabilística, “human considerations” como lo más difícil, ejemplos de fracaso/éxito
  • Sesgos en recomendación (popularidad, precios) — InfoQ escaso, complementar con literatura externa

Arquitectura como craft socio-técnico

  • Minibook Architecture as a Socio-Technical Craft (7 artículos): “Comprehension at AI Speed” (context store), “Change Locality”, “Architectural Decay Loop: Fitness Functions as Guardrails” (Aretini et al.), “3-tier team structure” (Bayramov et al.), “Platform Convergence” (Kurian et al.), “Sensing Socio-Technical Friction” (Polvara et al.)

Arquitectura de commerce (indirectamente relevante)

  • “From DVDs to Global Streaming: How Netflix’s Commerce Architecture Actually Evolved” (Kasia Trapszo) — pago internacional, descomposición por dominio, suscripciones, evolución sin rediseño. Transferible a ecommerce chino (membresías, suscripciones de entrega)

2. Syllabus (5 módulos, 16 semanas)

Perfil de entrada: data engineer con experiencia ML/DS (SQL, Python, pipelines, algo de modelado).

Objetivo de entrega: portafolio de 3 proyectos end-to-end + un capstone, alineado a lo que piden Alibaba, JD, PDD, Meituan, Shopee/Lazada, TikTok Shop.

Módulo 1 — Fundaciones Data Engineering para ML (S1–S3)

  • S1 Ingesta y pipelines a escala (Kafka/RocketMQ, CDC, Hudi/Iceberg, orquestación, data contracts). Proyecto 1: pipeline de eventos ecommerce.
  • S2 Warehousing, feature stores, datos para ML (Feast/Tecton/DIY, point-in-time joins, drift). Proyecto 2: feature store para recomendación.
  • S3 Calidad de datos, observabilidad, data contracts (Great Expectations/Soda, lineage, SLAs). Proyecto: suite de sensores.

Módulo 2 — MLOps en Producción (S4–S6)

  • S4 Recomendación y ranking a escala (two-tower, LTR, eval offline/online, A/B). Proyecto 3: servicio de recomendación (<50ms p95).
  • S5 MLOps (DVC/MLflow/W&B, CI/CD, canary, rollback, evaluation debt de Mallika Rao).
  • S6 Evaluación multicapa en producción (5 capas). Proyecto: dashboard de evaluación.

Módulo 3 — IA Generativa, RAG y Agents (S7–S10)

  • S7 RAG y context engineering (embeddings, vector DBs — Milvus/Qdrant, chunking, re-ranking, knowledge graphs). Proyecto: búsqueda semántica + chatbot.
  • S8 Agents de operaciones (tool inventory, fail modes, escape hatches). Proyecto: agente de soporte.
  • S9 Sistemas multi-agente (CoALA, agentic fitness functions, agents de datos). Proyecto: agente de análisis de datos.
  • S10 Plataforma interna (AI Gateway de Meryem Arik, MCP + semantic models de Fabiane Nardo, cost control). Proyecto: diseño de plataforma.

Módulo 4 — Seguridad, Privacidad, Gobernanza (S11–S13)

  • S11 Privacidad y protección de datos (PIPL/FSML/MLPS, pseudonimización, consent). Proyecto: análisis de flujos.
  • S12 Threat modeling, red teaming, guardrails (LINDDUN/STRIDE/Plot4AI, prompt injection). Proyecto: red teaming del chatbot.
  • S13 Observabilidad de seguridad y gobernanza (Arize Phoenix, auditoría). Proyecto: suite de observabilidad.

Módulo 5 — Liderazgo, Estrategia, Ética (S14–S16)

  • S14 Estrategia técnica (Engineering Leadership semana 2, evolutionary architecture pattern). Proyecto: estrategia 1–2 páginas.
  • S15 Medición, accountability, operaciones (Goodhart, incident response, cost management). Proyecto: sistema de medición.
  • S16 Ética, sesgos, responsabilidad + Proyecto final integrado (capstone formato InfoQ: presentación 20min + discusión 30min, cerrando con “unresolved architectural question”).

Cronograma realista (6 meses)

  • Mes 1–2: Módulos 1–2 (bases universales)
  • Mes 3: Módulo 3 (RAG + agents, lo más demandado)
  • Mes 4: Módulo 4 (seguridad/privacidad — diferenciador)
  • Mes 5: Módulo 5 + proyecto final
  • Mes 6: refinamiento, entrevistas, investigación PIPL/MLPS

Portafolio (resumen)

ProyectoMóduloStack sugerido
Pipeline eventos ecommerce + data quality1Kafka/RocketMQ, Hudi/Iceberg, Airflow/Dagster, Great Expectations
Feature store + recomendador + MLOps + eval 5 capas2, 4Feast/Tecton/DIY, LightGBM/two-tower, MLflow/W&B, DVC, canary
RAG search + chatbot soporte + agente análisis3Milvus/Qdrant, LLM API, MCP, AST grading, guardrails
Privacidad + red teaming + observabilidad4Análisis PIPL/MLPS, threat modeling, Arize Phoenix
Estrategia + operaciones + capstone5KPIs negocio, incident response, “unresolved question”

3. Fuentes de InfoQ (inventario completo)

3a. PDFs de certificación (en la carpeta, extraídos)

  • AI-Assisted Engineering — semanas 1–4: codebase comprehension como artifact, sensor suite (lint rules, architecture-fitness tests, drift sensors, background cleanup agents), CI como harness, verificación independiente.
  • AI Engineering — semanas 1–5: AI ambiguity (Hilary Mason), RAG/context pipelines, agent design (tool inventory, escape hatches), operational excellence, capstone.
  • AI Security & Privacy Engineering — semanas 1–5: sensitive data flows, LINDDUN/Plot4AI, red teaming LLM, guardrails/sandboxes, observabilidad (Arize Phoenix), gobernanza.
  • Engineering Leadership — semanas 1–5: Westrum model, technical strategy, medición/Goodhart’s law, incident response.
  • Architect (Architecture as a Socio-Technical Craft) — comprehension, fitness functions, evolutionary architecture.

3b. Transcripts/artículos extraídos en esta sesión (en caché)

  • “From Models to Agents: Building Context-Aware Consumer AI at Scale at DoorDash” — Sudeep Das, ago 2026. Consumer memory, semantic IDs (RQ-VAE), grounded search, rubric multi-dimensional, agentic harness engineering. El texto más relevante para recomendación + agents en ecommerce.
  • “Architecting the Data Layer for AI Agents: from Transactional Systems to MCP and Semantic Models” — Fabiane Nardo (TOTVS), ago 2026. Data mesh como base, MCP tools como data products, deterministic vs. non-deterministic, semantic ontologies. Fundamental para preparar datos para agents.
  • “What I Learned Building Multi-Agent Systems from Scratch” — Paulo Arruda (Shopify), may 2026. Chat→swarm, fragmentación de contexto, llm-fuse, memoria/Defrag, agentic search vs. AST. Lectura obligada para agents (transcript completo en caché, offset 53+).
  • “Architecting AI Systems for the Messy Reality of Enterprises: Why Agentic Compute is the Missing Layer” — Arun Joseph (LMOS/Deutsche Telekom), sep 2026. Ephemeral agents, ADL, agentic compute.
  • “The Next Generation of AI Products” — Hilary Mason, may 2026. Mentalidad probabilística, human considerations, ejemplos de fracaso/éxito.
  • “From DVDs to Global Streaming: How Netflix’s Commerce Architecture Actually Evolved” — Kasia Trapszo, ago 2026 (offset 63+).
  • “Powering the Future: Building Your GenAI Infrastructure Stack” — Merrin Kurian (Intuit), may 2026. Fixed/flexible/free, GenOS, LLM-as-judge, tool-ready APIs, gobernanza.
  • “Beyond Prompting: Context Engineering for Production-Grade AI” — Ricardo Ferreira, sep 2026. Redis, token limits, semantic caching, cost control.
  • “Panel: Taking Architecture out of the Echo Chamber” — Andrew Harmel-Law + panel, abr 2026. ADRs, tech debt, career paths.

3c. Presentaciones/artículos identificados pero NO extraídos (pendientes)

  • www.infoq.com/presentations/ai-coding-agents/ — agents de codificación enterprise (Claude Code, Cursor, Kiro Crew de AWS)
  • www.infoq.com/presentations/agentic-ai/ — conceptos agentic AI en producción
  • www.infoq.com/presentations/video-podcast-ad-trends-report-2025/ — ad-tech (recomendación/personalización trasladable)
  • www.infoq.com/presentations/ml-arch-challenges/ — challenges de arquitectura de ML
  • www.infoq.com/minibooks/architecture-age-ai-opportunity/ — “Architecture in the Age of AI: Change and Opportunity”
  • www.infoq.com/presentations/context-engineering-redis-llm-architecture/ — context engineering con Redis
  • “Building Evals for AI Adoption” — Mallika Rao, may 2026 (5 capas de evaluación)
  • “Designing AI Platforms for Reliability: Tools for Certainty, Agents for Discovery” — Aaron Erickson, may 2026
  • “Securing MCP in Production: Defense-in-Depth beyond the Gateway” — Nik Kale, jul 2026
  • “Leadership in AI-Assisted Engineering” — Justin Reock, may 2026
  • “Write-Ahead Intent Log: a Foundation for Efficient CDC at Scale” — Vinay Chella, jun 2026
  • “Beyond Offset Lag: Computing Time in Queue for Apache Hudi…” — Srikanth Mamidala, ago 2026
  • “Automating the Web with MCP: Infra that Doesn’t Break” — Paul Klein, jun 2026
  • “Agentic Fitness Functions: Extending Evolutionary Architecture Beyond Deterministic Rules” — Hemant Kumar Mahato et al., ago 2026
  • “An Evolutionary Architecture Pattern for Managing AI’s Pace of Change” — Joe Price et al., jul 2026
  • “The Ironies of A²I²” — J. Paul Reed, may 2026
  • “AI Native Engineering” — Ian Thomas (Meta), may 2026
  • “Engineering at AI Speed: Lessons from the First Agentically Accelerated Software Project” — Adam Wolff, may 2026
  • “Data-Aware AI Agents at OpenAI” — Bonnie Xu (Kepler), jun 2026

3d. eMags / minibooks (índice estructurado)

  • Agentic AI Architecture: Mallika Rao (“From Microservice to Agents”), Karthik Ramgopal (“Evolution of Agentic Harnesses”), Adi Polak (“Systemic Approach to Memory, Knowledge, and Context”), Natarajan + Ponnusamy (“Agentic AI Architecture Framework”), + artículo de Rafał sobre adaptación de áreas arquitecturales.
  • Architecture as a Socio-Technical Craft (7 artículos): Berhe et al. (Comprehension), Fischer et al. (Change Locality), Aretini et al. (Decay Loop), Bayramov et al. (3-tier team), Kurian et al. (Platform Convergence), Polvara et al. (Sensing Friction).
  • AI-Assisted Development 2025: Kapoor et al. (“Architecting Agentic MLOps: A2A + MCP”), Wenjie Zi (“Why Most ML Projects Fail to Reach Production”), Comprehension como característica.
  • Act One: From Chatbots to AI Agents; Securing the AI Stack: From Model to Production; InfoQ Trends Reports 2025/2024.

3e. Noticias del feed (AI, ML & Data Engineering)

  • “Swiggy Uses 350+ Features and Multi-Task MLP to Predict Customer Lifetime Value” — Lela Kumili, sep 2026
  • “DoorDash’s Flux Runs 130,000 Engineering Tasks through Cloud-Based Agents” — ago 2026
  • “AWS Open Sources Kiro Crew for Asynchronous Coding Agents”
  • “Multi-Agent AI for Production Security Operations: A2A and MCP in a 5G Core” — Willem Berroubache, jul 2026
  • “Virtual panel: Security in the Machine Age: Expert Insights on AI Threat Evolution” — jun 2026

3f. Podcasts

  • “The AI Joy Gap: Why Some Developers Thrive While Others Struggle” — Shane Hastie + Michael Parker (TurinTech AI) — factory architects, hype vs. legacy
  • “Tiger Teams, Evals and Agents: The New AI Engineering Playbook” — Sam Bhagwat
  • “Beyond Code: How Engineers Need to Evolve in the AI Era” — Ben Greene
  • “Information Flow: The Hidden Driver of Engineering Culture” — Adrian Peryer
  • “Context Engineering with Adi Polak” — abr 2026
  • “From Java EE to Quarkus and LLMs: Adam Bien’s Playbook” — Adam Bien (filosofía “boring, future-proof”)

3g. Webinarios (con transcript)

  • “When AI Accelerates Development, Can Your CI Pipeline Keep Up?” — Eric Metaj (Datadog) + Rohin Chandra, oct 2026
  • “Beyond the PR: The New Control Plane for Agentic Software Delivery” — Mohit Suman (Harness), sep 2026

4. Plan de lectura por semana

Prioridad alta (antes de construir):

  1. DoorDash “From Models to Agents” (Sudeep Das) → S4, S8, S9
  2. “Architecting the Data Layer for AI Agents” (Fabiane Nardo) → S3, S7, S10
  3. “What I Learned Building Multi-Agent Systems” (Paulo Arruda, offset 53+) → S8, S9
  4. “Why Agentic Compute is the Missing Layer” (Arun Joseph) → S10
  5. AI Engineering PDF (semanas 2, 3, 5) → S7, S8, S15
  6. “The Next Generation of AI Products” (Hilary Mason) → S16
  7. “Beyond Prompting: Context Engineering” (Ricardo Ferreira) → S7

Prioridad media (según tema):

  • “Powering the Future” (Merrin Kurian) → S10
  • “Building Evals for AI Adoption” (Mallika Rao) → S6
  • “Netflix Commerce Architecture” (Kasia Trapszo) → S14
  • AI-Assisted Engineering PDF (semanas 1, 2, 4) → S1, S3
  • AI Security & Privacy PDF (semanas 1–5) → S11–S13
  • Engineering Leadership PDF (semanas 1, 2, 4) → S14, S15

Prioridad baja (consultar):

  • eMags (Agentic AI Architecture, Socio-Technical Craft, AI-Assisted Dev)
  • “Write-Ahead Intent Log”, “Beyond Offset Lag” (Hudi) → S1
  • “Securing MCP in Production”, “Designing AI Platforms for Reliability”, “Leadership in AI-Assisted Engineering”
  • Noticias del feed + podcasts

5. Temas que InfoQ NO cubre (complementar de otras fuentes)

  1. Cumplimiento regulatorio chino: PIPL, FSML, MLPS en la práctica; data localization, consent, certificaciones; casos Alibaba Cloud / JD Tech / Meituan; documentos CAC; estándares GB/T.
  2. Infra local China: RocketMQ, PolarDB, Lindorm, AliGraph, Milvus/Zilliz; LLMs chinos (Qwen, DeepSeek, GLM, Yi); GPU landscape (restricciones exportación, Huawei Ascend).
  3. Técnicas de recomendación del mercado chino: GNN (Alibaba), AliRec, multi-task learning (JD), social commerce signals (PDD); sesgo de popularidad, cold-start, feedback loops con millones de SKUs. Fuentes: KDD/RecSys/CIKM, blogs de ingeniería en chino.
  4. Mandarín técnico: lectura de documentación, blogs de ingeniería chinos, comunicación técnica.
  5. Ética/responsabilidad en marco regulatorio chino: estructura de equipos security/privacy/ethics en empresas chinas.

6. Decisiones tomadas en esta sesión

  • Formato: syllabus 5 módulos / 16 semanas, orientado a portafolio end-to-end + capstone.
  • Foco de mercado: Alibaba, JD, PDD, Meituan, Shopee/Lazada, TikTok Shop.
  • Diferenciador clave: módulo de seguridad/privacidad (PIPL/MLPS) — pocos candidatos lo tienen bien.
  • Fuente base: InfoQ (técnica occidental) + complemento obligatorio de fuentes chinas (regulación, infra, modelos, técnicas de recomendación).

7. Guía para la siguiente sesión (retomar aquí)

Estado: syllabus + mapa temático + inventario de fuentes completos. Falta: plan de lectura semana a semana detallado (opción 1 pendiente), expansión de módulos con objetivos medibles (opción 2), y documentos de portafolio (opción 3).

Próximas acciones (elegir una):

  1. Plan de lectura ordenado por semana: para cada semana del syllabus, 1–3 textos de InfoQ + fuentes externas, con “qué extraer de cada uno” y “qué preguntas hacer al leerlo”.
  2. Expandir un módulo (ej. Módulo 1 o 4) con: objetivos medibles/semana, ejercicios, tecnologías a probar, criterios de aprobación, textos exactos (con enlaces a transcripts en caché) + fuentes externas para PIPL/infra china/técnicas de recomendación.
  3. Documentos de portafolio: README ejecutable del pipeline + feature store, notebook de evaluación multicapa del recomendador, o análisis de privacidad PIPL del sistema completo.
  4. Investigar fuentes específicas PIPL/MLPS/infra china — búsqueda web focalizada en casos de empresas chinas de ecommerce.

Pendientes de extracción (bloqueo conocido): InfoQ bloquea crawlers en varios endpoints. Los transcripts/artículos marcados en 3c requieren navegador o búsqueda más específica. El web_extract de presentaciones falló en varias URLs; usar el navegador (Chrome dio error de arranque en esta sesión) como plan B.

Rutas de caché relevantes: transcripts en ~/.../www.infoq.com-*.md (ver archivos en la carpeta de trabajo ~//Downloads/infoq-clone/).


8. Contexto de la sesión (para continuidad)

  • Origen: usuario pidió un syllabus de data engineer + ML/DS para mercado chino de ecommerce 2026, usando los documentos de la carpeta infoq-clone (5 PDFs de certificación) y los transcripts de infoq.com/ai-ml-data-eng/presentations.
  • Método: PDFs leídos por terminal (pdftotext/python); presentaciones intentadas vía web_extract (bloqueado) y navegador (Chrome falló); feed RSS de presentaciones extraído por web_search/web_fetch como fallback.
  • Entregable previo: syllabus completo (sección 2) + mapa de recursos; luego exhaustividad temática (sección 1) + lista de fuentes (sección 3).

Guardado por save-decision skill. No contiene secretos. Fuentes de InfoQ listadas son URLs/transcripts de acceso público.