Descripción del programa

Este curso introduce a estudiantes de postgrado, investigadores y profesionales de las Ciencias Sociales y Humanidades en el uso de Python y de herramientas de inteligencia artificial para la exploración, organización y análisis de corpus textuales, mediante procedimientos accesibles y directamente vinculados con problemas de investigación.

El programa recorre un flujo de trabajo completo y coherente: parte de la construcción y preparación del corpus, avanza hacia su exploración crítica mediante frecuencias, profundiza en la recuperación semántica basada en el significado (embeddings), incorpora la identificación de entidades, actores y voces discursivas (NER), suma el uso de modelos de lenguaje (LLM) como apoyo a la codificación, y culmina en la validación e interpretación de la evidencia. El énfasis permanente está en articular procedimientos computacionales con análisis cualitativo, y en tratar todo resultado computacional como un insumo a validar, nunca como una conclusión en sí mismo.

La relevancia de estas herramientas para las Ciencias Sociales radica en que permiten trabajar de manera sistemática con conjuntos amplios de datos textuales, reconocer patrones difíciles de detectar mediante una lectura exclusivamente manual y establecer criterios explícitos y reproducibles para organizar y seleccionar información. Los resultados obtenidos requerirán, luego, ser evaluados, contextualizados e interpretados a la luz de las preguntas de investigación y de los marcos teóricos utilizados.

Desde esta perspectiva, Python y la IA se incorporan como herramientas de apoyo al proceso de investigación —nunca como sustituto del juicio del investigador—, en un recorrido que va desde el dato crudo hasta la evidencia validada, documentada y lista para el análisis.

Objetivos del programa

1.  Preparar, limpiar y organizar corpus textuales en un entorno de trabajo reproducible en la nube (Google Colab).

2.  Explorar corpus mediante frecuencias y n-gramas, reconociendo los límites del conteo para capturar fenómenos conceptualmente complejos.

3. Comprender y aplicar la representación semántica de textos mediante embeddings (BGE-M3) y recuperar información por significado.

4. Afinar la recuperación semántica mediante umbrales, gradientes y visualización exploratoria (UMAP), construyendo subcorpus justificados.

5.  Identificar entidades, actores sociales y voces discursivas mediante NER (spaCy) y recuperar sus contextos de aparición.

6. Emplear modelos de lenguaje (LLM) como copiloto de código y como apoyo a la codificación y síntesis cualitativa, validando críticamente sus resultados.

7.  Aplicar criterios éticos y de protección de datos (Ley N.° 21.719) y documentar el pipeline para garantizar su trazabilidad.

8.  Convertir los resultados computacionales en una estrategia de selección, validación e interpretación cualitativa de la evidencia.

Dirigido a

El curso está dirigido a un público amplio del ámbito de las Ciencias Sociales y Humanidades que trabaja con datos textuales cualitativos y desea sistematizar su análisis, sin requerir experiencia previa en programación:

   Estudiantes de postgrado y tesistas (magíster y doctorado) en sociología, ciencia política, lingüística, comunicación, antropología, historia, trabajo social, educación y disciplinas afines.

   Investigadores e investigadoras que trabajan con entrevistas, grupos focales, prensa, documentos normativos, actas o contenidos de redes sociales.

   Profesionales del sector público y de organizaciones que analizan grandes volúmenes de texto (consultas ciudadanas, informes, respuestas abiertas, documentación de política pública).

   Docentes y equipos académicos interesados en incorporar métodos computacionales y de IA a su investigación o a su docencia.

Importante: no es un curso de programación desde cero, sino un curso de métodos computacionales aplicados que utiliza Python y la IA como vehículos. La progresión en dos módulos permite que participantes sin experiencia previa alcancen, al finalizar, un pipeline completo de análisis de corpus. El foco permanente está en el problema de investigación.

Fechas y Horarios

  • Ícono fecha-colored Desde 19 octubre 2026 hasta 21 diciembre 2026.
  • Ícono duracion-colored Martes de 18:30 a 20:30
  • Ícono modalidad-colored Modalidad: Online en vivo.

Programa 100% online Plataforma Canvas / Zoom

Arancel y descuentos

  • Matrícula $0.-
  • Arancel $300.000.-

Descuentos

  • 25% Descuento sobre el arancel Para los primeros 20 matriculados

Equipo docente

Eugenia Marta Rivieri

Doctora en Lingüística, Pontificia Universidad Católica de Valparaíso Magíster en Comunicación y Licenciada en Comunicación Social, Universidad Austral de Chile Licenciada en Comunicaciones, Universidad Austral de Chile Cuenta además con formación en traducción especializada y data science. Su trabajo integra lingüística, comunicación y análisis del discurso con herramientas de análisis de datos. Docente en diversas Universidades, dictando cursos en comunicación, escritura, metodología de investigación y análisis del discurso. Su investigación se centra en lingüística, procesamiento del lenguaje, comunicación y envejecimiento, con publicaciones y participación en congresos nacionales e internacionales.

Contacto

  • Tatiana Valenzuela Campanine
  • Coordinadora formación continua
  • Correo electrónico: tvalenzuela@udd.cl

La Universidad se reserva el derecho de impartir o no el programa/actividad según contingencia, fuerza mayor o viabilidad académica o económica, en función del número de inscritos. Asimismo, podrá realizar ajustes en contenidos, cronogramas o cuerpo docente para asegurar su actualización y calidad académica.