Programa de Verão do LNCC · 2026
Jornada de Ciência de Dados
09 de fevereiro a 23 de fevereiro de 2026
Evento onlineApresentação
Sobre o evento
O massivo volume de dados gerado pela ciência e bilhões de usuários de Internet é um dos grandes desafios atuais, impulsionando avanços e novas formas de investigação.
Na ciência, esse "dilúvio" de dados exige soluções computacionais de biólogos, astrônomos e pesquisadores. Na indústria, ele se associa à computação em nuvem, oferecendo escalabilidade e tolerância a falhas. No governo, grandes bases de dados aprimoram serviços públicos e planejam políticas.
A Jornada em Ciência de Dados visa consolidar o LNCC como referência nacional e promover um workshop entre governo, academia e indústria para discutir desafios e oportunidades.
Como participar
Informações
Inscrições
As inscrições nas atividades deste evento estarão abertas de 03 Nov 2025 a 09 Jan 2026. Confira o valor de inscrição para todos os eventos na página de Inscrições. Os membros da instituição e bolsistas do Programa PIBIC/PIBIT do LNCC têm inscrições gratuitas.
Formato das atividades
As atividades serão oferecidas de forma síncrona e online, pela plataforma Zoom, em datas e horários específicos divulgados após a inscrição. Toda a programação deste evento, disponível logo abaixo, será gravada e disponibilizada no canal do YouTube do LNCC.
Certificados
Os dados fornecidos no momento da inscrição serão utilizados para a emissão dos certificados de participação, disponíveis até 31 Mar 2026. O Programa de Verão emite certificados exclusivamente para inscritos que acompanhem as atividades pelo Zoom — participantes via YouTube não recebem certificação.
Atividades
Programação
Acesse a programação completa.
Minicursos
- Professor(es):
- Jonice Oliveira e Silas Pereira Lima Filho (UFRJ)
- Horário:
- De 09/02 ao 12/02. Das 09:00h às 10:30h
Duração: 09 de fevereiro a 12 de fevereiro de 2026
Horário: 9:00 às 10:30
Objetivo: Permitir que o aluno consiga analisar redes ego-centradas ou redes completas, bem como o impacto individual no grupo e vice-versa.
Ementa:
- Redes Sociais: Introdução, aplicações práticas e histórico
- Grafos
- Tipos de rede
- Comunidades, alianças e poder
- Dinâmica populacional e identificação de eventos
- Exemplos de modelagem e aplicações
- Ética
Bibliografia:
- Easley, David, and Jon Kleinberg. Networks, crowds, and markets: Reasoning about a highly connected world. Cambridge University press, 2010.
- Fuks, Hugo, and Mariano Pimentel, eds. Sistemas colaborativos. Elsevier Brasil, 2011. Disponível em: https://sistemascolaborativos.uniriotec.br/
- Barabási, Albert-László. "Network science." Philosophical Transactions of the Royal Society A: Mathematical, Physical and Engineering Sciences 371.1987 (2013): 20120375. Disponível em: http://barabasi.com/book/network-science
- Christakis, Nicholas A., and James H. Fowler. Connected: The surprising power of our social networks and how they shape our lives. Little, Brown Spark, 2009.
- Barrat, Alain, Marc Barthelemy, and Alessandro Vespignani. Dynamical processes on complex networks. Cambridge University press, 2008.
- Stanford Large Network Dataset Collection https://snap.stanford.edu/data/#socnets
- Artigos acadêmicos focados em cada tópico
- Professor(es):
- Eduardo Ogasawara (CEFET-RJ)
- Horário:
- Dias 10, 11 e 12 de fevereiro. Das 11:00h às 12:30h
Duração: Dias 10, 11 e 12 de fevereiro
Horário: 11:00h às 12:30h
Objetivo: Estudo de técnicas de mineração de dados, i.e., extração de conhecimento a partir de grandes volumes de dados. O processo de extração de conhecimento contempla a análise exploratória de dados, pré-processamento, regressão e uma visão geral de mineração de padrões frequentes, predição e agrupamento. O curso é contextualizado com o uso da linguagem R.
Ementa:
- Introdução e visão geral
- Análise exploratória de dados
- Pre-processamento
- Regressão
Bibliografia:
- HAN, Jiawei; KAMBER, Micheline; PEI, Jian. Data mining: concepts and techniques. 4. ed. Cambridge, MA: Morgan Kaufmann, 2022.
- JAMES, Gareth; WITTEN, Daniela; HASTIE, Trevor; TIBSHIRANI, Robert. An introduction to statistical learning: with applications in R. 2. ed. New York: Springer, 2021.
- BISHOP, C. M.; Bishop, H. Deep Learning: Foundations and Concepts. Springer Nature, 2023.
- BRAMER, M. Principles of Data Mining. Springer London, 2020.
- GARCIA, S.; LUENGO, J.; HERRERA, F. Data Preprocessing in Data Mining. Springer, 2014.
- OGASAWARA, E.; SALLES, R.; PORTO, F.; PACITTI, E. Event Detection in Time Series. 1. ed. Cham: Springer Nature Switzerland, 2025.
- GOLDSCHMIDT, R.; PASSOS, E.; BEZERRA, E. Data Mining. Elsevier Brasil, 2015.
- Professor(es):
- Fábio Porto (LNCC)
- Horário:
- Dias 09, 11 e 12 de fevereiro. Das 13:30h às 15:00h
Duração: Dias 09, 11 e 12 de fevereiro
Horário: 13:30h às 15:00h
Objetivo: O surgimento de grandes volumes de dados a serem analisados modificou o panorama de sistemas de processamento de dados. Além de sistemas do tipo NoSQL, surgiram frameworks BigData com alta escalabilidade e um modelo de programação que favorece o processamento paralelo e distribuído. Neste curso apresentaremos as principais abordagens para processamento BigData e nos concentramos no framework Apache Spark. Discutiremos seu Modelo de Programação, Arquitetura e Técnicas de Programação. No último dia do curso os alunos têm a experiência prática de desenvolvimento de um dataflow em Apache/Spark.
Ementa:
- Introdução a Big Data
- Modelo de programação map reduce
- Apache Spark, Spark SQL e dataframe
- Aprendizado de Máquina em Spark
- Processamento de dados em fluxo
- Armazenamento de dados em Data Lake
- Parte Prática: Exercícios com o framework Spark-Python
Bibliografia:
- Dean, J., Ghemawat, S., MapReduce: Simplified Data Processing on Large Clusters;, OSDI'04: Sixth Symposium on Operating System Design and Implementation, San Francisco, CA, December, 2004.
- Tamer Ozsu, Patrick Valduriez, Principles of Distributed Database Systems, Springer-Verlag, 2011.
- Hasso Plattner, Alexander Zeir, In-Memory Data Management, Springer
- Zaharia, M., Chowdhury, M., Franklin, M. J., Shenker, S., and Stoica, I. (2010). Spark: Cluster computing with working sets. In Proceedings of the 2 nd USENIX Conference on Hot Topics in Cloud Computing, HotCloud’10, pages 10–10, Berkeley, CA, USA. USENIX Association.
- Fabio Porto, Algoritmos e Programação em Big Data, Apostila, 2017
- Philip Moritz et al, Ray: A Distributed Framework for Emerging AI Applications, OSDI, 2018
- dask.org, last accessed June 2020.
- Professor(es):
- Eduardo Bezerra (CEFET-RJ)
- Horário:
- Dias 09, 10 e 12 de fevereiro. Das 15:00h às 16:30h
Duração: Dias 09, 10 e 12 de fevereiro
Horário: 15:00h às 16:30h
Objetivo: O objetivo do minicurso é apresentar uma introdução à aprendizagem profunda. São apresentados conceitos básicos da área, técnicas relacionadas ao treinamento e a avaliação de modelos. São também descritas algumas das principais arquiteturas de redes profundas, além de algumas aplicações. São apresentados exemplos de código por meio do framework PyTorch. Ementa:
- Conceitos básicos (forward/backward computation); Timeline; tutorial Pytorch
- Técnicas de treinamento (backprop, batch GD, dropout, model selection, model evaluation...); Convolutional Nets; tutorial PyTorch
- Recurrent Nets (LSTMs); tutorial PyTorch
- Considerações finais: aplicações; outras arquiteturas de rede (Autoencoders, Transformers, GANs, BDL, PIML, ...)
Bibliografia:
- Carl Doersch. Tutorial on variational autoencoders. CoRR, abs/1606.05908, 2016.
- Ian Goodfellow, Yoshua Bengio, and Aaron Courville. Deep Learning. MIT Press, 2016. http://www.deeplearningbook.org.
- Ian Goodfellow, et al. Generative adversarial nets. In Z. Ghahramani, M. Welling, C. Cortes, N. D. Lawrence, and K. Q. Weinberger, editors, Advances in Neural Information Processing Systems 27, pages 2672– 2680. Curran Associates, Inc., 2014.
- Sepp Hochreiter and Jürgen Schmidhuber.Long short-term memory. Neural Comput., 9(8):1735–1780, November 1997.
- Alex Krizhevsky, Ilya Sutskever, and Geoffrey E Hinton. Imagenet classification with deep convolutional neural networks. In F. Pereira, C. J. C. Burges, L. Bottou, and K. Q. Weinberger, editors, Advances in Neural Information Processing Systems 25, pages 1097–1105. Curran Associates, Inc., 2012.
- MichaelA.Nielsen. Neural networks and deep learning,2018.
- J. Schmidhuber. Deep learning in neural networks: An overview. Neural Networks, 61:85–117, 2015. Published online 2014; based on TR arXiv:1404.7828 [cs.NE].
- Hao Wang and Dit-Yan Yeung. Towards bayesian deep learning: A survey. CoRR, abs/1604.01662, 2016.
- Karniadakis, G.E., Kevrekidis, I.G., Lu, L. et al. Physics-informed machine learning. Nat Rev Phys 3, 422–440 (2021). https://doi.org/10.1038/s42254- 021-00314-5
- Professor(es):
- Bruno Menezes (LNCC) e Eduardo Bezerra (CEFET/RJ)
- Horário:
- Dia 09 de fevereiro, de 11:00h às 12:00h. Dia 10 de fevereiro, de 13:30h às 15:00h. Dia 11 de fevereiro, de 15:30h às 17:00h
Horário:
Dia 09 de fevereiro, de 11:00h às 12:00h.
Dia 10 de fevereiro, de 13:30h às 15:00h.
Dia 11 de fevereiro, de 15:30h às 17:00h
Objetivo: Apresentar, de forma concisa e aplicada, os fundamentos conceituais e práticos dos (LLMs) Large Language Models, destacando a evolução dos Transformers e as inovações recentes em inferência e ajuste fino. O minicurso oferece uma visão atualizada do ecossistema de modelos abertos (LLaMA 3, Qwen2, Mixtral, DeepSeek, entre outros), equilibrando base teórica essencial e demonstrações práticas de geração e fine-tuning, com foco em eficiência, alinhamento e aplicações científicas.
Ementa:
- Introdução aos LLMs: panorama 2023–2025, evolução, impacto e ecossistema open-source.
- Núcleo do Transformer: atenção, embeddings e normalização, compreensão conceitual sem excesso matemático.
- Variações modernas: Mixture of Experts (MoE), Rotary Embeddings e Attention Scaling (visão sintética e aplicada).
- Controle e inferência: parâmetros de geração (temperatura, top-p) e gerenciamento de contexto (KV cache, expected-attention, cache merging). Prática 1 – Inferência Interativa: experimentação guiada com prompts e parâmetros de geração, explorando variação de temperatura, top-p e raciocínio via chain-of-thought.
- Prompt engineering e in-context learning: few-shot, self-consistency e limites de contexto.
- Pré-treinamento e otimização: datasets em larga escala, quantização (FP8, INT4) e eficiência computacional.
- Ajuste fino supervisionado (SFT) e métodos eficientes: LoRA 2, QLoRA e estratégias em três estágios para fine-tuning de modelos quantizados.
- Prática 2 – Simulação de Fine-Tuning: demonstração simplificada de pipeline LoRA/QLoRA, seleção de camadas e visualização de pesos adaptados. Alinhamento de preferências: DPO, RLHF, GRPO e abordagens emergentes de raciocínio (DeepSeek-R1, raciocínio via RL).
- Avaliação moderna (2024–2025): MMLU-Pro/Pro+, AIME-24/25, LiveBench e GPQA; riscos de contaminação e limitações do LLM-as-a-judge.
- Tendências e desafios em LLMs abertos: interoperabilidade, governança e impacto científico.
- Interaction Patterns
- Tool Calling
- RAG
Bibliografia:
- Bai, Y. et al. Qwen2: Scaling Open Models for Multilingual and Multimodal Understanding. Alibaba DAMO Academy, arXiv:2407.10671 (2024). https://arxiv.org/abs/2407.10671
- Qian, J. et al. Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution. arXiv:2409.12191 (2025). https://arxiv.org/abs/2409.12191
- Jiang, A.Q. et al. Mixtral 8×7B: A Mixture-of-Experts Language Model. Mistral AI Technical Report, arXiv:2401.04088 (2024). https://arxiv.org/abs/2401.04088
- Zhang, Y. et al. DeepSeek Coder V2: Scaling Open Code Models with Mixture-of- Experts. arXiv:2410.03810 (2024). https://arxiv.org/abs/2410.03810
- Touvron, H. et al. LLaMA 3: Open Foundation and Chat Models. Meta AI Technical Report, arXiv:2407.21783 (2024). https://arxiv.org/abs/2407.21783
- Xu, Y. et al. Revisiting Group Relative Policy Optimization. arXiv:2505.22257v1 (2025). https://arxiv.org/abs/2505.22257
- Li, K. et al. Efficient Fine-Tuning of Quantized LLMs via Three-Stage Optimization. ICLR 2025 submission. https://openreview.net/forum?id=zcx6rIMbbR
- Dettmers, T. et al. QLoRA: Efficient Finetuning of Quantized LLMs. NeurIPS (2023). https://arxiv.org/abs/2305.14314
- Ouyang, L. et al. Training Language Models to Follow Instructions with Human Feedback. OpenAI, NeurIPS (2022). https://arxiv.org/abs/2203.02155
Workshops
O Workshop contará com sessões técnicas proferidas por palestrantes convidados com duração de 30 minutos e palestras plenárias de 1 hora de duração. Contará, também, com um painel de discussão sobre os desafios da área e possibilidade de projetos conjuntos. Espera-se uma participação diversificada contemplando governo, academia e indústria.
- Horário:
- Dia 23 de fevereiro, de 9:00h às 16:00h
Workshop em Ciência de Dados
- 09:00h - 09:15h. Abertura
- 09:15h - 09:30h. Julio César dos Reis (IC-UNICAMP): Designing and LLM-based Multiagent Framework for Data Analyses
- 10:00h - 10:30h. Cid Santos (ElDorado): Deep Learning na indústria: Desafios e Soluções em Visão Computacional
- 11:00h - 11:30h. Karin Becker (UFRGS): O que as LLMs entendem sobre o Funk? Desafios da modelagem em tópicos em letras musicais
- 11:30h - 14:00h. Almoço
- 14:00h - 14:30h. Marcos Andre Gonçalves (UFMG): Mais com Menos: Engenharia de dados para uma inteligência artificial sustentável
- 15:00h - 15:30h. Daniel de Oliveira e Wesley Ferreira (UFF): : AkôFlow: Um novo jeito de gerenciar workflows em qualquer plataforma
- 15:30h - 16:00h. Isabela Siqueira (Petrobras): Do Modelo ao Sistema: Desafios Práticos da Aplicação de IA em Gêmeos Digitais Industriais
- 16:00h. Fechamento