Olá, pessoal!
Ao analisar a organização da base matemática do curso, observei uma presença significativa de conteúdos de Aritmética, Álgebra, Geometria Analítica, Álgebra Linear e Cálculo. Esses conhecimentos são importantes, principalmente para compreender funções, vetores, matrizes, distâncias, derivadas e processos de otimização. No entanto, gostaria de propor uma discussão sobre alguns conteúdos que parecem essenciais para a formação em Data Science e que poderiam receber maior destaque nessa etapa introdutória: Estatística e Probabilidade.
Entre os temas que poderiam compor ou complementar essa base, destaco:
- medidas de tendência central e de dispersão;
- variabilidade dos dados;
- quartis, percentis e identificação de valores atípicos;
- probabilidade e probabilidade condicional;
- variáveis aleatórias;
- distribuições de probabilidade;
- amostragem e representatividade;
- correlação e covariância;
- noções de inferência estatística;
- interpretação da incerteza;
- normalização e padronização dos dados.
Penso que esses assuntos possuem uma relação mais imediata com a análise de dados do que algumas revisões extensas de conteúdos elementares, como frações, conjuntos numéricos e raízes de polinômios. Naturalmente, esses conhecimentos anteriores não devem ser ignorados, pois os estudantes podem apresentar diferentes formações escolares. Uma alternativa seria oferecer uma avaliação diagnóstica e disponibilizar revisões direcionadas somente para lacunas identificadas.
Dessa maneira, estudantes que já dominam os pré-requisitos poderiam avançar para aplicações matemáticas mais diretamente relacionadas à Ciência de Dados, enquanto aqueles que necessitam de revisão continuariam contando com o material de apoio.
Outra possibilidade seria contextualizar os conteúdos existentes. Por exemplo:
- porcentagem aplicada à variação de indicadores;
- conjuntos relacionados à filtragem de dados;
- lógica proposicional associada a operadores booleanos;
- distância cartesiana aplicada a algoritmos como KNN e agrupamento;
- função do primeiro grau relacionada à regressão linear;
- derivadas e gradientes associados à minimização de funções de perda.
O que vocês pensam sobre essa proposta?
Estatística e Probabilidade deveriam aparecer mais cedo na base e ocupar uma posição mais presente nesta trilha do curso de Data Science?