2026
Model Merging via Data-Free Covariance Estimation
↗ Marawan Gamal Abdel Hameed, Derek Tam, Pascal Jr Tikeng Notsawo, Colin Raffel, Guillaume Rabusseau
CATS (Continual Adaptation at Scale) Workshop, ICML, 2026 (Oral)
Conference on Language Modeling (COLM), 2026
Model MergingCovariance EstimationTransfer Learning
Grokking Finite-Dimensional Algebra
↗ Pascal Jr. Tikeng Notsawo, Guillaume Dumas, Guillaume Rabusseau
Forty-Third International Conference on Machine Learning (ICML), 2026
GrokkingAlgebraRepresentation LearningGeneralization
2025
2024
2023
Predicting Grokking Long Before it Happens: A look into the loss landscape of models which grok
↗ Pascal Jr. Tikeng Notsawo, Hattie Zhou, Mohammad Pezeshki, Irina Rish, Guillaume Dumas
Workshop on Mathematical and Empirical Understanding of Foundation Models, ICLR, 2024
GrokkingGeneralizationLoss LandscapeFourier Analysis
2023 / Research Vector Quantization
Adaptive Discrete Communication Bottlenecks with Dynamic Vector Quantization for Heterogeneous Representational Coarseness
↗ Dianbo Liu, Alex Lamb, Xu Ji, Pascal Jr. Tikeng Notsawo, Mike Mozer, Yoshua Bengio, Kenji Kawaguchi
Thirty-Seventh AAAI Conference on Artificial Intelligence (AAAI), 2023
Vector QuantizationDiscrete RepresentationsReinforcement LearningCommunication
2023 / Research Optimization
Stochastic Average Gradient : A Simple Empirical Investigation
↗ Pascal Junior Tikeng Notsawo
IFT6512: Stochastic Programming, Université de Montréal, 2023
OptimizationStochastic GradientConvergenceSAG