A research project on multilingual pre-training that studies transfer, synergy, and interference between language data sources. It provides methods for measuring language relationships, fitting multilingual scaling laws, choosing data mixtures and model sizes, and deciding between fine-tuning and pre-training.