pkupie/mc2_corpus
Viewer • Updated • 504k • 74 • 16
This model is a continual pretraining (CPT) checkpoint built by further pretraining Qwen2.5 1.5B on the Mongolian (Traditional Mongolian Script) portion of the MC^2 Corpus.
The model is intended to improve Mongolian (Traditional Mongolian Script) language modeling and to support research on low-resource language adaptation.
Training details and methodology are described in: "Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion" (ACL 2026).
mn, Traditional Mongolian Script)This checkpoint is released primarily for research purposes. Researchers are welcome to use this CPT checkpoint as a base model for future work, particularly in model merging and logit fusion.
If you use this model, please cite:
@article{zhang2026efficient,
title={Efficient Low-Resource Language Adaptation via Multi-Source Dynamic Logit Fusion},
author={Zhang, Chen and Lin, Jiuheng and Liao, Zhiyuan and Feng, Yansong},
journal={arXiv preprint arXiv:2604.18106},
year={2026}
}
Base model
Qwen/Qwen2.5-1.5B