RCreddit.com
20
·12小时前·开发者社区 · RSS
Multilingual Tiny (3.7B) Reasoning MoE pretrained from scratch on a consumer-grade GPU
热度趋势
趋势数据积累中
百分比基于当前可用热度信号,而非评论数或独立用户人数。
Hugging Face 相关模型动态已经出现,适合跟踪能力变化、生态影响和后续可用性。
一个名为polanka_3.7b_exp_wip_260901的多语言Tiny (3.7B) Reasoning MoE模型已在Hugging Face上发布。该模型在一个4090消费级GPU上经过数月的从头预训练、中期训练和微调。它支持13种语言,包括波兰语、英语和中文,并为这三种语言提供了额外的放大数据,可作为研究成果使用。
Hello!
I've just uploaded a recent checkpoint of my model trained from scratch:
https://huggingface.co/piotr-ai/polanka_3.7b_exp_wip_260901
It was pre-trained, mid-trained, and fine-tuned on a single 4090 over many months. How many tokens? I lost count.
Feel free to use it as a research artefact.
13 languages: PL, EN, ZH, CS, SK, UK, RU, IT, ES, FR, DE, PT, LT — with extra upscaled data for PL/EN/ZH.