返回
RCreddit.com
20
·12小时前·开发者社区 · RSS

Multilingual Tiny (3.7B) Reasoning MoE pretrained from scratch on a consumer-grade GPU

查看原文
Hugging Face模型发布

热度趋势

趋势数据积累中

百分比基于当前可用热度信号,而非评论数或独立用户人数。

推荐理由

Hugging Face 相关模型动态已经出现,适合跟踪能力变化、生态影响和后续可用性。

AI 摘要

一个名为polanka_3.7b_exp_wip_260901的多语言Tiny (3.7B) Reasoning MoE模型已在Hugging Face上发布。该模型在一个4090消费级GPU上经过数月的从头预训练、中期训练和微调。它支持13种语言,包括波兰语、英语和中文,并为这三种语言提供了额外的放大数据,可作为研究成果使用。

Hello!

I've just uploaded a recent checkpoint of my model trained from scratch:

https://huggingface.co/piotr-ai/polanka_3.7b_exp_wip_260901

It was pre-trained, mid-trained, and fine-tuned on a single 4090 over many months. How many tokens? I lost count.

Feel free to use it as a research artefact.

13 languages: PL, EN, ZH, CS, SK, UK, RU, IT, ES, FR, DE, PT, LT — with extra upscaled data for PL/EN/ZH.

Multilingual Tiny (3.7B) Reasoning MoE pretrained from scratch on a consumer-grade GPU · BuzzRadr