RCreddit.com·
Ktransformers or llamacpp, for MoE on multigpu+ram?
一位用户正在寻求关于优化 qwen3.8 next flash 在 fp8 上的推理性能的建议,特别是在 ktransformers 和 llamacpp 之间进行比较。该用户的硬件配置包括 4 块 5060ti16gb GPU 和 8x32gb ddr4-3200 内存,他们对这些工具在多 GPU 和内存配置下,针对 MoE(专家混合)模型的推理速度和性能表现感兴趣。
- 发布
- 2026年9月6日 15:35
- 来源类型
- 开发者社区
- 档位
- 社区
- 信源状态
- 正常
时间以 UTC 显示
更多信息
首次发现2026年9月7日 06:00时区UTC · UTC+0
正文
Does anyone have experience on inference speed and performance of ktransformers vs llamacpp? Thinking of ways to optimize performance for qwen3.8 next flash at fp8 on my setup below 4x 5060ti16gb 8x32gb ddr4-3200 (4-channel)