RCreddit.com
13
·1天前·开发者社区 · RSS
Over 200k context on 16GB VRAM with Qwen 3.8 27B UD-IQ3_XXS
热度趋势
新上榜
百分比基于当前可用热度信号,而非评论数或独立用户人数。
Qwen 相关模型动态已经出现,适合跟踪能力变化、生态影响和后续可用性。
一位Reddit用户报告称,他们在使用Qwen 3.8 27B UD-IQ3_XXS模型时,在16GB显存上实现了超过20万的上下文处理能力。此前,他们使用的是UD-Q3_K_XL模型,上下文处理能力超过14万,并指出该模型质量良好,工具调用错误极少。尽管新的IQ3_XXS模型允许更高的上下文,但提示处理速度从每秒700-800个token下降到每秒400个token,而质量差异仍在测试中。
I was using UD-Q3_K_XL until now with more than 140000 context. Quality wise it's very good, very few erroneous tool calls. Then I saw many others here reporting good results with IQ3_XXS, so I gave it a try.
The downside is prompt processing speed went down from 700-800 tk/s to 400 tk/s. Quality difference is yet to be tested.