新闻
收评
12GB显存显卡跑125B模型:Strata登场
配图:12GB显存显卡跑125B模型:Strata登场
新闻导读
苏婉棠和四个养兄的小说界面干净,夜间模式护眼,稍长一点的文章也能坐下来读完。关键术语会顺手用白话解释一句,不太劝退小白。敢更耐心地跟亲戚解释误区,底气来自系统理解而不是热搜。相关推荐还能顺着主题往下挖,不是看完一条就断掉。作为主力科普入口长期留下很合适。小处想得细,耐看也耐用。
IT之家 10 月 6 日消息,科技媒体 gigazine 今天(10 月 6 日)报道,报道称开发者 Niko1221 开源推出 Strata 引擎,可以在 12GB 及以上显存的消费级显卡上,运行量化的 Qwen3.8-Flash-Next 模型(1250 亿参数)。
IT之家注:Qwen3.8-Flash-Next 模型是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家(MoE)模型的压缩版本,配有 125B 参数,另含 51B 参数的 n-gram 嵌入表,原生支持 262K token 上下文长度。
Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE(混合专家)模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。
量化版本(Size)写答案速度(Writes answers)阅读提示速度(Reads your prompt)Q2_094 个词元 / 秒2,650 个词元 / 秒IQ2_XS79 个词元 / 秒2,090 个词元 / 秒IQ3_XXS62 个词元 / 秒1,750 个词元 / 秒IQ3_S53 个词元 / 秒1,620 个词元 / 秒Coder55 个词元 / 秒2,180 个词元 / 秒
网友观点
本来只是随手点开,后来变成晚间汇总阅读的习惯。内容更新偏稳,宁缺毋滥,注水感不强。热点事件解读会标明哪些较确定、哪些仍在研究,表述相对克制。进度跨设备衔接自然,换手机平板继续看不费劲。安静获取知识像逛管理良好的图书馆,来去自由。写给后来者:别指望一夜变专家,但真的能变清醒。
免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.gxycedu.cn/te_inform?id=qwfise-dysf7mp%3D5p%3D13


评论区
热门讨论 · 占位展示期待你的精彩发言。