新闻 新报

12GB显存显卡跑125B模型:Strata登场

刘建辉 阅读约 9 分钟 840294 阅读
12GB显存显卡跑125B模型:Strata登场
配图:12GB显存显卡跑125B模型:Strata登场

新闻导读

商教授的小乖宝TXT百度网盘离线包下载后出去也能看,信号差的地方不至于断档。谣言澄清结构清楚:常见说法、现有证据、更稳妥的理解。概念关系图帮助把术语放到网络里,不再孤立背词。挺适合想系统了解某个问题、又不想正儿八经上课的人。先记一笔真实感受:稳、清、诚实,就这三点够用。

IT之家 10 月 6 日消息,科技媒体 gigazine 今天(10 月 6 日)报道,报道称开发者 Niko1221 开源推出 Strata 引擎,可以在 12GB 及以上显存的消费级显卡上,运行量化的 Qwen3.8-Flash-Next 模型(1250 亿参数)。 IT之家注:Qwen3.8-Flash-Next 模型是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家(MoE)模型的压缩版本,配有 125B 参数,另含 51B 参数的 n-gram 嵌入表,原生支持 262K token 上下文长度。 Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE(混合专家)模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。 量化版本(Size)写答案速度(Writes answers)阅读提示速度(Reads your prompt)Q2_094 个词元 / 秒2,650 个词元 / 秒IQ2_XS79 个词元 / 秒2,090 个词元 / 秒IQ3_XXS62 个词元 / 秒1,750 个词元 / 秒IQ3_S53 个词元 / 秒1,620 个词元 / 秒Coder55 个词元 / 秒2,180 个词元 / 秒

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.gxycedu.cn/te_inform?id=g4fib7-026593

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者9号
    语音提问能理解口语说法,懒得打字时很友好。语言通俗,但没有把科学讲成尴尬段子,分寸拿得住。朋友圈少转发谣言后,自己的信息环境都清净一点。家庭共享和分龄内容池让人更放心,给孩子用也踏实一些。把核心求知需求解决得很扎实。作为主力科普入口长期留下很合适。
    20261007 · 来自移动端
  • 用户
    冯荣平
    物理入门把单位、量级、估算意识放前面,比急着堆理论有用。争议话题措辞谨慎,不站队煽情,更像在认真备课。导出长图给不爱装应用的长辈,关键信息还在。慢慢把常识补起来,这种不紧不慢的节奏反而更容易坚持。至少在我这儿,它已经从尝鲜变成了习惯。把核心求知需求解决得很扎实。
    2026-10-07 07:06:09
  • 用户
    热心网友
    甜蜜惩罚第一季免费全集观看动画版,内容值得关注,期待后续更新。
    20261007

期待你的精彩发言。