新闻 科普

12GB显存显卡跑125B模型:Strata登场

李桂岩 阅读约 5 分钟 943390 阅读
12GB显存显卡跑125B模型:Strata登场
配图:12GB显存显卡跑125B模型:Strata登场

新闻导读

12GB显存显卡跑125B模型:Strata登场深色模式配星空专题合适,注释可开关,交互在服务阅读。方法讲得多:对照、重复、证据强弱,比只丢结论更让人长进。愿意把内容传给家人的产品,已经过了信任门槛。收藏、稍后读和笔记同步比较稳,复习旧内容不用重新翻半天。若你也怕“不懂”,不妨从一条条小问题开始。

IT之家 10 月 6 日消息,科技媒体 gigazine 今天(10 月 6 日)报道,报道称开发者 Niko1221 开源推出 Strata 引擎,可以在 12GB 及以上显存的消费级显卡上,运行量化的 Qwen3.8-Flash-Next 模型(1250 亿参数)。 IT之家注:Qwen3.8-Flash-Next 模型是阿里巴巴 Qwen 团队于 2026 年 8 月推出的多模态混合专家(MoE)模型的压缩版本,配有 125B 参数,另含 51B 参数的 n-gram 嵌入表,原生支持 262K token 上下文长度。 Strata 为了降低显存占用,主要采用两项关键技术:其一是将 MoE(混合专家)模型整体载入 RAM,仅将高频使用的专家模型载入 VRAM。其二使用轻量模型进行投机解码,预测下一 Token 以加速推理过程。 量化版本(Size)写答案速度(Writes answers)阅读提示速度(Reads your prompt)Q2_094 个词元 / 秒2,650 个词元 / 秒IQ2_XS79 个词元 / 秒2,090 个词元 / 秒IQ3_XXS62 个词元 / 秒1,750 个词元 / 秒IQ3_S53 个词元 / 秒1,620 个词元 / 秒Coder55 个词元 / 秒2,180 个词元 / 秒

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:http://www.gxycedu.cn/te_inform?id=htlyhx-a12abnp%3D2p%3D13p%3D5p%3D13

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者10号
    版本说明会写清知识点修订了什么,而不只是“体验优化”。健康类注意证据和个体差异,很少一刀切下结论,也不推销神方。字号行距可调,夜间模式护眼,长时间阅读相对不累。求知从情绪慢慢变成方法,转变安静,但对人影响很大。转给带娃的父母时也不担心语气太冲或太玄乎。
    20261007 · 来自移动端
  • 用户
    张双喜
    通勤路上听音频讲解特别合适,语速不赶,吐字也清楚。像模型为什么不等于现实本身这种问题,讲解顺序清楚,不太把人劝退。图示和类比都挺到位,读完往往能记住核心观点,而不是只剩“好神奇”。广告若有也相对克制,注意力还能留给内容本身。好的工具不吵不闹,但你会总想起打开看一眼。
    2026-10-07 03:15:12
  • 用户
    热心网友
    快穿之第三者(HP)肖舒TXT百度云,内容值得关注,期待后续更新。
    20261007

期待你的精彩发言。