返回 讨论 apply CMS 文章

Tencent-HY3 在 128GB 显存上表现惊艳:编程能力超越 DeepSeek-v4-flash

Tencent-HY3 在 128GB 显存上编程能力超越 DeepSeek-v4-flash,但上下文窗口较小。

Tencent-HY3DeepSeek-v4-flashMiniMax M3编程能力
成长分 / 100 65 综合收获、行动、留存与影响

为什么值得读了解 Tencent-HY3 在 128GB 显存上的实际表现

对比 MoE 模型与密集模型的优劣

关键洞察
  1. Tencent-HY3 编程能力明显强于 DeepSeek-v4-flash
  2. DeepSeek-v4-flash 仅在速度优先时值得使用
  3. Tencent-HY3 比 MiniMax M3 好不少
转成行动

深入阅读

正文与原文对照

原文保真覆盖:全文原文字符:907

讨论精选

sixx7 (0↑): 完全同意!我在这里做了评测: https://youtu.be/32pkyoYmNjI

但 TLDR 版本:

比 deepseek-v4-flash 强很多的编程能力

只有在速度是首要考虑因素时才继续使用 deepseek-v4-flash

比 MiniMax M3 好不少

思考很多,因此感觉慢

编辑:哦,我忘了重要的事情。Deepseek 可以容纳 100 万上下文,而我在 Hy3 上只能得到大约 19 万。这对某些人来说可能是决定性因素。我也不是在贬低 Deepseek v4,它是一项工程奇迹。

Cold_Tree190 (0↑): 好奇想听听高显存用户(羡慕)的看法,但像 Q3 Hy3 这样的模型与基本全量化的 Qwen3.6:27B 相比如何?运行一个更大的 MoE 模型,即使是 Q3 量化,真的比全量密集模型更好吗?

Voxandr (0↑): 我刚拿到 DGX Spark 的线缆,准备运行 2x 和 3x Spark Hy3 张量并行性能测试。看起来很有趣!