最近,由于当前的硬件短缺,不幸也好,幸运也罢,我们不能再无限制地向问题投入云算力,而是被迫真正关心底层发生了什么。我们正在调整推理引擎,学习量化数学,优化架构,只为在尽可能低的配置上榨取尽可能高的性能。
事实:
就在最近,Strix Halo 的
forked llama.cpp(s)
和
halogen-flash-server
将性能推向了顶峰,在解码上实现了双倍性能(52tok/s),在预填充上实现了 5-6 倍性能(1300tok/s)
对于 Qwen 3.8 Flash Next (Q38FN),而 Q38FN 本身是另一个带有 Engram 的大规模架构改进,使其不仅小巧而且智能。
我仍然记得在硬件短缺之前,作为一个热爱调整和优化的人,人们只是告诉我停下来,调整是愚蠢的,只需购买更多 RAM,购买更多 GPU..
这让我想起了早期的网络.. 那时设置一个盒子或托管服务器意味着要翻遍论坛帖子,在 IRC 上排除故障,并自由分享自定义脚本只是为了让它工作。那个时代不仅产生了程序员;它培养了高度多才多艺、端到端的思考者,他们从裸机开始理解整个技术栈。
将其与主流网络文化最终走向的地方对比。今天大多数平台如 Tiktok、Facebook、Youtube... 都是为零摩擦的末日滚动而设计的.. 无尽的短视频信息流旨在让我们分心并浪费时间。我们被便利过度宠坏了。
我的观点:
当我们拥有太少时,我们尝试学习更多。当我们拥有太多时,我们分心并学习太少。这是我们本地 LLM 社区的黄金时间,让我们学习和改进!
阅读更多
讨论精选
jacek2023 (332↑): " 当我们拥有太少时,我们尝试学习更多。当我们拥有太多时,我们分心并学习太少。"
这是一个众所周知的事实:创造力是限制的产物。
Haron51255 (298↑): 这个子版块最大的问题是巨大的 AI 文本墙,发帖人自己甚至没有读过。
mfkamil87 (141↑): 那个时代不仅产生了程序员;它培养了高度多才多艺、端到端的思考者,他们从裸机开始理解整个技术栈。 那个 X 不仅 Y,还 Z。典型的 AI。
如果帖子是用手和自己的想法打出来的,将非常感激。