讨论精选
MuffinPure9787 (0↑): 利用人类打字延迟来隐藏计算延迟,这简直太聪明了。我们实际上以大约每秒2个token的速度输出文本,而GPU却只能闲置着无所事事。有点不可思议的是,这竟然还不是每个本地前端工具的默认行为。
lost-context-65536 (0↑): 如果你还没见过 CachyLLama
,不妨去看看。它可能对你有用。
-p-e-w- (0↑): 最好的想法总是在别人用起来之后,才让每个人都觉得显而易见😉 太棒了!我只能附和另一位评论者的疑问:为什么这还不是每个本地UI的默认设置。
