现在大家都在谈论那种非自回归的架构,它能借助 JSON schema 以闪电般的速度进行概率预测。我早在一年前,也就是 2025 年 3 月就研究过这个,发表了一篇 arxiv 论文,把模型连同 pypi 包和训练数据集一起推到了 huggingface 上。然后一年之后,一家前沿实验室出现了,提出了同样的想法,像是字面意义上的突破,却没有技术论文、没有开放权重,也没有开放数据集。我把我的方法发在了这个 subreddit 上。供大家参考,主要的引导模型是 RL,而不是嵌入模型或 LLM
Reddit 帖子:
https://www.reddit.com/r/LocalLLaMA/s/6eGEwsAz43
论文:
https://arxiv.org/abs/2503.23303
模型:
https://huggingface.co/DeepMostInnovations/sales-conversion-model-reinf-learning
数据集:
https://huggingface.co/datasets/DeepMostInnovations/saas-sales-conversations
另外,2025 年 9 月发表的第二项工作,和 jev 现在提出的完全一样
论文:
https://arxiv.org/abs/2510.01237
我的模型在序列嵌入上使用 PPO,输出逐轮的转化轨迹(从 0.0 到 1.0 的概率)。
Jev 使用并行采样(通过 RLCD 训练)来输出置信度分布和 schema 选择。
令人极其沮丧的是,你花了几个月的心血、汗水和无数个不眠之夜做出来的东西,在架构上与那个垂直用例相似,却得不到你应得的支持,因为前沿实验室做的是横向的东西。总的来说,这就是开源的故事 🙂
顺便说一句,之前的帖子被 reddit 的过滤器删掉了
阅读更多
讨论精选
hapliniste(505↑):但你是不是发帖说这是下一个大事件?新手才会犯的错误
nullc(358↑):有一件事你可以 感到
乐观,因为你的工作,他们将无法就这个总体想法获得有效的专利并将其锁起来不让所有人用……所以因为你的工作,这个总体想法对所有人都是可用的,而本来可能并非如此!
这是一项巨大的贡献!……而且即使很少有人注意到你的代码,这一点依然成立。:)
Stunning_Mast2001(330↑):别以为 Jev 是一家前沿实验室,但生活中的很多事情都关乎在对的时间出现在对的地方 继续思考伟大的想法吧,像你这样的人通常不会只有一个。