返回首页
最新
这一直是一个实验项目,旨在构建一个在任何设备上都能舒适阅读的界面。它有点像是Pocket风格的界面、数字报纸和Hacker News的混合体。
大家好,我今天推出了 role-model:一个路由协议、一个参考路由器运行时以及一个用于 Pi 的扩展,旨在帮助做出更明智的路由决策。
role-model 主要是确定性的,并且可以回退到控制器模型,基于所选的路由策略来路由请求。该协议围绕为模型分配域和角色进行结构化,其中消费者应用程序(如 Pi)发送的请求具有任务类型,以丰富路由元数据,从而提高准确性。您可以运行内置基准测试,以比较模型在速度、质量和成本等方面的性能,以及在实际任务中的观察性能。我有一张关于路由工作原理的图示在 [0] 中。
该运行时支持本地模型,可以直接连接到您的本地端点(如 LM Studio、llama.cpp 等),或通过 vendored llama-swap 在多个本地模型之间进行路由。
由于昨天有另一篇关于模型路由的帖子,大家讨论了路由的基本知识,我将重点讨论我在构建和测试过程中获得的一些有趣的经验:
1. 模型路由本质上是在尝试预测未来:在这个请求上,哪个模型会表现最佳(基于用户定义的标准)?
2. 在您路由请求后,您希望评估这是否是正确的决策,或者是否有其他模型会表现得更好。
3. 您还会意识到,让路由器自行评估困难程度(以及其他因素)来做出决策远非理想——我们更希望消费者应用程序与路由器合作,定义请求的需求。
4. 您还会发现,当模型之间的区分度更高时,决策变得更容易、更准确,路由的结果也变得更具影响力。
关于第 2 点,我将推出可以在本地运行的评估工具,以基准测试您池中的模型在相同请求上的表现。这里的结果可以用作第 1 点的输入,以便在路由新请求时使用。
关于第 3 点,我为 Pi 构建了 pi-role-model 包,它允许 Pi 代理注入 role_model.intent 元数据,包括困难程度、首选角色,甚至特定模型 ID、所需能力(例如工具使用或图像输入)等。您应该能够在 Pi 中进一步自定义这一点,并通过更改元数据以其他方式进行路由。这就是我构建 role-model 路由协议的原因。
关于第 4 点,模型路由所产生的第二阶效应实际上是为专业模型创造了市场——这些模型可能更小、可能更便宜或更昂贵,可能可以在本地运行。在两个前沿模型(如 GPT 5.5 和 Opus 4.8)之间进行路由是没有太大意义的;在模型之间进行路由时,更有意义的是其中一个质量、速度、成本因素是其他候选模型的倍数,并且拥有专业领域模型(如代码、散文、数学和科学、视觉等)更是合情合理。在这个阶段,模型路由变得非常有价值。
虽然 role-model 有一个我正在持续构建的参考运行时(还有很多工作要做,以改善路由,并为用户提供更细粒度的路由决策控制,以及改进跨模型缓存的方式,并添加像 FastContext 这样的技术),但 role-model 的最终目标是为推理请求建立一个标准协议,以供消费者应用程序使用,这样提供者,无论是路由中间件还是推理提供者,都能够路由到在成本、速度和质量之间取得最佳平衡的模型,并尊重用户的选择,甚至让用户控制这些偏好,以便在某些任务中使用本地模型,而在其他任务中使用云模型。
链接:
[0] role-model - 模型路由协议的案例: [https://try.works/role-model-the-case-for-a-model-routing-protocol](https://try.works/role-model-the-case-for-a-model-routing-protocol)
[1] GitHub: [https://github.com/try-works/role-model](https://github.com/try-works/role-model)
[2] 文档: [https://role-model.dev/](https://role-model.dev/)
在我上学的时候,我的老师常常给我们班玩一个游戏。这个游戏是轮流添加一个字母,试图组成一个单词。后来,我尝试寻找这个游戏,但没有找到完全相同的版本。最接近的是拼字游戏(Scrabble),但它太复杂了。因此,我决定自己制作一个。
我确实做了一些修改,使游戏更加具有挑战性和趣味性。那时候,我们会从一个空白的棋盘开始,并且还会为两个字母的单词计分。而在这里,游戏会预填随机字母,这样每次游戏的体验都会有所不同。两个字母的单词不计分。我添加的最棒的功能是组合得分。如果你的字母组成了两个或更多的单词,你将为每个后续的单词获得一个倍数加成,因此挑战在于寻找能够获得更多组合得分的方法。
我还添加了每日谜题,你将获得5个棋盘,需要找到最佳位置和最佳字母,以获得最高的得分。你可以将类似Wordle的结果分享给你的朋友。
这是一个我在周末创建的项目,源于我对经典终端应用程序的失望。这些应用程序存在一个问题:如果我重启我的Mac,那么我的Claude Code实例或Shell实例就会停止,我必须手动重新运行它们。此外,它们在运行多个Claude Code实例时并不是很优化,因此我创建了这个项目来解决这个问题。