1作者: GodelNumbering2 天前原帖
目前有很多大型语言模型(LLM)的基准测试,但很少有,甚至没有,专门针对“工具使用”的基准测试。我认为这将是一个非常好的社区项目,可以建立这样一个基准测试。 最终目标:建立一个关于“工具使用”性能的排行榜(多维度),涵盖一系列多样化的现实世界任务[1],并按基础模型和推理努力进行分组。任何人都可以贡献结果。 任务标准、测量方法、基础框架等可以由一个团队而不是单个人决定。 如果有足够的兴趣,我将创建一个Discord频道。 披露:我是一款名为Dirac的编码代理的维护者(https://github.com/dirac-run/dirac),因此我不会影响最终基准测试的样子,以避免任何利益冲突。我只是想让这个项目实现。 [1] 多样化的现实世界任务是指那些复杂程度足够高、贡献者曾经遇到过的任务,最好来自开源代码库。
2作者: alias_122 天前原帖
这是一个旨在被公众破解的实验,因此,请随意利用。这个实验基本上是一个有限的免费供应,由公众进行挖掘,总量在100到10000之间,因此比比特币的2100万有更严格的上限。一旦免费供应耗尽,交易就会开始,而我的理论并没有深入到这一点,因此经济要么会蓬勃发展,要么会严重崩溃。祝你实验愉快!