返回首页
一周热榜
目前有很多大型语言模型(LLM)的基准测试,但很少有,甚至没有,专门针对“工具使用”的基准测试。我认为这将是一个非常好的社区项目,可以建立这样一个基准测试。
最终目标:建立一个关于“工具使用”性能的排行榜(多维度),涵盖一系列多样化的现实世界任务[1],并按基础模型和推理努力进行分组。任何人都可以贡献结果。
任务标准、测量方法、基础框架等可以由一个团队而不是单个人决定。
如果有足够的兴趣,我将创建一个Discord频道。
披露:我是一款名为Dirac的编码代理的维护者(https://github.com/dirac-run/dirac),因此我不会影响最终基准测试的样子,以避免任何利益冲突。我只是想让这个项目实现。
[1] 多样化的现实世界任务是指那些复杂程度足够高、贡献者曾经遇到过的任务,最好来自开源代码库。
大家好!<p>我每天在几个Facebook页面上发布内容。<p>它们都有相同的格式:一种推特风格的帖子——一张图片,包含名字、照片和正文。<p>这是我第一次寻找这个模板,但没有找到。尝试了Canva,搜索模板,也没有找到。<p>于是我在Canva上从零开始设计了一个。<p>现在,我希望其他人不再需要自己设计这个模板。<p>这是一个简单的应用程序。一个推特风格的模板。你只需更换照片、名字,添加你的内容,然后将图片下载为JPG格式,便于在社交媒体上发布。<p>非常简单。无需登录。没有后台。没有AI功能。100%免费。<p>这是为我自己制作的——但可能对其他人也有用。希望你们喜欢!
Pistachio 是一个声明式的模式迁移工具,类似于 sqldef,采用类似 Terraform 的计划/应用工作流程。<p>我创建这个工具是因为有一些 SQL 语句是 sqldef 无法解析的。<p>Pistachio 使用 pg_query_go。<p>演示:docker run --rm -it ghcr.io/winebarrel/pistachio-demo