返回首页

24小时热榜

1作者: andrelago大约 8 小时前原帖
通过Ollama和类似提供商,使用自定义任务集对本地大型语言模型(LLMs)进行基准测试,涵盖多种指标。您可以使用确定性的评估标准或带有自定义指令的LLM评审员。 此外,这还支持查询HuggingFace,以便根据您设备的规格比较热门模型,从而了解哪些模型可能值得在您的环境中进行测试。