4作者: andyjohnson0大约 1 个月前原帖
我是一个开发者。我对经典神经网络有基本的工作知识。我想学习遗传算法。请问我应该阅读哪些书籍?我更喜欢纸质书,但也欢迎推荐PDF格式的书籍。
3作者: kamaludu大约 1 个月前原帖
Bash4LLM 是一个单文件的 Bash 封装程序,用于从终端与大型语言模型(LLM)进行交互。我创建它是因为我想要一个简单的工具,无需安装 Python、Node 或其他任何运行时环境。 它仅使用 Bash、curl 和 jq。您可以发送提示、开始小型聊天、逐行处理文件、流式输出,并以 JSON 格式保存会话元数据。 我尽量使其安全且可预测:不使用系统的 /tmp,不使用 eval。默认支持 Groq,其他提供者可以通过 extras/providers 文件夹中的专用 Bash 脚本添加。 示例: ```bash echo "explains the command: ls -l" | ./bash4llm ```
3作者: vforno大约 1 个月前原帖
大家好, 在Anthropic的Fable被禁之后,我开始着手开发nanoeuler,因为我的抱负和梦想是能够在Anthropic的人工智能领域工作。促使我创建nanoeuler的两个有趣原因是:(1)与大型语言模型(LLM)进行交互并不意味着理解它们是如何构成的;(2)在非常底层的层面上研究LLM,以理解参数与数据之间的关系、模型的增长、GPU的工作原理,以及如何优化某些层。 因此,我开始从研究的角度着手,逐步推动nanoeuler的发展,从Shakespeare.txt开始,理解一个具有2300万参数的文本生成模型所理解的内容。例如,在这个参数数量下,nanoeuler已经理解到“Name:”是一个行的开头,并且能够有意义地写出这一行。 我使用CUDA编写了一切,因为我希望在训练和推理过程中不使用任何中介。尽管使用SFT等方法的方式较小,但它们确实对理解构建一个像聊天机器人这样的LLM的各个步骤非常有帮助。 任何反馈、帮助或建议都是非常欢迎的!