2作者: greggman653 个月前原帖
这几乎完全是由Claude创建的,不是我。我知道有些人对此不太感兴趣,三个月前我也是其中之一。自今年年初以来,我终于开始认真尝试人工智能。我所在的公司也举办了一周的人工智能培训。我要说的是,我真的感到震惊。在过去的一个月里,我的生活感觉发生了变化,从一个主要写代码的人变成了一个主要让人工智能编写代码的人。为了提供一点背景信息,我60岁,自1980年以来一直在编程。 我理解所有的担忧,我在工作中会审查所有的人工智能代码,以及大多数个人项目中的人工智能代码。然而,这个项目我并没有太多审查。我知道这样做不太被认可,但这是一个小型、有限范围的个人项目。并不是说我没有关注,Claude确实以一些奇怪的方式做了一些事情,我经常要求它修正这些问题。但相对而言,我对Rust没有任何经验,对OpenXR没有任何经验,对wgpu也没有任何经验,几乎没有相关的Windows经验。 我估计我总共花了大约30小时来引导Claude完成每一步。我开始时让它“制作一个打开窗口的Windows应用程序”。然后我让它添加wgpu并绘制“你好,三角形”。接着我让它添加OpenXR,并在虚拟现实中绘制这些三角形。实际上,这花了一些时间,因为它试图弄清楚如何将wgpu纹理连接到在OpenXR中绘制的表面。不过,它最终解决了这个问题,远比我自己要快得多。我可能会尝试寻找一个有效的示例,或者放弃。 然后我放置了这个项目大约一个月,终于在这个周末重新回到它身上,迅速让Claude使其正常工作。我唯一做的就是制作一些程序员艺术图标。 如果有人感兴趣,我可以在代码库中发布提示,前提是我能找到它们。 此外,在过去的两周里,我复活了一个老项目,它经历了位腐蚀。Claude将其更新到最新版本,修复了一些错误,并勾选了我一直想添加的一些功能。我还让Claude编写了两个库,一个是zip库,一个是rar解压库,并重构了一个现有的zip解压库以使用一些现代特性。这真的很有趣!对于这些项目,我阅读的代码比这个项目多得多。尽管如此,“活在这个时代真好”!
1作者: _nhynes3 个月前原帖
嗨,HN,最近关于伯克利RDI基准测试完整性的帖子引起了很多关注[0],现在似乎是分享Amber的好时机,Amber是一个旨在简化代理基准测试可重复性的相关工作。 Amber源于RDI AgentX-AgentBeats基准测试竞赛[1],该竞赛邀请公众提交代理。为了确保结果的可信度,我们需要提交的内容是可重复的,并且具有明确的来源。可重复性促使我们对基准测试进行声明性规范,而来源则促使我们能够安全高效地在托管硬件上运行基准测试。一旦支持多阶段多代理基准测试(如狼人游戏),Amber的设计基本上就自然而然地形成了。 Amber的灵感来源于Fuchsia OS组件框架。Amber的安全模型是,像A2A代理或MCP工具这样的组件仅为那些被明确授予使用权限的组件提供服务。在基准测试的上下文中,这意味着正在测试的代理无法访问评估器,并且工具可以在基准测试的后期阶段被撤销。 Amber结合了编译器和运行时系统:编译器将描述代理、工具以及它们如何相互连接的清单转换为确定性的计划。该计划可以在不同的后端上执行,如Docker、K8s、KVM或主机操作系统。编译器注入了执行能力模型所需的运行时组件:提供组件间受保护连接的边车路由器,以及允许组件在运行时创建和销毁其他组件的后端控制器。 Amber最初仅使用静态的`docker compose`,但像TerminalBench和OSWorld这样的基准测试需要添加动态组件和基于虚拟机的组件。随后,竞赛参与者希望有一种更简单的本地测试方式,而不需要重复构建Docker镜像,因此Amber获得了原生二进制支持和一行命令的`amber run`接口。从Fuchsia借用的概念到目前为止都得到了验证。现在,我正在努力使Amber的可观察性追踪可供基准评估者使用,以便根据代理所采取的路径进行评判,而不仅仅是最终答案。 总体而言,我们设定的目标是使在低信任环境中重现代理基准测试结果变得简单。Amber并不是一个完整的解决方案,但它减轻了基准测试作者和代理构建者的一些负担。也许它在基准测试之外也有用。我很乐意接受你对这个概念框架的批评! AgentBeats tau2基准测试清单[2]是一个真实的例子。树内混合站点示例[3]是Amber端到端的简单演示,使用`amber run`命令。 [0]: [https://news.ycombinator.com/item?id=47733217](https://news.ycombinator.com/item?id=47733217) [1]: [https://rdi.berkeley.edu/agentx-agentbeats.html](https://rdi.berkeley.edu/agentx-agentbeats.html) [2]: [https://github.com/RDI-Foundation/tau2-agentbeats/blob/main/amber/amber-scenario.json5](https://github.com/RDI-Foundation/tau2-agentbeats/blob/main/amber/amber-scenario.json5) [3]: [https://github.com/RDI-Foundation/amber/tree/main/examples/mixed-site](https://github.com/RDI-Foundation/amber/tree/main/examples/mixed-site)
1作者: windystockholm3 个月前原帖
嗨,HN, 我意识到我每天都在追踪代码,却忽视了自己的健康。 于是我创建了 GitBalance,可以像记录代码提交一样记录锻炼,并将其视为贡献图。 你甚至可以通过命令行界面来操作: ``` gitbalance commit -m "30分钟锻炼" gitbalance commit -m "拉伸 + 手腕恢复" ``` 这是一个非常早期的 MVP——想知道这是否能引起共鸣。