2作者: rndhouse5 个月前原帖
你好, 我正在构建Draxl,这是一种源格式,旨在为一个由数百万代理编辑代码的世界服务。 人工智能代理将生成比人类今天更多的代码。重基分支、并发编辑和长期存在的分叉将变得更加普遍。在这种规模下,代码管理需要更精确的控制。 Draxl将稳定的抽象语法树(AST)节点ID直接嵌入源代码中,因此工具可以通过身份而不是行位置来定位语法。以下是一个小例子: ```rust @m1 mod demo { @d1 /// 增加x的值1。 @f1[a] fn add_one(@p1[a] x: @t1 i64) -> @t2 i64 { @c1 /// 缓存中间值。 @s1[a] let @p2 y = @e1 (@e2 x + @l1 1); @s2[b] @e3 y } } ``` 语法为: ``` @id[rank]->anchor ``` * `@id` 为下一个节点提供稳定的身份 * `[rank]` 在有序槽内对兄弟节点进行排序 * `->anchor` 将分离的文档或注释附加到现有的兄弟节点ID 相同的代码可以简化为普通的Rust代码: ```rust mod demo { /// 增加x的值1。 fn add_one(x: i64) -> i64 { /// 缓存中间值。 let y = (x + 1); y } } ``` 在Draxl中,函数、语句、表达式、文档和注释都可以携带稳定的ID。有序的兄弟节点携带明确的等级。分离的文档和注释可以携带明确的锚点。 这使得工具可以说“替换表达式`@e3`”或“将语句插入`@f1.body[ah]`”,而不是“更改附近的这些行”。 这应该使得在大量并发编辑下的语义重放更加可靠。它还应该减少虚假的合并冲突,并更精确地定位真实的冲突。 这也开启了其他用途。你可以直接将所有权、政策或审查元数据附加到AST节点上。 我对早期反馈很感兴趣:这种源模型是否感觉有用,以及以这种方式编辑代码是否更适合以代理为主的工作流程。在互联网上讨论这类事情的最佳地方在哪里? 请与我联系: [https://x.com/rndhouse](https://x.com/rndhouse)
1作者: mbadyl5 个月前原帖
我一直在大量使用Claude Code,并围绕它构建了一个网页界面。主要感觉缺少的就是在模型运行时对其实际操作的可视化——因此核心功能是Claude步骤和工具调用的实时交互图表。<p>它还具有一个聊天用户界面,支持流式传输、项目和会话管理、带有YOLO模式的权限控制,以及用于在API密钥之间切换的个人资料。<p>目前处于早期阶段,采用MIT许可证,主要是为我自己构建的。
1作者: krishpavuluri5 个月前原帖
我们运营一个云设备农场,用于移动测试自动化(真实的Android/iOS设备,Selenium Grid,Appium)。<p>我们刚刚推出了一款聊天AI助手,它可以在每个设备会话中使用。它可以实时查看屏幕,并回答诸如“那个按钮的XPath是什么?”或“给我第二行的UIAutomator2选择器”这样的问题——并以Java、Python、Swift、Kotlin或WebDriverIO的代码格式输出。<p>实现方式是:我们在查询时从WebRTC流中抓取一个帧,并将其传递给一个视觉大语言模型(LLM),并使用结构化提示。模型返回所有适用格式的定位器(XPath、CSS、UIAutomator2、XCUITest、可访问性ID)。我们对输出进行解析并渲染,带有语法高亮。<p>主要挑战在于提示工程,以获得干净可解析的输出,而不是带有嵌入代码的散文。<p>欢迎就实现细节提出问题。
3作者: data-leon5 个月前原帖
我开发这个应用是因为我想要一个简单的姿势监测工具,可以全天候运行而不增加额外的负担。它在Mac上本地运行,实时监测姿势偏差,并在你开始驼背时提醒你。 我特别希望能收到关于准确性、隐私期望以及提醒在实际使用中是否有用的反馈。 谢谢!
3作者: erkok5 个月前原帖
当我年轻的时候,我曾玩过一款名为《Helbreath》的韩国MMORPG,并且还为其托管了一些私人服务器。后来我逐渐转向其他事物,但我始终喜欢这款游戏的美术风格、2D特性和氛围。也许这只是怀旧之情在作祟。 社区维护的私人服务器和客户端,据我所知,是基于泄露的官方文件,使用相当古老的C++编写。如果你对原始源代码感兴趣,我在参考文件夹中包含了主要的客户端和服务器文件,分别是Client.cpp和Server.cpp。我一直觉得,如果这个项目用更现代、更结构化的语言重写,能够做的事情会更多。然而,从头开始重写一个MMORPG的客户端和服务器并不是随便就能做到的事情。话说回来,有一个人用C#重写并基于XNA的客户端做得相当不错,不过那个项目现在也已经停止了。 现在人工智能已经变得相当强大,我决定看看能否通过将原始资产连接到一个现代的HTML5游戏引擎中,取得多大的进展。我选择HTML5是因为我认为一款近30年的2D游戏在浏览器中运行应该没有问题。最终我选择了Phaser 3,主要有几个原因。首先,它仅支持2D,免费,优先支持HTML5(JS/TS),并且是代码优先,这一点很重要,因为我希望能有良好的Cursor集成以便于AI辅助。我还喜欢它与React的集成,这让我可以使用浏览器技术构建用户界面,并在WebGL画布上以原生分辨率渲染用户界面,而不是在游戏引擎内部构建用户界面,后者的分辨率为1024x576。原始游戏的分辨率为640x480。 经过大约1.5个月的晚上和周末与AI交流,以及大约200美元的Cursor使用费用后,我完成了在一个现代游戏引擎中连接原始资产的工作,这个引擎似乎在浏览器中运行得很好。 所谓的“基础游戏客户端”,是指它在如何实现完整的(MMO)RPG功能方面并没有完全连接,但它包含了所有原始资产和核心机制,为你在此基础上构建自己的2D(MMO)RPG提供了坚实的基础。继续使用AI进行开发也应该没问题,因为这正是我能走到这一步的原因。就我而言,资产库相当丰富,但有一个警告:这些资产并不属于公有领域。它们仍然是某个人或某个实体的财产,这个实体继承了原开发者的知识产权,而原开发者已经不再营业。你可以在GitHub页面上了解更多相关信息。
1作者: godot5 个月前原帖
大家好,这是我一个早期的副项目版本。希望能收到一些反馈和评论。 我喜欢卡拉OK,成长过程中接触的是带有音乐视频和底部歌词的亚洲风格卡拉OK。有时候我想唱一首歌,但找不到这样的卡拉OK版本视频。 几年前,我发现了一些机器学习模型,可以干净地分离歌曲的主唱和伴奏。我想到一个主意:将多个机器学习模型串联起来,输入一个音乐视频文件,提取音频(使用ffmpeg),分离音轨(使用机器学习),转录歌词(使用机器学习),将带有时间信息的歌词重新嵌入视频中(使用ffmpeg),最终输出一个卡拉OK版本的视频。 这是这个应用的早期版本,目前仅支持Mac(因为我使用Mac,尽管它是一个Electron应用……我最终想做一个Windows版本),我只让几个朋友试过。请告诉我你们的想法!