返回首页
最新
我正在构建一个众包的人工智能检测基准。这个基准包含对同一提示的两个响应——一个来自真实人类(2022年前,证明在AI内容泛滥之前),另一个由AI生成。你需要选择出AI生成的内容。三次错误就会被淘汰。
数据集包括来自Reddit、Hacker News和Yelp的16,000条人类帖子,每条帖子都与来自两个提供商(Anthropic和OpenAI)六个模型在三个能力层级下生成的AI内容配对。使用相同的提示,长度匹配,没有对抗性指导——仅仅是模型的自然声音和平台上下文。
每次投票都会记录模型、层级、来源、响应时间和位置。
初步测试结果显示:Reddit的帖子很容易识别(人类的表达太随意,AI难以模仿),而Hacker News则显著更难。
我将把完整的数据集发布在HuggingFace上,如果通过这个众包研究能获得足够的数据,我会发表一篇论文。
如果你选择仅玩Hacker News模式,你是在帮助校准AI在这个平台上的可检测性。
我非常希望能收到关于这些配对的反馈——有没有哪些是显而易见的?有没有一些是真正困难的?
我们真的需要另一个代理协调器吗?可能不需要。但我找不到一个能与我实际使用编码代理命令行界面(CLI)相匹配的工具,所以我自己构建了一个。
Codelegate 是一款桌面应用程序(基于 Tauri 2 + React + xterm.js),它将代理会话组织成一个以键盘为主的工作区。我构建它是为了应对一些特定的烦恼:
1. 我希望能够用双手在键盘上导航。会话切换使用 `Alt+1..9`,窗格切换使用 `Alt+A/G/T`。无需使用鼠标。
2. 我在同一个代码库中并行工作,使用 Git 工作树。Codelegate 内置了工作树流程:为每个代理创建一个独立的分支,会议结束时自动清理。
3. 我希望能够继续使用我的 CLI 工具(如 zellij 等),而不是替代它们。
4. 我需要它在 macOS 和 Linux 上都能使用。
每个会话提供三个窗格:代理、终端和 Git。Git 窗格处理带有语法高亮的差异审查、批量暂存/取消暂存、提交和修改。会话在侧边栏按代码库分组。
目前支持 Claude Code 和 Codex CLI,但任何在 shell 中运行的工具都可以使用。
这是 v1.0.0,仅涵盖我最常用的代理 CLI 和功能。它采用 GPLv3 许可证,因此可以被分叉并根据你的工作流程进行调整。
希望你喜欢使用它或将其改造成自己的工具!