返回首页
最新
目前,获胜的人工智能工具往往是那些拥有最大市场营销预算和炒作的工具,而不是那些实际效果最好的工具。<p>我们希望建立一个市场,卖家必须提供证明,以便买家在付款前能够分辨出差异。我们正在努力为人工智能市场带来证明和质量。<p>我们现在正在构建这个平台。它尚未开放,在进一步推进之前,我们想了解什么因素会促使人们在上面发布信息。<p>如果您销售人工智能工具:在现有市场和目录中,您遇到了什么问题?什么会促使您在一个新平台上发布信息,而什么又会让您选择放弃?<p>在构建过程中,我们制作了两个免费的工具,无需注册。<p>Achboard可以像怀疑的买家一样读取任何人工智能产品的网站。<p>Comparima则将一个产品与其最接近的替代品进行比较,并显示每个产品的价格。<p>这两个工具都可以在achrima.com找到。
嗨,HN,
我们是OpenLake的开发者,这是一个开源的存储引擎,用于将KV缓存卸载到远程磁盘和内存。
一旦我们将数据卸载到本地磁盘,我们意识到瓶颈在于PCIe或网络接口卡(NIC)的带宽。我们想知道在GPU上进行无损压缩是否可行,以实现快速读取和更低的TTFT(传输延迟)。
BF16通常很难压缩(符号/尾数的高熵)。令我们惊讶的是,实际的KV块非常不同。指数字节的熵非常低,几乎没有被填充。我们并不是压缩整个张量,而是仅在GPU上压缩指数流。
我们得到了以下结果:(H100,生产KV快照):
- 1.51倍无损压缩
- 622 GB/s的中位数GPU解码
解压缩速度比400 Gb/s的NIC带宽快约10倍,能够无损地传输数据而不改变质量。
我们将其开源为ExANS,届时将通过我们的vLLM和SGLang连接器在OpenLake v0.8版本中提供。推理引擎无需进行任何更改。
我很好奇其他人今天是如何处理KV传输的。你们是否在使用KV压缩,还是带宽尚未成为瓶颈?
谢谢!
GitHub: [https://github.com/openlake-project/openlake](https://github.com/openlake-project/openlake)
技术博客: [https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache](https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache)
我构建了一个在线剪贴板,功能强大。<p>或者说,是一个可分享的临时工作区,我可以在这里粘贴文本和文件,设置过期计时器,或配置阅读与销毁。对于真正私密的内容,可以使用端到端加密(E2E),该加密方式在浏览器中对文本进行加密,然后再存储到数据库中(文件不会被加密)。它还提供了一个API,可以用来将其集成到自动化工作流程中。<p>我经常发现自己使用WhatsApp或Slack作为临时剪贴板,与自己(或同事)分享一些数据:配置、笔记、密码,有时还包括文件。这是一种快速且简单的解决方案,虽然能完成任务,但随着时间的推移,我的聊天记录变得杂乱无章,充满了我不再需要的内容。<p>有时我需要从无法使用WhatsApp或Slack的设备访问这些数据。对于这种情况,我依赖于像cl1p.net或pastebin这样的在线剪贴板服务,但总是遇到一些限制,妨碍了我的使用。<p>另一个使用场景是自动化。有时我需要将任意数据提供给自动化工作流程,因此能够快速将其发布到网上并通过API检索是我期待已久的功能。<p>一些功能包括:
- 语法高亮
- Markdown/HTML预览
- 上传最多10个文件(每个最大10MB,总共最大50MB)
- 设置自定义过期时间或配置阅读与销毁
- 用密码保护剪贴板的端到端加密,该密码作为文本的加密密钥(不适用于上传的文件)
- 也支持账户/团队(个性化网址),但上述整个流程在没有账户的情况下也能正常工作。<p>此外,正在开发自托管的开源版本。<p>欢迎反馈!
我非常喜欢使用 Conductor 及其带来的体验,但我更喜欢使用我的终端。因此,我构建了 t。
它的功能如下:
- `t new "fix vault sync"` 创建一个 git 工作树和一个分支,并切换到该分支。
- `t claude`、`t codex`、`t grok`、`t gemini` 在该工作树和分支上启动一个代理并记录该会话。
- 一个任务可以同时在不同的面板中进行多个来自不同代理的对话。所有对话都引用相同的工作树/分支。
- `t sessions` 列出与任务相关的每个对话,并恢复你选择的对话。`t find` 可以在所有对话中进行搜索。
嗨,HN,我是Shailendra和Karan。我们正在构建一种快速且安全的方式,让编码代理能够实时调试生产环境中的问题。
当生产环境出现故障时,它允许Cursor、Claude等在你的运行代码中安全地插入虚拟断点或探针,并提取日志中没有的确切变量值。
这一切都为工程师节省了时间和精力,否则他们需要翻阅日志和追踪信息,或者通过控制台日志或打印语句重新部署,直到找到根本原因。
这里是一个解释这一过程的视频链接:<a href="https://www.youtube.com/watch?v=ivV7I--ta5c" rel="nofollow">https://www.youtube.com/watch?v=ivV7I--ta5c</a>
现在,代理编写了我们大部分的代码。这缩小了工程师调试AI编写代码所需的有效上下文,而AI在同一代码中添加的有限遥测并没有帮助解决这个问题。
因此,当生产环境出现故障时,工程师的第一反应是打开日志或将其发送给你的代理。但如果你要查找的行不在其中,代理将开始根据不存在的数据猜测根本原因,迫使你添加日志并重新部署。
这种基于现有数据的代理分析推理循环并不便宜,消耗了大量的令牌。而添加日志和重新部署的周期又慢又痛苦,使得工程师对值班工作感到厌烦。
我们的方法让代理能够在故障发生的确切时刻和位置按需捕获遥测,打破了日志-重新部署的循环,并在消耗更少令牌的同时获得最准确的根本原因分析(RCA)。
显然的问题是如何在运行中的服务上实现这一点。你无法像在笔记本电脑上暂停调试器那样暂停一个实时服务。安全地从运行过程获取值,而不暂停线程或减慢主机的速度是一个挑战。我们正在实现这一目标。
在此之前,我在一个100人的团队中负责工程工作。然后Karan和我花了三年时间开发HyperTest,这是一个测试工具。
在HyperTest中,我们使用OpenTelemetry将生产流量转化为集成测试。这也是生产仪表化。我们学习到的困难部分是如何在不破坏运行服务的情况下提取真实的运行时状态。
我们还以艰难的方式学到了一些其他教训。HyperTest试图通过更好的测试来防止错误,而每次采用都是一场斗争。由于团队在处理生产问题,通话不断被取消。测试只是卫生,而生产故障则是火上浇油。这使我们看到了优先级所在。
这催生了构建一个真正自主的值班代理的想法,即一个能够在几分钟内接收警报、探测、诊断并修复问题的代理。但目前的工作方式是这样的:
你可以像往常一样与编码代理对话。告诉它哪里出错了:“结账返回200,但一些用户看到他们的订单失败,找出原因。”它会在你的本地代码中找到相关行,通过MCP与我们连接,并在运行服务的那一行插入探针。探针是只读的,直到真正的流量到达之前一直处于休眠状态。当被触发时,它会捕获调用栈每一帧的本地变量。然后将这些变量交给代理,代理利用真实数据进行诊断。
这个过程有两个部分。一个在你的服务内部运行的SDK,以及一个你的编码代理与之通信的MCP服务器。SDK使得在不重新部署的情况下设置探针(虚拟断点、日志或指标)成为可能。在Node和Python中,它是进程内挂钩的。在Java中,它作为JVM代理附加,在字节码级别进行仪表化。无论哪种方式,服务都保持运行并处理流量。没有任何暂停。
当你的代理想查看某一行时,它会调用MCP服务器,后者告诉SDK在该行放置一个探针。当请求到达该行时,SDK会捕获探针所请求的内容,在进程中进行清理,并通过MCP将其流回代理。
这可以在生产环境中运行,因此探针可以读取该变量中的任何值。我们确保在进程中进行数据脱敏,确保在任何数据传输之前完成。像密码、令牌、授权、社会安全号码和信用卡等关键数据默认会被脱敏,你也可以添加自己的脱敏规则。
此外,探针只能读取而不能写入,如果你希望捕获的状态永远不离开你的网络,你可以在你的基础设施中自托管服务器、代理,甚至数据库。
关于开销:在空闲时,SDK增加的内存几乎可以忽略不计,对吞吐量和响应时间几乎没有影响。探针只有在主动捕获时才会产生费用。此外,捕获是有界限的。一个单独的监控器实时观察,并在开销激增时拉取每个活动探针。
每个日志和追踪工具都向代理提供已经存在的数据,并要求其推理出可能发生的情况。我们认为,给代理提供对运行代码的“眼睛和耳朵”更有用,这样它们可以在需要时捕获所需的信息,正好在故障发生的时刻。
这似乎是调试生产事件最简单和最快的方法。
我们希望社区能够在任何环境中尝试这一方法,通过与编码代理聊天来调试任何已知或未知的问题。并告诉我们你需要哪些更多功能,以使其成为一个真正自主的值班代理。
支持的平台:NodeJs、Java、Python。
我的合作伙伴经常审核大量的P&ID(管道和仪表图)及相关文件(如Excel、Word、PDF、acd/l5x等)。在他的公司,这些通常是在Bluebeam中完成的。
很难查看差异并跟踪这些迭代所产生的所有修订。他们最终会存储像“rev3_final_redlined.pdf”这样的文件。我们一直在寻找类似Github的工具来进行这些审核,但还没有找到一个足够简单的工具,适合没有命令行经验的人使用(如果你知道其他工具,欢迎推荐)。
因此,我创建了withkord.com,旨在帮助进行修订和二进制文件的差异比较。欢迎任何反馈。