返回首页
一周热榜
嗨,HN!<p>我们整理了一个关于纯 Elixir 的群聊应用程序的展示,内容包括:<p>* Hologram UI<p>* Jido Agents<p>* Jido Messaging(将聊天桥接到 Telegram/Discord)<p>无论是前端还是后端,创作体验都是纯 Elixir。这次展示展示了这一技术栈的强大潜力。
嗨,HN,
我们是OpenLake的开发者,这是一个开源的存储引擎,用于将KV缓存卸载到远程磁盘和内存。
一旦我们将数据卸载到本地磁盘,我们意识到瓶颈在于PCIe或网络接口卡(NIC)的带宽。我们想知道在GPU上进行无损压缩是否可行,以实现快速读取和更低的TTFT(传输延迟)。
BF16通常很难压缩(符号/尾数的高熵)。令我们惊讶的是,实际的KV块非常不同。指数字节的熵非常低,几乎没有被填充。我们并不是压缩整个张量,而是仅在GPU上压缩指数流。
我们得到了以下结果:(H100,生产KV快照):
- 1.51倍无损压缩
- 622 GB/s的中位数GPU解码
解压缩速度比400 Gb/s的NIC带宽快约10倍,能够无损地传输数据而不改变质量。
我们将其开源为ExANS,届时将通过我们的vLLM和SGLang连接器在OpenLake v0.8版本中提供。推理引擎无需进行任何更改。
我很好奇其他人今天是如何处理KV传输的。你们是否在使用KV压缩,还是带宽尚未成为瓶颈?
谢谢!
GitHub: [https://github.com/openlake-project/openlake](https://github.com/openlake-project/openlake)
技术博客: [https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache](https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache)
这段代码可以预测未来某个价格点的确切时间和价格,并能够构建未来价格的曲线。它可以用于解析任何具有图形的过程——例如,人工智能与人类之间相互理解的图形。
嗨,HN,我根据你的反馈进行了改进:
latex.to 是一个 Overleaf 的替代品,现在可以在浏览器中运行完整的 TeX Live 发行版。
这是通过 CheerpX(JIT wasm 引擎)实现的,运行一个带有 TeX Live 的 32 位 Alpine 镜像。
我之前尝试过的方案:
- 最初这个项目只是使用 KaTeX 将 LaTeX 转换为图像。
- v86 wasm 引擎:速度太慢(至少比 CheerpX 慢 10 倍)。
- 各种 TeX Live 二进制文件的 wasm 移植:这些通常不支持 Biber(因为它是一个 Perl 应用)或像 ConTeXt 这样的引擎。
使其能够工作的原因:
- CheerpX 仅通过 HTTP 范围请求流式传输所需的数据。编译基础示例只需下载 50MB(整个镜像为 5GB)。
- Cloudflare R2 只能缓存小于 512MB 的文件。因此,5GB 的镜像被拆分为 1 个基础镜像和 19 个挂载镜像。
- LaTeX 在编译之前需要对字体进行预处理(索引),这可能需要很长时间,并且可能导致 CheerpX 内存溢出。因此,所有超过 0.7MB 的字体都预先处理到镜像文件中。
第一次编译会稍慢,因为需要下载字体等资源,但所有内容都被缓存,第二次编译会快得多。
100% 免费,无需登录,无编译超时,文档在浏览器中编译,而不是发送到远程服务器。
如果有任何问题或反馈,欢迎随时告诉我。