返回首页

一周热榜

2作者: arnav__13 天前原帖
嗨,HN, 我们是OpenLake的开发者,这是一个开源的存储引擎,用于将KV缓存卸载到远程磁盘和内存。 一旦我们将数据卸载到本地磁盘,我们意识到瓶颈在于PCIe或网络接口卡(NIC)的带宽。我们想知道在GPU上进行无损压缩是否可行,以实现快速读取和更低的TTFT(传输延迟)。 BF16通常很难压缩(符号/尾数的高熵)。令我们惊讶的是,实际的KV块非常不同。指数字节的熵非常低,几乎没有被填充。我们并不是压缩整个张量,而是仅在GPU上压缩指数流。 我们得到了以下结果:(H100,生产KV快照): - 1.51倍无损压缩 - 622 GB/s的中位数GPU解码 解压缩速度比400 Gb/s的NIC带宽快约10倍,能够无损地传输数据而不改变质量。 我们将其开源为ExANS,届时将通过我们的vLLM和SGLang连接器在OpenLake v0.8版本中提供。推理引擎无需进行任何更改。 我很好奇其他人今天是如何处理KV传输的。你们是否在使用KV压缩,还是带宽尚未成为瓶颈? 谢谢! GitHub: [https://github.com/openlake-project/openlake](https://github.com/openlake-project/openlake) 技术博客: [https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache](https://theopenlake.com/blog/exans-lossless-gpu-compression-for-bf16-kv-cache)
1作者: SKYNET8006 天前原帖
这段代码可以预测未来某个价格点的确切时间和价格,并能够构建未来价格的曲线。它可以用于解析任何具有图形的过程——例如,人工智能与人类之间相互理解的图形。
1作者: Wdorf5 天前原帖
嗨,HN,我根据你的反馈进行了改进: latex.to 是一个 Overleaf 的替代品,现在可以在浏览器中运行完整的 TeX Live 发行版。 这是通过 CheerpX(JIT wasm 引擎)实现的,运行一个带有 TeX Live 的 32 位 Alpine 镜像。 我之前尝试过的方案: - 最初这个项目只是使用 KaTeX 将 LaTeX 转换为图像。 - v86 wasm 引擎:速度太慢(至少比 CheerpX 慢 10 倍)。 - 各种 TeX Live 二进制文件的 wasm 移植:这些通常不支持 Biber(因为它是一个 Perl 应用)或像 ConTeXt 这样的引擎。 使其能够工作的原因: - CheerpX 仅通过 HTTP 范围请求流式传输所需的数据。编译基础示例只需下载 50MB(整个镜像为 5GB)。 - Cloudflare R2 只能缓存小于 512MB 的文件。因此,5GB 的镜像被拆分为 1 个基础镜像和 19 个挂载镜像。 - LaTeX 在编译之前需要对字体进行预处理(索引),这可能需要很长时间,并且可能导致 CheerpX 内存溢出。因此,所有超过 0.7MB 的字体都预先处理到镜像文件中。 第一次编译会稍慢,因为需要下载字体等资源,但所有内容都被缓存,第二次编译会快得多。 100% 免费,无需登录,无编译超时,文档在浏览器中编译,而不是发送到远程服务器。 如果有任何问题或反馈,欢迎随时告诉我。