返回首页
最新
我正在开发一个专门为自主AI代理设计的内存平台。
目前,代理内存面临两个乏味的选择:RAG(关系拓扑丢失)和图数据库(需要大量指针追踪,并在重度递归推理时性能下降)。
我正在使用向量符号架构(超维计算)构建一种替代方案。通过将事实、序列和树以数学方式绑定成固定大小的高维向量(D=16,384),我们可以将复杂的图遍历压缩为O(1)常数时间的SIMD操作……并且以低成本实现一些类脑的功能,也就是说,不依赖于GPU和大型语言模型(LLM)。
设计正在顺利成熟,并严格分为两个部分,以尊重机械同情:
• 数据平面(Zig):纯粹的裸金属数学。通过io_uring实现2GB内存映射的NVMe块。事实被叠加到严格对齐到64字节缓存行的无锁8位累加器中。查询通过AVX-512 popcount指令执行,以线速计算汉明距离。没有垃圾回收。
• 控制平面(Gleam):处理并发、路由以及用于外部通信的Linda风格元组空间。它管理代理的“清理”循环和自动分块,而不会阻塞数据平面。
• 桥接:一个严格的C-ABI/NIF边界,将指针从BEAM调度器直接传递到Zig的核心部分。
这里没有风险投资的浮夸言辞,我也没有对AGI做出夸大的声明。我已经完成了大部分规格、内存布局不变性和架构设计。现在开始编码,并取得了良好的进展。
我在寻找热爱低级系统(Zig/Rust/C)或高度并发运行时(Erlang)的人来帮助我构建这个平台。这是我第二个AI平台,第一个平台运转良好并在不断增长。
如果你对裸金属系统工程感兴趣,想解决LLM上下文瓶颈,我很乐意交流:请发邮件至acowed@pm.me。
祝好,
Kendall
快速分享这个概述。为了获得一个操作系统神经系统,而不是典型的人工智能网络架构,我们做出了架构选择,将语音、接口和系统状态作为独立服务,通过共享的网络进行协调——这为我们提供了PearlOS的“骨架”。
Mozzie最初是我为自己的工作流程构建的一个工具。<p>我喜欢同时处理多个任务,但大多数开发工具将工作流程分散在不同的地方:工单存在于问题跟踪系统中,执行在终端中进行,而上下文在它们之间往往会丢失。我希望我的工作项目及其上下文能够紧挨着实际工作的地方。<p>Mozzie是一个本地桌面工作区,每个工作项目可以启动自己的终端或编码代理。这个想法是将任务作为主要界面——每个任务都持有其上下文,并可以独立运行命令或代理。<p>这样可以更轻松地并行处理多个任务,而无需不断在工具之间切换。<p>虽然还处于早期阶段,但我每天都在使用它,它符合我喜欢的工作方式。<p>我很好奇是否还有其他人喜欢这样工作或尝试过类似的工具。
大家好,我是 Veer,我的联合创始人是 Suryaa。我们正在构建 Cumulus Labs(YC W26),并推出我们的最新产品 IonRouter([https://ionrouter.io](https://ionrouter.io)),这是一个用于开源和微调模型的推理 API。您只需替换我们的基础 URL,保留现有的 OpenAI 客户端代码,即可访问在我们自己的推理引擎上运行的任何模型(无论是开源模型还是针对您进行微调的模型)。
我们遇到的问题是:每个推理提供商要么是快速但昂贵(如 Together、Fireworks——您需要为始终在线的 GPU 付费),要么是便宜但需要自己配置(如 Modal、RunPod——您需要自己配置 vLLM,并处理缓慢的冷启动)。这两种选择都不适合那些只想快速交付的团队。
Suryaa 在 TensorDock 构建 GPU 编排基础设施和在 Palantir 的生产系统方面有多年的经验。我负责 Space Force 和 NASA 合同的机器学习基础设施和 Linux 内核开发,这些技术栈必须在压力下实际工作。当我们开始自己构建 AI 产品时,我们不断碰到同样的障碍:GPU 基础设施要么太贵,要么工作量太大。
因此,我们构建了 IonAttention——一个专门围绕 GH200 内存架构设计的 C++ 推理运行时。大多数推理栈将 GH200 视为兼容性目标(确保 vLLM 可以运行,使用 CPU 内存作为溢出)。我们采取了不同的方法,围绕硬件的实际有趣之处进行构建:900 GB/s 的一致 CPU-GPU 链接、452GB 的 LPDDR5X 紧挨加速器,以及可以实际使用的 72 个 ARM 核心。
我们认为从中得出的三点是新颖的:(1)利用硬件缓存一致性使 CUDA 图表现得像是具有动态参数,而每步成本为零——这仅在 GH200 级硬件上有效;(2)由不变性驱动的急切 KV 块写回,而不是内存压力,这将驱逐延迟从 10ms+ 降低到 0.25ms 以下;(3)在小批量大小下的幻影块注意力调度,在受影响最严重的情况下将注意力时间减少超过 60%。我们在 cumulus.blog/ionattention 上详细介绍了这些内容。
在多模态管道中,我们的性能优于大公司(在相同 VLM 工作负载下,588 个 token 对比 Together AI 的 298 个 token)。我们坦诚地说,目前的 p50 延迟较差(约 1.46 秒对比 0.74 秒)——这是我们正在积极解决的权衡。
定价是按 token 计费,没有闲置费用:GPT-OSS-120B 的输入为 $0.02,输出为 $0.095;Qwen3.5-122B 的输入为 $0.20,输出为 $1.60。完整的模型列表和定价请访问 [https://ionrouter.io](https://ionrouter.io)。
您可以立即在 [https://ionrouter.io/playground](https://ionrouter.io/playground) 尝试我们的游乐场,无需注册,或者输入您的 API 密钥并替换基础 URL——只需一行代码。我们构建这个是为了让团队能够看到我们引擎的强大,并最终使用相同的解决方案来满足他们的微调模型需求。
我们很想知道您的想法,特别是如果您正在运行微调或自定义模型——这是我们投入最多的用例。有什么问题?什么能让这个对您真正有用?