返回首页

24小时热榜

12作者: HenryNdubuaku大约 24 小时前原帖
大家好,<p>我是来自Cactus的Henry!<p>我们之前发布了Cactus Needle,这是一款14MB的代理型大语言模型(LLM),用于工具调用、设备使用和结构化提取,适用于手机、可穿戴设备、智能家居、小型机器人和微控制器。我们收到了非常好的反馈,并根据建议发布了Needle 2。<p>整个模型是一个14MB的单一二进制文件,运行一个完整会话需要28MB的RAM;参数量为4500万,采用2位压缩。Needle在Raspberry Pi 5上达到每秒500个令牌的解码速度,在Meta Quest 3S和Apple Vision Pro等VR设备上介于每秒400到1500个令牌之间,在售价低于200美元的手机(如三星A系列)上则在每秒300到700个令牌之间。<p>在工具调用和移动设备使用的基准测试中,Needle 2与LFM2.5 230M和Apple Foundation Model等最接近的小型模型交替获胜,后者的体积是Needle 2的5到70倍,均采用f16,而Needle 2使用的是2位压缩。Needle基于我们论文中的简单注意力网络(Simple Attention Networks)(<a href="https://arxiv.org/abs/2607.18363" rel="nofollow">https://arxiv.org/abs/2607.18363</a>)。<p>边缘人工智能(Edge AI)最近主要指的是Mac和PC,但这仅占全球超过210亿个连接物联网设备中的15亿,而在新兴市场,大多数手机的售价低于200美元,且没有NPU,使用廉价GPU。这些设备包括预算手机、Raspberry Pi、微控制器、可穿戴设备、小型机器人(如Reachy Mini)和连接家居设备。<p>一款与Needle相同宽度和深度的传统变换器(transformer)每处理一个令牌需要消耗164 MFLOPs,即使是压缩到Needle参数数量的变换器也需要87,而Needle仅需70。即使在高端手机上,始终在线的助手也必须在功耗预算内运行;每个MFLOP都代表毫瓦时,而Needle每处理一个令牌所消耗的功耗比最小的高性能LLM少7到85倍。有关架构的更多信息,请查看链接。<p>当我们将智能结构化为具有类型参数的函数时,唯一困难的部分是将混乱的句子映射到这些函数上;使用哪个函数,传入哪些值。我们的研究发现,当以这种方式框定问题时,不需要任何世界知识和开放式散文,这就是为什么4500万参数足够的原因。<p>Needle 2扩展到结构化提取,允许在工具位置传递模式,模型返回结构化输出。您可以将Needle用作具有枚举字段的文本分类模型,或通过提供提取关键字段的模式来作为摘要模型,除了自由解码之外的所有功能。<p>每个产品都有其自己的工具词汇,微调Needle可以帮助其在自定义任务上实现前沿水平的性能,因此使用Python包(<a href="https://github.com/cactus-compute/needle" rel="nofollow">https://github.com/cactus-compute/needle</a>),可以在Mac或PC上在几分钟到几小时内完成Needle的微调,配合自动化数据生成管道,只需传递几个样本。<p>尽管如此,每个响应都带有基于我们Cactus Hybrid技术的学习置信度评分。如果高于您的阈值,则采取行动;如果低于阈值,则升级到云或更大的模型。将Needle 2与私有的DeepSeek-v4-Flash部署结合使用,特别适合企业级任务,几乎没有成本,我们可以协助进行此设置。<p>我们对Needle 2进行了大量思考,但可能仍然缺少很多内容,请使用提供的链接中的游乐场测试Needle并分享您的想法,我们始终非常感激!
9作者: zackashen大约 2 小时前原帖
嗨,HN!我们是Zack和Tommy,Keet的联合创始人(<a href="https://trykeet.com">https://trykeet.com</a>)。我们正在开发一款移动应用,能够生成任何主题的课程,配有短视频进行讲解和游戏进行巩固。课程内容与真实的课程大纲相似,旨在帮助你在较长时间内学习。 Tommy和我在大学的线性代数课上相识,接下来的四年里一起上课。我们的友谊建立在共同学习新事物的基础上。在学校里,课程大纲由他人设计,内容由教师传授,评估由教师编写。你只需到场即可。没有这种结构的学习令人沮丧,开始时也存在很多摩擦。 Zack对咖啡情有独钟,但在将YouTube视频、与ChatGPT的对话以及他正在阅读的书籍整合成对冲泡咖啡的各种变量的连贯理解时遇到了困难。他的尝试让他能够自由追寻好奇心,但教学设计却很复杂。每一段内容要么假设有某种先决知识,要么完全没有。 Keet是我们尝试提供自主学习的工具,同时增加有利于学习的结构。它能够找到一个定制的起点,并以逻辑顺序排列课程。 我们发现Keet在以下场景中最为有用: - 你对某个主题有兴趣,喜欢被动学习(例如,你非常喜欢学习中世纪历史,并生成关于中世纪工程的课程)。 - 你想探索一个你已经了解很多的主题领域中的小众话题(例如,你对生物学了解颇深,但想探讨迁徙动物如何感知地球的磁场)。 - 你在某个地方看到一个非常小众的话题被提及,想进一步探索(例如,便士大学的历史、复式簿记或罗伯特·摩西与BQE的创建)。 当你创建课程时,我们会询问一些关于课程难度、深度以及一些可选的意图问题,以了解你想学习的内容。未来,我们希望能够建立一个全球的先决条件地图,以便了解每个用户已经掌握的知识,从而为他们生成量身定制的课程。例如,如果某人主修计算机科学,他们的课程应该与没有STEM背景的人有很大不同。 在了解你的目标和意图后,我们会根据Biglan分类对课程进行分类。Biglan分类分为四个象限: - 硬性-纯粹(例如,数学、理论物理) - 硬性-应用(例如,工程学和应用科学) - 软性-纯粹(例如,历史、文学、哲学) - 软性-应用(例如,政策、管理、教育、社会工作) 我们利用这些分类调整教学内容,以更好地适应主题。例如,在寻找示例时,硬性-纯粹课程会寻找已解决的问题、证明和现实案例,而软性-纯粹课程则使用原始资料叙述和对比视角。 我们尝试先以网站形式构建,然后再以仅文本的移动应用形式进行开发。网站效果不佳,因为我们无法随时与内容互动,而当我们互动时,文本又显得乏味,无法清晰表达复杂的想法。Vox和3B1B的视频使复杂的想法变得易于理解,这激励我们转向基于视频的课程。没有一个“恍然大悟”的时刻让这一切变得可行。在过去的一年中,我们一直在使用和迭代这个产品,直到我们享受使用它的过程。 我们有两种类型的解释视频,分别使用Manim(<a href="https://www.manim.community/" rel="nofollow">https://www.manim.community/</a>)和Remotion(<a href="https://www.remotion.dev/" rel="nofollow">https://www.remotion.dev/</a>)制作。Manim用于需要数学可视化的视频,而Remotion视频则旨在动画化过程并展示原始资料,以模仿Vox视频的风格。 我们还在开发更具吸引力的评估方式,通过定制活动来完成。例如,在遗传学课程中,学习者可能会与Watson-Crick DNA模型进行互动,而不是回答关于碱基对的选择题。 你可以今天下载Test flight测试版(<a href="https://testflight.apple.com/join/wkWW2enA" rel="nofollow">https://testflight.apple.com/join/wkWW2enA</a>)。我们为每位用户提供3次免费的课程生成。你可以在候补名单页面使用代码“KEETHN”。下载应用后,尝试生成一个关于小众兴趣或非常具体主题的课程。我们看到的最酷的课程都是在这些类别中生成的。 [备注] - 个性化仍处于早期阶段。目前,Keet主要围绕主题和课程目标进行调整;我们希望它能更好地适应学习者的背景、节奏和薄弱环节。 - 课程生成速度较慢。我们故意在生成时间上做出了权衡,以获得更高质量的课程,因为用户将长期学习这些课程。 - 我们正在积极努力提高巩固质量。生成测验很简单,但生成能够深入理解概念的互动则困难得多。 [定价] 我们计划推出月度订阅,用户可以使用积分生成课程。这将类似于Suno(<a href="https://suno.com/" rel="nofollow">https://suno.com/</a>)。