返回首页

一周热榜

3作者: kushalpatil073 天前原帖
我开始思考为什么火花不支持语音模型。目前有很多优秀的开源模型可用,比如parakeet、kokoro、Qwen ASR等,但如果不自己管理一堆GPU,就无法使用它们。 即使是像Gemma 4这样的LLM(大型语言模型),在语音代理中也不被支持。 然后我意识到,推理平台需要根据你所使用的用例进行不同的优化。以LLM为例,而不仅仅是语音转文本(STT)和文本转语音(TTS): - 编码代理 -> 需要大量缓存输入,需要针对KV缓存进行优化 - 创建幻灯片/博客 -> 输出量大,需要针对推测解码进行优化 - 语音LLM -> 缓存输入小,输出少,目前还没有找到优化的方法。 因此,TTS和STT是完全不同的领域。 我不知道的是时间问题,大家现在是否真的想使用像kokoro、parakeet、Qwen等开源模型?
3作者: vivekyyy3 天前原帖
有一段时间,像 Kiro、OpenSpec/SpecKit、Tessl 这样的 SDD 工具似乎将成为编码代理的未来。至少在我看来,这似乎是个好主意,它解决了很多人对编码代理随意发挥而产生的问题。然而,如今看来,所有的 SDD 工具似乎都已经失去了热度,但人们的抱怨依然存在——编码代理仍然经常编写不符合用户要求的代码。难道我们大家都共同决定了“/plan 模式”就足够了吗?
3作者: mtabini3 天前原帖
标题:展示 HN:我们构建了一个开放的 USB-C 电力传输分析仪和可编程负载 <p>大家好!我们是 Arbi、Marco 和 Rob,我们开发了 Dr. PD,旨在让 USB-C 电力问题更易于理解。它位于电源和设备之间,捕获并解码它们的 USB-PD 协商,并将其与电压和电流测量相关联。它还可以作为一个可编程负载,支持固定电源、PPS、AVS 和高达 240 W 的 USB-PD 3.2 EPR。</p> <p>商业 USB-PD 分析仪的价格通常超出业余爱好者和独立设计师的承受范围。我们的使命是让高质量的测试设备变得更易获取。Dr. PD 的硬件、固件、软件、库和文档都是开源的。</p> <p>硬件和软件已准备就绪,所有源代码和设计文件都可以在我们的 GitHub 仓库 [1] 中找到。我们还准备通过 Crowd Supply [2] 发布它,您可以在那注册以便在产品可用时收到通知。</p> <p>主机软件在 Chrome 中本地运行,无需驱动程序、账户或云服务。Dr. PD 还支持通过 USBTMC 的 SCPI、Python 和 JavaScript 库、捕获导出以及外部示波器同步。我们提供了完整的文档 [3],包括用户指南、编程参考、交互式原理图和详细的硬件设计说明。</p> <p>欢迎随时提问!您也可以通过 hello@t76.org 联系我们。</p> <p>[1] <a href="https://github.com/T76-org/drpd" rel="nofollow">https://github.com/T76-org/drpd</a></p> <p>[2] <a href="https://www.crowdsupply.com/t76-org/dr-pd" rel="nofollow">https://www.crowdsupply.com/t76-org/dr-pd</a></p> <p>[3] <a href="https://t76.org/drpd/docs" rel="nofollow">https://t76.org/drpd/docs</a></p>