我开始思考为什么火花不支持语音模型。目前有很多优秀的开源模型可用,比如parakeet、kokoro、Qwen ASR等,但如果不自己管理一堆GPU,就无法使用它们。
即使是像Gemma 4这样的LLM(大型语言模型),在语音代理中也不被支持。
然后我意识到,推理平台需要根据你所使用的用例进行不同的优化。以LLM为例,而不仅仅是语音转文本(STT)和文本转语音(TTS):
- 编码代理 -> 需要大量缓存输入,需要针对KV缓存进行优化
- 创建幻灯片/博客 -> 输出量大,需要针对推测解码进行优化
- 语音LLM -> 缓存输入小,输出少,目前还没有找到优化的方法。
因此,TTS和STT是完全不同的领域。
我不知道的是时间问题,大家现在是否真的想使用像kokoro、parakeet、Qwen等开源模型?
返回首页
一周热榜
有一段时间,像 Kiro、OpenSpec/SpecKit、Tessl 这样的 SDD 工具似乎将成为编码代理的未来。至少在我看来,这似乎是个好主意,它解决了很多人对编码代理随意发挥而产生的问题。然而,如今看来,所有的 SDD 工具似乎都已经失去了热度,但人们的抱怨依然存在——编码代理仍然经常编写不符合用户要求的代码。难道我们大家都共同决定了“/plan 模式”就足够了吗?
标题:展示 HN:我们构建了一个开放的 USB-C 电力传输分析仪和可编程负载
<p>大家好!我们是 Arbi、Marco 和 Rob,我们开发了 Dr. PD,旨在让 USB-C 电力问题更易于理解。它位于电源和设备之间,捕获并解码它们的 USB-PD 协商,并将其与电压和电流测量相关联。它还可以作为一个可编程负载,支持固定电源、PPS、AVS 和高达 240 W 的 USB-PD 3.2 EPR。</p>
<p>商业 USB-PD 分析仪的价格通常超出业余爱好者和独立设计师的承受范围。我们的使命是让高质量的测试设备变得更易获取。Dr. PD 的硬件、固件、软件、库和文档都是开源的。</p>
<p>硬件和软件已准备就绪,所有源代码和设计文件都可以在我们的 GitHub 仓库 [1] 中找到。我们还准备通过 Crowd Supply [2] 发布它,您可以在那注册以便在产品可用时收到通知。</p>
<p>主机软件在 Chrome 中本地运行,无需驱动程序、账户或云服务。Dr. PD 还支持通过 USBTMC 的 SCPI、Python 和 JavaScript 库、捕获导出以及外部示波器同步。我们提供了完整的文档 [3],包括用户指南、编程参考、交互式原理图和详细的硬件设计说明。</p>
<p>欢迎随时提问!您也可以通过 hello@t76.org 联系我们。</p>
<p>[1] <a href="https://github.com/T76-org/drpd" rel="nofollow">https://github.com/T76-org/drpd</a></p>
<p>[2] <a href="https://www.crowdsupply.com/t76-org/dr-pd" rel="nofollow">https://www.crowdsupply.com/t76-org/dr-pd</a></p>
<p>[3] <a href="https://t76.org/drpd/docs" rel="nofollow">https://t76.org/drpd/docs</a></p>
我们是否已经到了一个阶段,大多数进展以新的集成或应用的形式出现,而不是更好的模型?我们还能从中挤出多少生产力?