5作者: craigsmitham大约 1 个月前原帖
大家好,我创建了QUALITY.md,以帮助构建一个全面的质量评估流程,适用于我的项目。结果发现,这也非常适合循环工程。我希望这能为关于质量和工艺的讨论提供有价值的贡献,并借助人工智能来帮助我们实现这一目标。我希望能够将思维方式从被动的审查/修复转变为主动的关怀。 请试试看。我期待着你们的想法、评论和反馈! 网站: [https://getquality.md](https://getquality.md) GitHub: [https://github.com/qualitymd/quality.md](https://github.com/qualitymd/quality.md)
1作者: mrich大约 1 个月前原帖
2作者: luca-ctx大约 1 个月前原帖
编码代理没有长期记忆。 但您在机器上存储了数月的完整代理记录。 一个简单而有效的解决方案是:将这些记录和日志导入到结构化的SQLite数据库中,然后通过排名文本匹配进行搜索。一切都是完全本地的,不需要像图数据库或托管内存服务那样复杂的东西。 这就是ctx的理念,一个处理数据导入和搜索的Rust命令行工具。 我们给代理赋予一种技能,让它们在某个领域工作之前参考过去的会话。通常,我们通过一个“代理历史研究子代理”来实现,这个子代理的任务是在任务开始之前准备一份简短的涵盖相关历史的简报。 一个真实的例子是:有时我们的测试套件运行会失败,因为运行器的磁盘已满。正确的做法是运行清理手册,但失败的根本原因对代理来说并不明确,因此它们会认为这是测试回归,并进入错误的调试方向。当代理搜索历史时,它意识到这个失败之前曾经遇到过,并立即找到了正确的解决方法。这使得代理走上了正确的清理路径,后来我们改进了日志输出,以便下次同样的失败能更加清晰。这是一个无聊的故事,但却是真实的代理生产力。 另一个不错的用例是快速生成会话记录以便分享。您可以排除嘈杂的中间消息,使得记录更清晰地显示会话的重要部分。试着将会话记录附加到您下一个PR中,以便您的团队成员和他们的代理可以审查变更的来源和提示。 如果您想挑战一下,可以让您的代理“全面审查此仓库中的所有代理历史,找出SDLC存在问题或不符合代理原生的地方”。利用过去的会话递归改进代理驱动的SDLC是我们今天经常使用的一个循环。 如果您尝试了,请告诉我们您的想法!
10作者: rot256大约 1 个月前原帖
零知识证明(ZKP)允许一个不可信的证明者在不向验证者透露输入的情况下,展示计算的正确执行。然而,要证明任何事情,计算首先必须以电路的形式表达:即在有限域上的多项式方程(约束)系统。电路是零知识证明的汇编语言,每个约束都会消耗证明者(有时也包括验证者)的时间,因此生产电路通常会经过严格的手动优化。 在过去几个月中,我们尝试编写正式规范,并让大型语言模型(LLM)生成电路:只要它们能够证明其实现是正确的。我们从SHA-256开始:我们手动在Lean中编写了SHA-256压缩的规范,然后要求LLM编写电路,目标是R1CS算术化和大域。 这项工作花费了Opus 4.7几个小时,并进行了适当的引导,但最终模型提出了一个合理的实现。接着,我们要求LLM积极优化电路,通过降低电路的成本指标(约束数量)。我们立即得到了非常有前景的结果,仅仅通过要求提出优化想法、实现它们并证明新电路仍然满足健全性和完整性。有时,它提出了一些不健全的优化,但由于无法证明这些优化,它会回溯并重新回到正确的方法上。 最终的结果是一个(非确定性)电路,其性能超过了当前人类优化的SHA256压缩的最先进水平。这次经历促使我们创建了“zk.golf”,这是一个开放的竞赛,旨在生成优化的、经过正式验证的电路,以降低使用零知识证明的门槛,并提高其应用效率。 欢迎参与(<a href="https:&#x2F;&#x2F;zk.golf&#x2F;llms.txt" rel="nofollow">https:&#x2F;&#x2F;zk.golf&#x2F;llms.txt</a>)并了解正式验证。
30作者: pzullo大约 1 个月前原帖
嗨,HN,我们是Pietro和Luigi,Manufact的联合创始人(<a href="https://manufact.com">https://manufact.com</a>),这是一个为MCP应用和服务器提供云服务的平台。我们之前叫做mcp-use,仍然在这个名字下为MCP构建开源SDK:<a href="https://github.com/mcp-use/mcp-use" rel="nofollow">https://github.com/mcp-use/mcp-use</a>。去年我们做过一个Show HN:<a href="https://news.ycombinator.com/item?id=44747229">https://news.ycombinator.com/item?id=44747229</a>。 今天我们想告诉你们我们的云产品Manufact,它与mcp-use的关系就像Vercel与Next.js的关系。Manufact是一个为开发团队设计的MCP垂直云,旨在将MCP应用和服务器投入生产。你可以发布、迭代、测试和监控你的MCP,并为商店提交做好准备。所有这些都以最佳的开发者和代理体验为出发点。 这是产品的演示视频:<a href="https://www.youtube.com/watch?v=R2rbr5OT9LI" rel="nofollow">https://www.youtube.com/watch?v=R2rbr5OT9LI</a>。 我们自2025年4月以来一直在致力于MCP。我们的首要任务是简化构建能够使用任何MCP服务器的代理,很多人开始使用我们的SDK。随后,代理框架的革命开始了:Claude Code、Claude Cowork、ChatGPT、Codex、OpenCode开始发布代理框架,使大多数独立的代理框架变得多余。这促使我们转向连接的另一端——服务器。如果代理将会整合为几个框架,那么与公司其他系统(即MCP)的优先集成将变得至关重要,因此我们开始构建我们的服务器SDK。 接下来依次发生了: 1. 2025年10月。ChatGPT应用SDK。OpenAI将应用UI引入ChatGPT,基于MCP和mcp-ui的工作。 2. 2025年末。商店开放。ChatGPT开始接受应用提交,Claude与选定的合作伙伴扩展其连接器目录。 3. 2026年1月。MCP应用正式成为官方。SEP-1865合并为第一个MCP扩展(io.modelcontextprotocol/ui):一个任何主机都可以渲染的UI标准。 如今,所有主要客户端都完全支持MCP,并正在开放经过审核的MCP市场,用户可以一键安装。所有主要科技公司都有MCP服务器,许多公司报告称,已有超过15%的使用量来自他们的MCP,而我们现在开始有了良好的分发方式。 MCP可以返回完全互动的用户界面。因此,公司可以(1)以更有意义的方式向用户展示数据(例如,分析、电子商务),以及(2)在一些全球使用最广泛的产品(如ChatGPT、Claude等)中展示他们的品牌。数据方面:Amplitude的一位工程师报告称,他们的MCP在添加UI后,保留率提高了2倍。 客户端(Claude、ChatGPT、Cursor)开始根据用户的意图动态呈现MCP服务器/应用。产品将在聊天中自然被发现! 我们感觉MCP正达到成熟的时刻。现在,MCP开始变得易于安装和发现,用户使用它们和公司创建它们的动力将会巨大: 1 - 大多数工作已经通过AI聊天完成,这种趋势不会停止,MCP为你提供了一种无需手动使用仪表板即可与产品互动的方式。 2 - MCP允许你将上下文集中到一个地方:你可以在连接到产品的源代码或知识库时,阅读电子邮件、创建工单。之前无法实现的产品聚合将在聊天中发生,由日益智能的模型进行协调。 如果AI应用(Codex、Claude Desktop)是新的浏览器,正如PG在最近的一条推文中所说的那样(<a href="https://x.com/paulg/status/2069080429236191504" rel="nofollow">https://x.com/paulg/status/2069080429236191504</a>),那么MCP就是新的网站。 但这里有一个问题: - 商店的提交过程仍然相当复杂,手动操作且耗时。 - 几乎没有人知道如何设计一个好的MCP:大多数MCP只是API的1:1代理,且在几个月后就被遗弃。 - MCP规范发展迅速,跟踪变化及其对你服务器的影响并不容易。 - 对于大多数团队来说,身份验证仍然是一个谜(API密钥在URL中???)。 - 大多数公司甚至不知道MCP可以返回互动UI。 - 客户端仍需整合行为,有些进行动态工具发现,有些则不,有些正确持久化身份验证,有些则不。 我们构建了Manufact和mcp-use来解决这些问题。我们的SDK帮助他们构建良好的MCP,我们的检查工具帮助他们进行本地测试,而我们的云服务则帮助他们在生产环境中发布和监控。 在Manufact上部署只需连接一个Github应用,选择代码库,我们会检测你正在使用的框架,并尽快为你提供一个实时的MCP URL。 在我们的平台上,该实时URL将用于为你提供一个聊天界面,你可以立即尝试/调试你的MCP并与团队分享。如果你在新的实验分支上推送更新,你也可以通过预览部署进行测试。 一旦你的服务器准备好上线,我们将帮助你确保它不会出现故障。你可以配置自动化测试,将你的MCP服务器安装到ChatGPT和Claude中进行测试。我们不测试模型,而是测试客户端(模型+框架)。这样你就可以可靠地知道你的服务器在用户使用时是否出现故障。 由于在商店发布是公司一个重要的分发解锁(你的MCP可以在Claude产品和ChatGPT中被动态发现并一键安装),我们收集了一系列要求,以防止你的提交被拒绝。你可以在实际审核过程之前在本地检查这些要求。 一旦你的服务器上线,你会想要了解它的使用情况。我们的分析工具专为MCP设计,因此你将知道有多少用户访问你的MCP,接收了多少工具调用,以及来自哪个客户端。 你今天可以免费试用<a href="https://manufact.com">https://manufact.com</a>。我们采用基于使用量的定价,在我们的免费账户中提供免费积分供你试用。如果你已经有一个MCP,只需连接你的Github代码库并进行部署;如果没有,你可以使用我们的技能和SDK轻松构建一个(我们将在入职过程中指导你)。 我们期待在评论中听到大家对产品的反馈,以及对MCP的看法。谢谢! :)