返回首页
最新
大家好,我们是Parsewise的创始人Greg和Max。
Parsewise将一堆非结构化数据转化为符合模式的数据,同时保留跨文档解析值的来源信息。想象一下,把一堆文件交给Claude,并请求输出CSV或JSON格式。如果你尝试过这个,你会知道系统的限制(文件数量、输入类型、成本、延迟),同时也面临着无法快速验证结果的人为挑战。我们解决了这两个问题。
我们帮助技术团队简化非结构化数据的ETL流程,并邀请业务专家参与定义和即时验证。
这里有一段视频,展示了一些使用案例:<a href="https://www.youtube.com/watch?v=dbRllnnh47w" rel="nofollow">https://www.youtube.com/watch?v=dbRllnnh47w</a>
以下是使用Parsewise的用户的描述:
“我需要从保险政策PDF、转录的电话记录、电子邮件等中提取信息。我并不是在寻找一种仅仅逐点、逐页提取数据并放入结构化定义模式的工具,而是希望有一种更具智能的方式,能够理解信息可能分散在多个文档中,并能够推理出应该提取哪些内容。”
我们基于十年的复杂数据转化和数据分析/综合经验(以及痛苦)创办了这家公司。Greg曾在Palantir构建经典的ETL并实施AI工作流,而Max则在贝恩公司进行金融领域的高度复杂数据分析,这与我们的许多客户相似。
Parsewise的工作方式是接收一堆数据(想象一下数百或数千个PDF、Excel等),并输出符合模式的数据,其中每个值都可以追溯到多个文档中的字级引用。我们为API客户提供在其应用程序中展示数据来源的方法,或者他们可以使用我们的平台进行内部操作。
在数据处理的核心,我们有自我改进的代理定义。它们定义了可接受的数据来源、解析或组合值的逻辑,以及向最终用户突出不确定性的规则。
我们的底层技术是模型和云无关的,可以在私有网络中部署。我们在视觉推理方面使用Gemini模型取得了最佳效果,在我们找到的最强基础推理基准(Databricks OfficeQA)上实现了SOTA(超越Claude Fable)[将包含我们博客文章的链接]。
值得注意的是,我们更关注“人机协作”而非模型协作,专注于我们在采用过程中看到的实际摩擦,主要围绕可验证性。这意味着优化信任结果所需的时间和点击次数。
我们使用vLLMs进行解析,然后使用小型模型进行高效的大规模全面搜索。与RAG不同,我们不进行抽样;相反,我们会全面找到与特定查询相关的所有值。我们使用更大的模型进行决策,处理解析和向用户标记不一致性。
这种全面性和明确的值来源是我们平台的独特之处,超越了许多现有提供商所覆盖的数据解析第一步。
我们非常欢迎构建者和探索者在复杂文档挑战中尝试Parsewise。我们有很多想法可以扩展产品并改进,但也希望能得到社区的反馈和建议!
我已经运营Yogile多年,因为我厌倦了分享照片相册,结果家里一半的人从来没有成功登录。
使用Yogile,任何人都可以打开相册,上传照片或视频,并直接通过链接查看所有内容。即使是奶奶通常也能搞定。
人们似乎喜欢的几点包括:
- 查看或上传照片无需注册账户。
- 低廉的年度订阅提供无限照片存储。
- 完全在欧盟内托管和运营。
- 原始文件会被保留,并可以以全质量下载。
大多数人用它来制作家庭相册、婚礼、体育俱乐部、摄影师以及其他私人团体的相册。
我非常希望能获得反馈,特别是来自那些在使用Google Photos、Apple Photos或Dropbox分享照片时感到沮丧的用户。