返回首页
最新
我正在为零售投资组合开发一个经纪人导入管道,但我低估了实际导出数据的复杂性。<p>我遇到的问题包括:
- 同一经纪人的CSV、JSON和PDF导出格式
- 欧盟/美国数字格式的差异
- 日期优先与月份优先的歧义
- ISIN/代码/名称不匹配
- 重复行和部分头寸
- 错误解析导致成本基础的静默损坏<p>我目前的做法是优先考虑确定性:
1. 本地解析结构化导出数据
2. 仅在解析失败时使用大型语言模型(LLM)作为备选
3. 规范化符号并拒绝无效行
4. 在持久化之前要求人工审核
5. 保守地应用导入,以避免成本基础漂移<p>我正在努力清晰思考这个系统应该强制执行的不可变性。<p>对于那些在金融导入、会计系统或安全关键数据管道方面有经验的人:
- 您绝对会强制执行哪些不可变性?
- 您会在哪里划定确定性逻辑与LLM提取之间的界限?
- 您会记录哪些内容以便重放/调试/审计?<p>如果有用,我很乐意分享实施细节。
我们持续将数据传输到云端进行分析,但现代的Mac电脑拥有足够的性能,可以在毫秒级别内本地查询数百万行数据。即使是8GB的MacBook Neo也能做到。
我开发ColumnLens是因为我希望停止将敏感数据上传到SaaS工具,仅仅为了执行一个GROUP BY操作。它是一款本地C++桌面应用,能够在大约3秒内打开超过5GB的CSV、JSONL、Parquet和Excel文件,然后让你使用DuckDB的完整SQL引擎进行查询——包括JOIN、CTE、窗口函数,所有操作都在你的机器上进行。
这个想法很简单:你的笔记本电脑完全可以作为一个优秀的分析工作站。你不应该需要一个云管道来查看你的数据。
在开发过程中我学到的一些事情:
- DuckDB的列式引擎效率极高。处理1200万行数据,查询时间在一秒以内,内存使用不到1GB,且硬件可以放进背包里。
- ImGui + OpenGL是数据密集型桌面应用的绝佳组合。没有DOM,没有布局引擎的开销——只有原始的GPU渲染。数据网格可以滚动1200万行而没有任何帧丢失。
- 我添加了一个“3D城市视图”,将行数据映射到建筑物(高度=一列,颜色=另一列)。听起来像是噱头,但异常值和聚类在这种视图中立刻显现出来,而在表格或图表中则不易察觉。我们的脑子擅长在天际线中识别高楼。
- Lua脚本的实用性超出了预期。人们编写小脚本从API获取数据、运行查询和配置图表——在应用内进行可重复的分析。
- 一切都在本地运行。零遥测,零网络调用。二进制文件大小为33MB,静态链接。
可以在<a href="https://columnlens.com" rel="nofollow">https://columnlens.com</a>免费下载。
我很想听听其他正在开发本地优先数据工具的人的想法——我认为“将一切都上传到云端”的时代正在开始回归。
其他所有知名的模型提供商都在持续推出新产品;xAI发生了什么?他们的模型从来不是最好的,但现在却被彻底甩在了后面。<p>这里有人在积极使用Grok模型吗?<p>SpaceX的合并刚刚发生,这是否是他们在过去五个月没有发布任何新产品的原因之一?
<a href="https://www.ft.com/content/7cab4ec7-4712-4137-b602-119a44f771de" rel="nofollow">https://www.ft.com/content/7cab4ec7-4712-4137-b602-119a44f77...</a> (<a href="https://archive.ph/wXvF3" rel="nofollow">https://archive.ph/wXvF3</a>)<p><a href="https://twitter.com/lukolejnik/status/2031257644724342957" rel="nofollow">https://twitter.com/lukolejnik/status/2031257644724342957</a> (<a href="https://xcancel.com/lukolejnik/status/2031257644724342957" rel="nofollow">https://xcancel.com/lukolejnik/status/2031257644724342957</a>)
我对照片分享网站感到很沮丧。苹果的iCloud共享相册加载需要20秒以上,而其他网站则充满了广告、繁琐的用户界面或社交媒体的干扰。我只想快速、移动友好且无干扰地与朋友和家人分享照片。
于是我构建了DD Photos。你可以将照片从你已经使用的任何工具(如Lightroom、Apple Photos等)导出到文件夹中,然后运行`photogen`(一个Go命令行工具)将它们调整为WebP格式并生成JSON索引,最后将SvelteKit静态网站部署到任何可以提供文件的地方,比如Apache、S3等。没有服务器端代码,也没有数据库。
这个项目花了几周时间完成,期间我大量使用了Claude Code,我发现它在这个涉及Go、SvelteKit/TypeScript、Apache配置、Docker和Playwright测试的全栈项目中非常有用。也很乐意讨论这段经历。
在线示例: [https://photos.donohoe.info](https://photos.donohoe.info)
代码库: [https://github.com/dougdonohoe/ddphotos](https://github.com/dougdonohoe/ddphotos)
嗨,HN,
我想分享一下我过去几个月一直在做的项目:一个用于嵌入式Linux系统的固件分析器,它可以帮助发现安全问题,并且完全在浏览器中运行。
这是一个非常早期的Alpha版本,可能会有些粗糙。但我认为它已经提供了相当大的价值。
所以请随意上传一个固件(目前只支持.tar格式的rootfs归档),试着找出其中的问题吧 :)