我在学习西班牙语课程时制作了这个应用程序,目的是寻找使用我正在学习的动词形式(现在时、过去时、将来时、虚拟式等)的文本。首先,我从网上抓取了大约10,000首西班牙语的公共领域诗歌。然后,我为550多个最常用的动词建立了一个变位词典,使用规则生成规则动词,并从网上抓取不规则动词。仅凭这些,你就可以识别出哪些诗歌包含你想要针对的动词类型。为了进一步分析,我在Python中使用了k-means聚类算法,将诗歌根据动词形式的频率分为四个难度等级(例如,包含大量虚拟式将来完成时动词的诗歌比仅有现在时的诗歌更难)。
我在2024年12月首次完成了这个项目,几乎完全是手动完成的,主要使用大型语言模型(LLMs)来制作一个交互式的Plotly Dash应用程序。(我在数据可视化方面有丰富的经验,尤其是使用ggplot2;这是我第一次使用LLMs在一个新领域进行创作。)上周,我与Claude合作,在一个小时内将前端完全更新为JavaScript和Plotly.js。
我希望有人能觉得这个工具有用。这可能是回答“哪位19世纪的哥伦比亚诗人使用了最多将来时动词?”这样问题的唯一方法(当然,这取决于可用的语料库)。
如果我今天从头开始做这个项目,我会使用LLMs来生成动词形式,而不是创建我之前制作的词典。但我仍然会保持对诗歌分析的确定性。我还会使用LLMs来评估主题和话题,作为额外的筛选条件。当然,我还会扩展到更多语言 :)
返回首页
最新
我一直在使用 DeepSeek v4 的闪存功能来进行引导代理工作流程(在 IDE 中,提示/审查差异),并发现使用 Haiku、Opus 和 Sonnet 在这个工作流程中并没有明显的好处。<p>每天花费大约一美元,我的生产力可以翻倍。前沿模型是什么?它们试图解决什么问题?<p>这些模型是为了单次应用而设计的吗?我们是否期望能够“随意”提示大型语言模型(LLM),让它们在无人监督的情况下完成工作?