1作者: skye0110大约 1 个月前原帖
你好,我是作者,Screenmind 是一个以隐私为首要考虑的 Microsoft Recall 替代品。它运行在 Gemma 4 上,这是少数支持视觉、音频和推理三者的模型之一,因此你的数据永远不会离开你的设备。 使用 Screenmind,你可以跟踪你的时间线,记录你在每项任务上花费了多少时间,搜索任何带有文本的截图。最酷的功能是,你可以与屏幕历史进行对话,比如询问“Alex 在 Discord 上给我发了什么消息?”或者“我是否收到了来自 Microsoft 的邮件?”如果这些信息曾出现在你的屏幕上,你可以在聊天中提取出来。此外,你还可以在此基础上创建自动化任务,比如“在 Slack 上给我发送整天的报告”(它支持集成)。你可以用简单的英语编写自动化任务,适合非程序员,或者使用 Python 供想深入研究的开发者使用。你还可以通过快捷键保存语音备忘录(附带截图),并自动转录和总结会议内容(自动检测会议)。 我遇到的最大挑战是将 Screenmind 作为后台服务持续运行,如果没有聊天功能,这并不会太困难,因为运行本地模型需要计算资源,而持续分析截图会占用大量资源。为此,我设计了一个感知缓存系统,这个三级缓存系统可以将平均用户的推理时间减少多达 40%(我就是其中之一)。为了进一步减少推理时间,我设计了三种模式:快速、平衡和准确,用户可以在时间和准确性之间进行权衡。 目前我在我的 4GB GTX 1650 显卡上每天使用它,使用快速模式运行得相当不错,在高端机器上会更快。它还配备了 MCP 服务器,因此你可以直接询问 Claude Desktop/Cursor 关于你早上看到的错误。 支持 Windows/Mac/Linux。 坦诚地说,它在 Mac 上的测试并不广泛,安装过程也有些摩擦,我正在开发一键安装程序来解决这个问题。 (重发 - 我几个月前发布了一个早期版本,评论因新账户被标记,所以无法回复。) 代码库:github.com/ayushh0110/ScreenMind 对如何实现多显示器支持有任何想法的人请分享一下。
1作者: nkersting大约 1 个月前原帖
作为一名曾经的教授,现在转型为行业顾问和频繁的行业演讲者,我对PowerPoint感到厌倦:线性的幻灯片顺序在现场问答环节中难以导航,无法一次性向观众展示整体情况,也不便于协作……我意识到,这些问题都可以通过转向基于树形结构的二维-三维格式来解决,这种格式基于一个包含所有节点结构、文本和多媒体链接的源JSON文件。我几个月前开发了这个格式,并在INFORMS的一个在线研讨会上进行了演示(<a href="https://www.youtube.com/watch?v=vXN2xu4z5qA" rel="nofollow">https://www.youtube.com/watch?v=vXN2xu4z5qA</a>)。现在,我已经将其与人工智能相结合(你可以实时生成完整的演示文稿或从给定的分支扩展),非常希望社区能够试用它。