返回首页
最新
大家好,
在过去一个月里,我一直在开发一个视觉AI编排工具,允许用户创建类似于软件开发生命周期(SDLC)的流程。基本上,你只需启动Wazear,创建一个项目并添加你的简要说明。然后选择代理(每个代理承担不同的角色,如规划者、架构师等),并设置哪些代理审查其他代理的工作,之后让它们进行工作。在任何时候,你都可以暂停流程以便自己审查输出。
你可以在这里查看: [https://wazear.space](https://wazear.space)。欢迎任何反馈。
非常感谢。
最好的祝福。
一个完全本地化的检索增强生成(RAG)实现,用于查询25年的瑞士电视频道新闻(约50万篇德语文章)——基于Deepmind最新的Gemma模型。<p>为什么?我认为这是一个很酷的数据集类型(短小/高密度的新闻摘要),可以用来测试一些本地RAG方法。Gemma 4给出了令人印象深刻的结果,但可能在系统提示上还需要进一步调整。
如果这个地方能够发展成更现代的样子,那该多好啊!
在一次朋友聚会上,有人提到想把她已故的父亲加入到家庭照片中。我认为这应该很简单——现代图像模型非常强大,只需发送两张照片,请求AI将它们合并。她说她试过,但结果奇怪且不稳定,她不知道该如何描述自己想要的效果。
我回家后自己尝试了一下。通过一个写得很好的提示和两张好的照片,确实可以实现。但现实中的使用场景并不是两张好的照片——而是现代家庭照片加上一张损坏的旧肖像,或者是来自不同年代的两张旧照片。这时候问题就出现了。
我查看了现有的工具。大多数工具展示的是干净、光线良好的现代照片之间的合并。没有人解决更复杂的版本:不匹配的时代、损坏的来源、不同的姿势、不同的正式程度。
我原以为这会是一个周末项目——一个系统提示就可以完成。经过200多次测试迭代,我意识到要获得稳定的结果需要远远超过提示工程。主要挑战包括:
AI在合并过程中会微妙地改变面孔。结果看起来“相似”,但并不是同一个人。对于想要添加已故亲人的人来说,这完全是失败。
姿势和比例需要匹配。如果一群人坐在草地上,而添加的人像个巨人一样站着,那显然是假的。
参考照片中的随意配饰会破坏正式场合的场景——婚礼上头戴太阳镜,典礼上穿运动服。
旧照片的分辨率低,损坏且没有颜色。与此同时进行合并、修复和上色使一切变得更加困难。
它支持头像、半身和全身的参考照片。旧的和损坏的照片也可以使用——可以选择上色和修复。
仍然是一个最小可行产品(MVP)。每天可以免费使用一次,无需登录。
我很想听听那些会导致它失效的边缘案例。
在三星Galaxy Watch 4 Classic(armeabi-v7a,Mali G68)上运行llama.cpp时,我注意到Vulkan后端拒绝了每一个量化的MUL_MAT操作,尽管报告显示“33/33层已转移到GPU”。<p>根本原因:在llama-model-loader.cpp中的create_tensor()函数内,张量步幅计算中缺少块大小的除法。错误的步幅导致ggml_nbytes()溢出,在32位系统上超出了max_buffer_size,因为size_t是32位的。<p>在64位设备上,溢出被静默掩盖——虽然值错误,但仍在GPU内存限制之内,因此没有人注意到。这个bug可能已经存在多年。<p>修复和相关信息: https://github.com/Perinban/llama.cpp/tree/axon-dev