霍格沃茨社交平台目前正在为哈利·波特的粉丝开发;如果没有意外问题,Apex团队计划在8月26日左右推出该应用,并已开始在Google Play商店进行准备。哈利·波特的粉丝们,准备好吧。
返回首页
最新
我认为编码基准测试的结果并不能代表我们混乱的现实。因为它们:
1) 使用专门构建的测试框架,我们使用Claude Code或Codex。
2) 测试一次性任务,而我们是以会话的方式工作。
会话是混乱的,我们通常从一个大型的主要任务开始,然后进行一些清理,修复一些相关的问题,可能在这里做一点,在那里做一点。我们开始、停止,并且改变主意。
这会影响成本和质量。缓存的生存时间(TTL)会过期,背景信息会不断增加。
我正在着手创建一个。以下是我的初步计划:
1) 使用Claude Code和Codex。
2) 使用会话形状的工作负载。将多个经过软件工程(SWE)基准验证的任务拼接成一个大型会话。
2.a) 使用来自同一代码库的任务,以确保主题的连贯性。
3) 主要指标:成本与质量。
3.a) 次要指标:转化次数、完成时间。
待解答的问题:
a) 这个问题有意义吗?
b) 我的基准规范合理吗?
c) 从一个难度较大的任务开始的10个经过软件工程基准验证的任务是合适的工作负载形状吗?
刚刚看到Cloudflare的缓存公告,我重新调整了我的数据库以利用这个更新,因此现在可以免费提供这个服务。您可以搜索任何关键词,以获取其在Google上的每月搜索量以及相关关键词。这对于在构建产品类别之前评估需求非常有用。
我目前正在考虑如何保护系统内部的探索活动。比如确保探索预算能够得到保持。大家有没有好的解决方案呢?