feat(examples): add evaluation-optimization closed-loop example with report and gate - #255
feat(examples): add evaluation-optimization closed-loop example with report and gate#255AsyncKurisu wants to merge 2 commits into
Conversation
Codecov Report✅ All modified and coverable lines are covered by tests. Additional details and impacted files@@ Coverage Diff @@
## main #255 +/- ##
==========================================
Coverage ? 88.56991%
==========================================
Files ? 491
Lines ? 46885
Branches ? 0
==========================================
Hits ? 41526
Misses ? 5359
Partials ? 0 ☔ View full report in Codecov by Harness. 🚀 New features to boost your workflow:
|
AI Code Review已确认。这些测试断言(overall=5, train candidate failed=0, overall_change_type="mixed", new_pass=2, critical_regression=1)与已提交报告中的值(overall=6, train candidate failed=1, "unchanged", new_pass=0, critical_regression=0)存在冲突。由于测试在执行时会重新运行流水线并重新生成报告,因此它们会通过(我的逻辑推导结果与测试一致)——但这意味着仓库中已提交的 注意:我无法在此沙箱环境中执行测试套件进行验证,但逻辑推导结果是决定性的:模拟候选路径添加了 让我写出审查意见。 发现的问题🚨 Critical
|
AI Code Review很好,SDK 会展开 注意:如果设置了 现在我已经掌握了足够的信息来定稿。我的结论是:没有 Critical 问题,有几个小的 Warning/Suggestion。鉴于指示要求避免低价值的建议且限制 Suggestion 的数量,我将只报告真正有维护价值的问题。 让我重新考虑 regex 问题是否符合条件。在 再重新考虑一下: 让我再重新考虑一下是否存在真正的资源/超时问题 —— real 模式按顺序运行用例且没有超时设置,依赖 SDK 自身的超时机制。对于示例来说是可以接受的。 我将定稿并附上这些发现。让我再快速验证一下一个可能确实重要的正确性细节: 现在我来写最终审查报告。我会保持简洁。我指出的问题都很轻微;我应该诚实评估是否需要将其提高到 Warning 级别。我将其报告为两个 Warning 级别的问题(它们都是真实的,但不会阻塞合并)。 实际上,让我重新考虑一下 pass-rate 规则是否真的会产生错误行为。当 我将提出 regex 问题作为主要可操作项,pass-rate 不一致作为一个次要问题。我不需要 Suggestion,因为它们价值很低。让我写下来。基于对 发现的问题
|
|
Closing as related to #92. |
|
@raychen911 |
AI Code Review好的。现在让我重新考虑一个真正的潜在问题:在 让我确认一下本示例中是否没有配置 现在,关于严重程度,让我重新考虑一下 让我对总结进行最后定稿。实际上,鉴于我有严格的要求,只报告可验证的问题,且真正的正确性 bug 很少,让我再重新审视一下
ratio_ok = cost_ratio is None or cost_ratio <= self.config.max_cost_ratio如果 现在让我重新考虑 鉴于代码质量相当高且测试覆盖良好,且我找不到 Critical 级别的 bug,让我做最终定稿。我需要诚实 —— 并没有明显的阻塞问题。让我报告我确信的内容,避免编造问题。 让我重新考虑测试可发现性(test-discoverability)问题,判断它是否为真正的 Warning 级别问题。根目录的 再检查一件事 —— 让我重新考虑是否真的存在任何 Critical 问题。鉴于检查结果,我会诚实地说明没有阻塞性问题,并给出 1 个真正的 Warning(通过率规则的不对称性),或许再加上 1 个关于代码重复的建议。 实际上,通过率规则的不对称性确实是一个真正的行为不一致,值得标记。让我确认一下: 让我确认一下默认配置和 committed gate.json 中的 让我写出最终结论。Based on my review of the 发现的问题
|
Overview
Resolves #91
This PR adds a complete example-only evaluation and optimization loop under
examples/optimization/eval_optimize_loop/. The pipeline runs baseline evaluation, failure attribution, prompt optimization, candidate validation, delta analysis, and gate decisioning, then writes both a machine-readable JSON report and a human-readable Markdown report.Key Changes
How to Run
Fake mode
cd examples/optimization/eval_optimize_loop python run_pipeline.py --mode fake pytest examples/optimization/eval_optimize_loop/tests -qReal mode