Skip to content

Commit 39d7676

Browse files
authored
Merge pull request #1676 from hkad98/jkd/deps
build(deps): bump dev tooling + wire gooddata-eval into tox
2 parents bb355b3 + 10ea9f2 commit 39d7676

25 files changed

Lines changed: 177 additions & 175 deletions

packages/gooddata-eval/pyproject.toml

Lines changed: 1 addition & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -45,6 +45,7 @@ dev = [
4545
test = [
4646
"pytest~=8.3.4",
4747
"pytest-cov~=6.0.0",
48+
"pytest-json-report==1.5.0",
4849
"pytest-mock>=3.14.0",
4950
]
5051

packages/gooddata-eval/src/gooddata_eval/cli/agentic_runner.py

Lines changed: 9 additions & 12 deletions
Original file line numberDiff line numberDiff line change
@@ -6,7 +6,7 @@
66
import time
77
from typing import Any, TypedDict
88

9-
from gooddata_eval.core.agentic._langfuse import HttpxLangfuseClient, make_langfuse_client
9+
from gooddata_eval.core.agentic._langfuse import make_langfuse_client
1010
from gooddata_eval.core.agentic.alert_skill import evaluate_agentic_alert_skill
1111
from gooddata_eval.core.agentic.conversation import ConversationFixture, evaluate_agentic_conversation
1212
from gooddata_eval.core.agentic.general_question import evaluate_agentic_general_question
@@ -17,17 +17,14 @@
1717
from gooddata_eval.core.models import CreatedVisualization, DatasetItem
1818
from gooddata_eval.core.runner import EvalReport, ItemReport
1919

20-
_LfKw = TypedDict(
21-
"_LfKw",
22-
{
23-
"langfuse": Any,
24-
"dataset_item_id": str,
25-
"dataset_name": str,
26-
"run_timestamp": str,
27-
"model_version_override": str | None,
28-
},
29-
total=False,
30-
)
20+
21+
class _LfKw(TypedDict, total=False):
22+
langfuse: Any
23+
dataset_item_id: str
24+
dataset_name: str
25+
run_timestamp: str
26+
model_version_override: str | None
27+
3128

3229
AGENTIC_TEST_KINDS = frozenset(
3330
{

packages/gooddata-eval/src/gooddata_eval/cli/main.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -12,6 +12,7 @@
1212
from rich.console import Console
1313
from rich.table import Table
1414

15+
from gooddata_eval.cli.agentic_runner import AGENTIC_TEST_KINDS, run_agentic_items
1516
from gooddata_eval.core.chat.sse_client import ChatClient
1617
from gooddata_eval.core.config import RunConfig
1718
from gooddata_eval.core.connection import ConnectionError_, resolve_connection
@@ -20,7 +21,6 @@
2021
from gooddata_eval.core.models import ChatResult, DatasetItem
2122
from gooddata_eval.core.reporting.console import render_comparison, render_console
2223
from gooddata_eval.core.reporting.json_report import write_multi_model_report
23-
from gooddata_eval.cli.agentic_runner import AGENTIC_TEST_KINDS, run_agentic_items
2424
from gooddata_eval.core.runner import ItemReport, run_items
2525
from gooddata_eval.core.summary.http_client import SummaryClient
2626
from gooddata_eval.core.workspace import ModelResolutionError, WorkspaceModelController

packages/gooddata-eval/src/gooddata_eval/core/agentic/alert_skill.py

Lines changed: 4 additions & 4 deletions
Original file line numberDiff line numberDiff line change
@@ -7,12 +7,10 @@
77
import os
88
import re
99
from dataclasses import dataclass
10-
1110
from typing import Any
1211

13-
from gooddata_eval.core.chat.sse_client import ChatClient
1412
from gooddata_eval.core.agentic._catalog import CatalogMetricAlert
15-
13+
from gooddata_eval.core.chat.sse_client import ChatClient
1614
from gooddata_eval.core.models import ToolCallEvent
1715

1816
try:
@@ -438,7 +436,9 @@ def evaluate_agentic_alert_skill(
438436
model_version_override: str | None = None,
439437
) -> None:
440438
"""Run alert-skill evaluation, log to Langfuse, and raise AlertSkillAssertionError on failure."""
441-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
439+
from datetime import datetime as _dt # noqa: PLC0415
440+
from datetime import timezone as _tz # noqa: PLC0415
441+
442442
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
443443

444444
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/conversation.py

Lines changed: 3 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -386,7 +386,9 @@ def evaluate_agentic_conversation(
386386
model_version_override: str | None = None,
387387
) -> None:
388388
"""Run conversation evaluation, log to Langfuse, and raise on failure."""
389-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
389+
from datetime import datetime as _dt # noqa: PLC0415
390+
from datetime import timezone as _tz # noqa: PLC0415
391+
390392
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
391393

392394
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/general_question.py

Lines changed: 3 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -154,7 +154,9 @@ def evaluate_agentic_general_question(
154154
model_version_override: str | None = None,
155155
) -> None:
156156
"""Run general-question evaluation, log to Langfuse, and raise on failure."""
157-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
157+
from datetime import datetime as _dt # noqa: PLC0415
158+
from datetime import timezone as _tz # noqa: PLC0415
159+
158160
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
159161

160162
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/guardrail.py

Lines changed: 3 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -151,7 +151,9 @@ def evaluate_agentic_guardrail(
151151
model_version_override: str | None = None,
152152
) -> None:
153153
"""Run guardrail evaluation, log to Langfuse, and raise on failure."""
154-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
154+
from datetime import datetime as _dt # noqa: PLC0415
155+
from datetime import timezone as _tz # noqa: PLC0415
156+
155157
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
156158

157159
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/metric_skill.py

Lines changed: 4 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -3,11 +3,10 @@
33

44
from __future__ import annotations
55

6-
from typing import Any
7-
86
import os
97
import re
108
from dataclasses import dataclass
9+
from typing import Any
1110

1211
from gooddata_eval.core.chat.sse_client import ChatClient
1312
from gooddata_eval.core.models import ToolCallEvent
@@ -247,7 +246,9 @@ def evaluate_agentic_metric_skill(
247246
model_version_override: str | None = None,
248247
) -> None:
249248
"""Run metric-skill evaluation, log to Langfuse, and raise MetricSkillAssertionError on failure."""
250-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
249+
from datetime import datetime as _dt # noqa: PLC0415
250+
from datetime import timezone as _tz # noqa: PLC0415
251+
251252
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
252253

253254
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/search_tool.py

Lines changed: 3 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -145,7 +145,9 @@ def evaluate_agentic_search_tool(
145145
model_version_override: str | None = None,
146146
) -> None:
147147
"""Run search-tool evaluation, log to Langfuse, and raise SearchToolAssertionError on failure."""
148-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
148+
from datetime import datetime as _dt # noqa: PLC0415
149+
from datetime import timezone as _tz # noqa: PLC0415
150+
149151
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
150152

151153
if langfuse is None:

packages/gooddata-eval/src/gooddata_eval/core/agentic/visualization.py

Lines changed: 3 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -267,7 +267,9 @@ def evaluate_agentic_visualization(
267267
) -> None:
268268
"""Run visualization evaluation, log to Langfuse, and raise VisualizationAssertionError on failure."""
269269
import json as _json # noqa: PLC0415
270-
from datetime import datetime as _dt, timezone as _tz # noqa: PLC0415
270+
from datetime import datetime as _dt # noqa: PLC0415
271+
from datetime import timezone as _tz # noqa: PLC0415
272+
271273
from gooddata_eval.core.agentic._langfuse import try_make_langfuse_client # noqa: PLC0415
272274

273275
if langfuse is None:

0 commit comments

Comments
 (0)