@@ -1272,7 +1272,7 @@ async def fake_resolve_media_ref_to_base64_data(
12721272
12731273
12741274@pytest .mark .asyncio
1275- async def test_apply_provider_specific_extra_body_overrides_disables_ollama_thinking ():
1275+ async def test_apply_provider_specific_request_overrides_disables_ollama_thinking ():
12761276 provider = _make_provider (
12771277 {
12781278 "provider" : "ollama" ,
@@ -1287,7 +1287,7 @@ async def test_apply_provider_specific_extra_body_overrides_disables_ollama_thin
12871287 "temperature" : 0.2 ,
12881288 }
12891289
1290- provider ._apply_provider_specific_extra_body_overrides ( extra_body )
1290+ provider ._apply_provider_specific_request_overrides ({}, extra_body )
12911291
12921292 assert extra_body ["reasoning_effort" ] == "none"
12931293 assert "reasoning" not in extra_body
@@ -1297,6 +1297,69 @@ async def test_apply_provider_specific_extra_body_overrides_disables_ollama_thin
12971297 await provider .terminate ()
12981298
12991299
1300+ @pytest .mark .asyncio
1301+ async def test_provider_specific_request_overrides_sets_minimax_m3_max_tokens ():
1302+ provider = _make_provider ({"provider" : "nvidia" })
1303+ try :
1304+ payloads = {"model" : "minimaxai/minimax-m3" }
1305+ extra_body = {"temperature" : 0.2 }
1306+
1307+ provider ._apply_provider_specific_request_overrides (payloads , extra_body )
1308+
1309+ assert payloads ["max_tokens" ] == 8192
1310+ assert extra_body == {"temperature" : 0.2 }
1311+ finally :
1312+ await provider .terminate ()
1313+
1314+
1315+ @pytest .mark .asyncio
1316+ async def test_minimax_m3_max_tokens_preserves_custom_extra_body_value ():
1317+ provider = _make_provider ({"provider" : "nvidia" })
1318+ try :
1319+ payloads = {"model" : "minimaxai/minimax-m3" }
1320+ extra_body = {"max_tokens" : 4096 }
1321+
1322+ provider ._apply_provider_specific_request_overrides (payloads , extra_body )
1323+
1324+ assert "max_tokens" not in payloads
1325+ assert extra_body ["max_tokens" ] == 4096
1326+ finally :
1327+ await provider .terminate ()
1328+
1329+
1330+ @pytest .mark .asyncio
1331+ async def test_minimax_m3_max_tokens_preserves_standard_payload_value ():
1332+ provider = _make_provider ({"provider" : "nvidia" })
1333+ try :
1334+ payloads = {
1335+ "model" : "minimaxai/minimax-m3" ,
1336+ "max_tokens" : 2048 ,
1337+ }
1338+ extra_body = {}
1339+
1340+ provider ._apply_provider_specific_request_overrides (payloads , extra_body )
1341+
1342+ assert payloads ["max_tokens" ] == 2048
1343+ assert extra_body == {}
1344+ finally :
1345+ await provider .terminate ()
1346+
1347+
1348+ @pytest .mark .asyncio
1349+ async def test_nvidia_request_does_not_set_max_tokens_for_other_models ():
1350+ provider = _make_provider ({"provider" : "nvidia" })
1351+ try :
1352+ payloads = {"model" : "nvidia/usdcode" }
1353+ extra_body = {}
1354+
1355+ provider ._apply_provider_specific_request_overrides (payloads , extra_body )
1356+
1357+ assert "max_tokens" not in payloads
1358+ assert "max_tokens" not in extra_body
1359+ finally :
1360+ await provider .terminate ()
1361+
1362+
13001363@pytest .mark .asyncio
13011364async def test_query_injects_reasoning_effort_none_for_ollama (monkeypatch ):
13021365 provider = _make_provider (
0 commit comments