AI Agent commited on
Commit
91dae80
Β·
1 Parent(s): 60d6a5a

Update expert mode LLM to mistral-medium-3.5-128b with reasoning effort

Browse files
Files changed (1) hide show
  1. agents/nvidia_llm.py +7 -3
agents/nvidia_llm.py CHANGED
@@ -29,7 +29,7 @@ _QUEUE_MAX_SIZE = int(os.getenv("NVIDIA_QUEUE_MAX", "8"))
29
  _REQUEST_TIMEOUT_S = int(os.getenv("NVIDIA_LLM_TIMEOUT", "600"))
30
 
31
  # DEFAULT_MODEL = "google/diffusiongemma-26b-a4b-it"
32
- DEFAULT_MODEL = "sarvamai/sarvam-m"
33
 
34
  # ── Flask app ─────────────────────────────────────────────────────────────────
35
  app = Flask(__name__)
@@ -61,12 +61,14 @@ def _run_inference(data: dict) -> dict:
61
  chat_template_kwargs = None
62
  temperature = float(data.get("temperature", 1.0))
63
  top_p = float(data.get("top_p", 0.95))
 
64
  else:
65
  model_name = data.get("model", DEFAULT_MODEL)
66
  max_tokens = int(data.get("max_tokens", 16384))
67
  chat_template_kwargs = None
68
- temperature = float(data.get("temperature", 0.5))
69
- top_p = float(data.get("top_p", 1.0))
 
70
 
71
  invoke_url = "https://integrate.api.nvidia.com/v1/chat/completions"
72
  headers = {
@@ -99,6 +101,8 @@ def _run_inference(data: dict) -> dict:
99
  }
100
  if chat_template_kwargs:
101
  payload["chat_template_kwargs"] = chat_template_kwargs
 
 
102
 
103
  response = requests.post(invoke_url, headers=headers, json=payload)
104
  response.raise_for_status()
 
29
  _REQUEST_TIMEOUT_S = int(os.getenv("NVIDIA_LLM_TIMEOUT", "600"))
30
 
31
  # DEFAULT_MODEL = "google/diffusiongemma-26b-a4b-it"
32
+ DEFAULT_MODEL = "mistralai/mistral-medium-3.5-128b"
33
 
34
  # ── Flask app ─────────────────────────────────────────────────────────────────
35
  app = Flask(__name__)
 
61
  chat_template_kwargs = None
62
  temperature = float(data.get("temperature", 1.0))
63
  top_p = float(data.get("top_p", 0.95))
64
+ reasoning_effort = None
65
  else:
66
  model_name = data.get("model", DEFAULT_MODEL)
67
  max_tokens = int(data.get("max_tokens", 16384))
68
  chat_template_kwargs = None
69
+ temperature = float(data.get("temperature", 0.70))
70
+ top_p = float(data.get("top_p", 1.00))
71
+ reasoning_effort = "high"
72
 
73
  invoke_url = "https://integrate.api.nvidia.com/v1/chat/completions"
74
  headers = {
 
101
  }
102
  if chat_template_kwargs:
103
  payload["chat_template_kwargs"] = chat_template_kwargs
104
+ if reasoning_effort:
105
+ payload["reasoning_effort"] = reasoning_effort
106
 
107
  response = requests.post(invoke_url, headers=headers, json=payload)
108
  response.raise_for_status()