AI Agent commited on
Commit Β·
91dae80
1
Parent(s): 60d6a5a
Update expert mode LLM to mistral-medium-3.5-128b with reasoning effort
Browse files- agents/nvidia_llm.py +7 -3
agents/nvidia_llm.py
CHANGED
|
@@ -29,7 +29,7 @@ _QUEUE_MAX_SIZE = int(os.getenv("NVIDIA_QUEUE_MAX", "8"))
|
|
| 29 |
_REQUEST_TIMEOUT_S = int(os.getenv("NVIDIA_LLM_TIMEOUT", "600"))
|
| 30 |
|
| 31 |
# DEFAULT_MODEL = "google/diffusiongemma-26b-a4b-it"
|
| 32 |
-
DEFAULT_MODEL = "
|
| 33 |
|
| 34 |
# ββ Flask app βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
|
| 35 |
app = Flask(__name__)
|
|
@@ -61,12 +61,14 @@ def _run_inference(data: dict) -> dict:
|
|
| 61 |
chat_template_kwargs = None
|
| 62 |
temperature = float(data.get("temperature", 1.0))
|
| 63 |
top_p = float(data.get("top_p", 0.95))
|
|
|
|
| 64 |
else:
|
| 65 |
model_name = data.get("model", DEFAULT_MODEL)
|
| 66 |
max_tokens = int(data.get("max_tokens", 16384))
|
| 67 |
chat_template_kwargs = None
|
| 68 |
-
temperature = float(data.get("temperature", 0.
|
| 69 |
-
top_p = float(data.get("top_p", 1.
|
|
|
|
| 70 |
|
| 71 |
invoke_url = "https://integrate.api.nvidia.com/v1/chat/completions"
|
| 72 |
headers = {
|
|
@@ -99,6 +101,8 @@ def _run_inference(data: dict) -> dict:
|
|
| 99 |
}
|
| 100 |
if chat_template_kwargs:
|
| 101 |
payload["chat_template_kwargs"] = chat_template_kwargs
|
|
|
|
|
|
|
| 102 |
|
| 103 |
response = requests.post(invoke_url, headers=headers, json=payload)
|
| 104 |
response.raise_for_status()
|
|
|
|
| 29 |
_REQUEST_TIMEOUT_S = int(os.getenv("NVIDIA_LLM_TIMEOUT", "600"))
|
| 30 |
|
| 31 |
# DEFAULT_MODEL = "google/diffusiongemma-26b-a4b-it"
|
| 32 |
+
DEFAULT_MODEL = "mistralai/mistral-medium-3.5-128b"
|
| 33 |
|
| 34 |
# ββ Flask app βββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββββ
|
| 35 |
app = Flask(__name__)
|
|
|
|
| 61 |
chat_template_kwargs = None
|
| 62 |
temperature = float(data.get("temperature", 1.0))
|
| 63 |
top_p = float(data.get("top_p", 0.95))
|
| 64 |
+
reasoning_effort = None
|
| 65 |
else:
|
| 66 |
model_name = data.get("model", DEFAULT_MODEL)
|
| 67 |
max_tokens = int(data.get("max_tokens", 16384))
|
| 68 |
chat_template_kwargs = None
|
| 69 |
+
temperature = float(data.get("temperature", 0.70))
|
| 70 |
+
top_p = float(data.get("top_p", 1.00))
|
| 71 |
+
reasoning_effort = "high"
|
| 72 |
|
| 73 |
invoke_url = "https://integrate.api.nvidia.com/v1/chat/completions"
|
| 74 |
headers = {
|
|
|
|
| 101 |
}
|
| 102 |
if chat_template_kwargs:
|
| 103 |
payload["chat_template_kwargs"] = chat_template_kwargs
|
| 104 |
+
if reasoning_effort:
|
| 105 |
+
payload["reasoning_effort"] = reasoning_effort
|
| 106 |
|
| 107 |
response = requests.post(invoke_url, headers=headers, json=payload)
|
| 108 |
response.raise_for_status()
|