diff --git a/providers/nvidia_nim.py b/providers/nvidia_nim.py index 48e02e99..03ca9bb6 100644 --- a/providers/nvidia_nim.py +++ b/providers/nvidia_nim.py @@ -147,6 +147,7 @@ class NvidiaNimProvider(BaseProvider): if choice.get("finish_reason"): finish_reason = choice["finish_reason"] + logger.debug(f"NIM finish_reason: {finish_reason}") # Handle reasoning content from delta reasoning = extract_reasoning_from_delta(delta) diff --git a/providers/utils/sse_builder.py b/providers/utils/sse_builder.py index 900a9966..a1411135 100644 --- a/providers/utils/sse_builder.py +++ b/providers/utils/sse_builder.py @@ -17,7 +17,7 @@ STOP_REASON_MAP = { "stop": "end_turn", "length": "max_tokens", "tool_calls": "tool_use", - "content_filter": "stop_sequence", + "content_filter": "end_turn", } diff --git a/server.py b/server.py index 0384580a..d8fa147b 100644 --- a/server.py +++ b/server.py @@ -26,11 +26,7 @@ from fastapi.responses import StreamingResponse, JSONResponse import tiktoken # Initialize tokenizer -try: - ENCODER = tiktoken.get_encoding("cl100k_base") -except Exception: - logger.warning("Could not load cl100k_base encoding, falling back to p50k_base") - ENCODER = tiktoken.get_encoding("p50k_base") +ENCODER = tiktoken.get_encoding("cl100k_base") # Load environment variables load_dotenv() @@ -39,7 +35,7 @@ load_dotenv() logging.basicConfig( level=logging.DEBUG, format="%(asctime)s - %(levelname)s - %(message)s", - handlers=[logging.FileHandler("server.log", encoding="utf-8", mode="w")], + handlers=[logging.FileHandler("server.log", encoding="utf-8", mode="a")], ) logger = logging.getLogger(__name__)