From f462d733474e4192c19eba8ca0024ae320a850ca Mon Sep 17 00:00:00 2001 From: Douwe Osinga Date: Wed, 11 Mar 2026 15:13:11 -0400 Subject: [PATCH] fix: return ContextLengthExceeded when prompt exceeds effective KV cache size (#7815) Co-authored-by: Douwe Osinga --- .../src/providers/local_inference/inference_engine.rs | 7 +++++++ 1 file changed, 7 insertions(+) diff --git a/crates/goose/src/providers/local_inference/inference_engine.rs b/crates/goose/src/providers/local_inference/inference_engine.rs index 06256fca90..90940f357e 100644 --- a/crates/goose/src/providers/local_inference/inference_engine.rs +++ b/crates/goose/src/providers/local_inference/inference_engine.rs @@ -226,6 +226,13 @@ pub(super) fn validate_and_compute_context( ))); } } + if prompt_token_count >= effective_ctx { + return Err(ProviderError::ContextLengthExceeded(format!( + "Prompt ({} tokens) exceeds context limit ({} tokens). \ + Try reducing conversation length.", + prompt_token_count, effective_ctx, + ))); + } Ok((prompt_token_count, effective_ctx)) }