diff --git a/Models/AgentSettingsViewModel.cs b/Models/AgentSettingsViewModel.cs
index a1c7253..05eedfb 100644
--- a/Models/AgentSettingsViewModel.cs
+++ b/Models/AgentSettingsViewModel.cs
@@ -3,6 +3,16 @@ using ClawdDotNet.Core.Config;
namespace ClawdDotNet.Models;
+/// Bietet die drei gültigen Prompt-Caching-Werte als Auswahlliste an.
+public sealed class PromptCachingConverter : StringConverter
+{
+ public override bool GetStandardValuesSupported(ITypeDescriptorContext? context) => true;
+ public override bool GetStandardValuesExclusive(ITypeDescriptorContext? context) => true;
+
+ public override StandardValuesCollection GetStandardValues(ITypeDescriptorContext? context)
+ => new(new[] { "auto", "on", "off" });
+}
+
[TypeConverter(typeof(ExpandableObjectConverter))]
public sealed class AgentSettingsViewModel
{
@@ -106,6 +116,42 @@ public sealed class AgentSettingsViewModel
set => _config.LoopGuard.CompactionThreshold = Math.Clamp(value, 50, 95) / 100.0;
}
+ [Category("3 - Kontext-Management")]
+ [DisplayName("Modell für Zusammenfassungen")]
+ [Description("Modell, mit dem beim Kompaktieren zusammengefasst wird. Leer = Modell des Agenten. " +
+ "Zusammenfassen ist anspruchslos — ein günstiges Modell spart hier deutlich, " +
+ "da bis zu 30.000 Zeichen verarbeitet werden.")]
+ public string SummaryModel
+ {
+ get => _config.LoopGuard.SummaryModel;
+ set => _config.LoopGuard.SummaryModel = value ?? "";
+ }
+
+ [Category("3 - Kontext-Management")]
+ [DisplayName("Max. Zeichen pro Tool-Ergebnis")]
+ [Description("Längere Tool-Ergebnisse werden gekürzt, bevor sie in den Kontext gelangen. " +
+ "Ohne Grenze kann ein einzelner Abruf den Kontext sprengen — 512 KB entsprechen " +
+ "etwa 130.000 Tokens in einer einzigen Antwort.")]
+ public int MaxToolResultChars
+ {
+ get => _config.MaxToolResultChars;
+ set => _config.MaxToolResultChars = Math.Max(1_000, value);
+ }
+
+ // ──────────────── Kosten ────────────────
+
+ [Category("5 - Kosten")]
+ [DisplayName("Prompt-Caching")]
+ [Description("auto = für Modelle aktivieren, die es unterstützen; on = erzwingen; off = aus. " +
+ "Spart erheblich, weil jeder Schritt eines Runs den kompletten Prompt erneut sendet — " +
+ "System-Prompt und Tool-Definitionen also dutzendfach.")]
+ [TypeConverter(typeof(PromptCachingConverter))]
+ public string PromptCaching
+ {
+ get => _config.PromptCaching;
+ set => _config.PromptCaching = string.IsNullOrWhiteSpace(value) ? "auto" : value;
+ }
+
// ──────────────── Tools (Read-Only) ────────────────
[Category("4 - Tools")]
diff --git a/docs/Bestandsaufnahme-2026-07.md b/docs/Bestandsaufnahme-2026-07.md
index f2282d2..e16b787 100644
--- a/docs/Bestandsaufnahme-2026-07.md
+++ b/docs/Bestandsaufnahme-2026-07.md
@@ -532,11 +532,14 @@ Siehe K3.
5. S3 API-Key-Leak
**Kurzfristig — größter Nutzen pro Aufwand**
-6. T1 Prompt-Caching
-7. T2 Tool-Ergebnisse kappen (= B5)
-8. T3 Günstiges Compaction-Modell
-9. B4 Kostenerfassung korrigieren
+6. ~~T1 Prompt-Caching~~ ✅ umgesetzt (inkl. T9 `cached_tokens`)
+7. ~~T2 Tool-Ergebnisse kappen (= B5)~~ ✅ umgesetzt
+8. ~~T3 Günstiges Compaction-Modell~~ ✅ umgesetzt
+9. ~~B4 Kostenerfassung korrigieren~~ ✅ teilweise: Prompt/Completion werden jetzt
+ getrennt erfasst statt 50/50 geschätzt. Offen bleibt die veraltete, hartcodierte
+ Preistabelle (`ModelPricing`) — Preise sollten vom `/models`-Endpoint kommen.
10. B12 Retry/Backoff
+11. T4 Proaktiv statt reaktiv kompaktieren
**Mittelfristig — Fundament**
11. S1 DatabaseTool absichern
diff --git a/frm_main.cs b/frm_main.cs
index cc8bed2..8821e26 100644
--- a/frm_main.cs
+++ b/frm_main.cs
@@ -289,7 +289,10 @@ public partial class frm_main : Form
///
private void OnEngineRunCompleted(string model, AgentRunResult result)
{
- _statusService?.RecordUsage(model, result.TokensUsed / 2, result.TokensUsed / 2);
+ // Echte Aufteilung statt 50/50: In Agenten-Loops liegt das Verhältnis eher bei
+ // 95:5, und da Ausgabe-Tokens ein Vielfaches kosten, war die alte Schätzung
+ // um ein Mehrfaches daneben.
+ _statusService?.RecordUsage(model, result.PromptTokens, result.CompletionTokens);
if (IsDisposed || !IsHandleCreated) return;
BeginInvoke(() =>
diff --git a/src/ClawdDotNet.Core/Api/Models/ChatMessage.cs b/src/ClawdDotNet.Core/Api/Models/ChatMessage.cs
index 6f57dfc..2d5007e 100644
--- a/src/ClawdDotNet.Core/Api/Models/ChatMessage.cs
+++ b/src/ClawdDotNet.Core/Api/Models/ChatMessage.cs
@@ -1,24 +1,33 @@
+using System.Text.Json;
using System.Text.Json.Serialization;
namespace ClawdDotNet.Core.Api.Models;
+[JsonConverter(typeof(ChatMessageConverter))]
public sealed class ChatMessage
{
- [JsonPropertyName("role")]
public string Role { get; set; } = "";
- [JsonPropertyName("content")]
- [JsonIgnore(Condition = JsonIgnoreCondition.WhenWritingNull)]
public string? Content { get; set; }
- [JsonPropertyName("tool_calls")]
- [JsonIgnore(Condition = JsonIgnoreCondition.WhenWritingNull)]
public List? ToolCalls { get; set; }
- [JsonPropertyName("tool_call_id")]
- [JsonIgnore(Condition = JsonIgnoreCondition.WhenWritingNull)]
public string? ToolCallId { get; set; }
+ ///
+ /// Setzt einen Prompt-Caching-Breakpoint auf diese Nachricht.
+ ///
+ /// Alles, was im Prompt VOR dem Breakpoint steht (Tool-Definitionen, System-Prompt,
+ /// vorherige Nachrichten), wird beim nächsten Aufruf aus dem Cache gelesen und
+ /// kostet nur einen Bruchteil. Der Inhalt wird dann als Block-Array statt als
+ /// einfacher String serialisiert.
+ ///
+ /// Wichtig: Der Prompt-Abschnitt vor dem Breakpoint muss zwischen zwei Aufrufen
+ /// zeichengenau identisch sein, sonst greift der Cache nicht.
+ ///
+ [JsonIgnore]
+ public bool CacheBreakpoint { get; set; }
+
public static ChatMessage System(string content) => new() { Role = "system", Content = content };
public static ChatMessage User(string content) => new() { Role = "user", Content = content };
public static ChatMessage Assistant(string content) => new() { Role = "assistant", Content = content };
@@ -36,3 +45,136 @@ public sealed class ChatMessage
Content = content
};
}
+
+///
+/// Serialisiert . Der Inhalt geht normalerweise als einfacher
+/// String raus; ist ein gesetzt, stattdessen
+/// als Block-Array mit cache_control — das Format, das Anbieter für Prompt-Caching
+/// erwarten.
+///
+/// Beim Lesen werden beide Formate akzeptiert: Antworten liefern den Inhalt als String,
+/// gespeicherte Kontexte können ihn als Array enthalten.
+///
+public sealed class ChatMessageConverter : JsonConverter
+{
+ public override ChatMessage Read(ref Utf8JsonReader reader, Type typeToConvert, JsonSerializerOptions options)
+ {
+ if (reader.TokenType != JsonTokenType.StartObject)
+ throw new JsonException("ChatMessage: Objekt erwartet.");
+
+ var message = new ChatMessage();
+
+ while (reader.Read())
+ {
+ if (reader.TokenType == JsonTokenType.EndObject)
+ return message;
+
+ if (reader.TokenType != JsonTokenType.PropertyName)
+ continue;
+
+ var propertyName = reader.GetString();
+ reader.Read();
+
+ switch (propertyName)
+ {
+ case "role":
+ message.Role = reader.GetString() ?? "";
+ break;
+
+ case "content":
+ message.Content = ReadContent(ref reader);
+ break;
+
+ case "tool_calls":
+ message.ToolCalls = reader.TokenType == JsonTokenType.Null
+ ? null
+ : JsonSerializer.Deserialize>(ref reader, options);
+ break;
+
+ case "tool_call_id":
+ message.ToolCallId = reader.GetString();
+ break;
+
+ default:
+ reader.Skip();
+ break;
+ }
+ }
+
+ throw new JsonException("ChatMessage: unerwartetes Ende.");
+ }
+
+ /// Nimmt den Inhalt als String oder als Block-Array entgegen.
+ private static string? ReadContent(ref Utf8JsonReader reader)
+ {
+ if (reader.TokenType == JsonTokenType.Null)
+ return null;
+
+ if (reader.TokenType == JsonTokenType.String)
+ return reader.GetString();
+
+ if (reader.TokenType != JsonTokenType.StartArray)
+ {
+ reader.Skip();
+ return null;
+ }
+
+ // Block-Array: die text-Anteile zusammenführen.
+ var parts = new List();
+ while (reader.Read() && reader.TokenType != JsonTokenType.EndArray)
+ {
+ if (reader.TokenType != JsonTokenType.StartObject)
+ {
+ reader.Skip();
+ continue;
+ }
+
+ using var block = JsonDocument.ParseValue(ref reader);
+ if (block.RootElement.TryGetProperty("text", out var text) &&
+ text.GetString() is { } value)
+ {
+ parts.Add(value);
+ }
+ }
+
+ return parts.Count > 0 ? string.Join("", parts) : null;
+ }
+
+ public override void Write(Utf8JsonWriter writer, ChatMessage value, JsonSerializerOptions options)
+ {
+ writer.WriteStartObject();
+ writer.WriteString("role", value.Role);
+
+ if (value.Content is not null)
+ {
+ if (value.CacheBreakpoint)
+ {
+ // [{ "type": "text", "text": "…", "cache_control": { "type": "ephemeral" } }]
+ writer.WriteStartArray("content");
+ writer.WriteStartObject();
+ writer.WriteString("type", "text");
+ writer.WriteString("text", value.Content);
+ writer.WriteStartObject("cache_control");
+ writer.WriteString("type", "ephemeral");
+ writer.WriteEndObject();
+ writer.WriteEndObject();
+ writer.WriteEndArray();
+ }
+ else
+ {
+ writer.WriteString("content", value.Content);
+ }
+ }
+
+ if (value.ToolCalls is { Count: > 0 })
+ {
+ writer.WritePropertyName("tool_calls");
+ JsonSerializer.Serialize(writer, value.ToolCalls, options);
+ }
+
+ if (value.ToolCallId is not null)
+ writer.WriteString("tool_call_id", value.ToolCallId);
+
+ writer.WriteEndObject();
+ }
+}
diff --git a/src/ClawdDotNet.Core/Api/Models/ChatResponse.cs b/src/ClawdDotNet.Core/Api/Models/ChatResponse.cs
index 70bb504..f10b057 100644
--- a/src/ClawdDotNet.Core/Api/Models/ChatResponse.cs
+++ b/src/ClawdDotNet.Core/Api/Models/ChatResponse.cs
@@ -42,6 +42,23 @@ public sealed class Usage
[JsonPropertyName("total_tokens")]
public int TotalTokens { get; set; }
+
+ [JsonPropertyName("prompt_tokens_details")]
+ public PromptTokensDetails? PromptTokensDetails { get; set; }
+
+ ///
+ /// Anteil der Prompt-Tokens, der aus dem Cache gelesen wurde. Nur damit lässt sich
+ /// belegen, ob das Prompt-Caching tatsächlich greift — ein still wirkungsloser
+ /// Cache wäre sonst nicht zu bemerken.
+ ///
+ [JsonIgnore]
+ public int CachedTokens => PromptTokensDetails?.CachedTokens ?? 0;
+}
+
+public sealed class PromptTokensDetails
+{
+ [JsonPropertyName("cached_tokens")]
+ public int CachedTokens { get; set; }
}
public sealed class ApiError
diff --git a/src/ClawdDotNet.Core/ClawdDotNet.Core.csproj b/src/ClawdDotNet.Core/ClawdDotNet.Core.csproj
index 70c7d29..a92ce0f 100644
--- a/src/ClawdDotNet.Core/ClawdDotNet.Core.csproj
+++ b/src/ClawdDotNet.Core/ClawdDotNet.Core.csproj
@@ -7,6 +7,10 @@
ClawdDotNet.Core
+
+
+
+
diff --git a/src/ClawdDotNet.Core/Config/AgentConfig.cs b/src/ClawdDotNet.Core/Config/AgentConfig.cs
index ef4658f..0365fd9 100644
--- a/src/ClawdDotNet.Core/Config/AgentConfig.cs
+++ b/src/ClawdDotNet.Core/Config/AgentConfig.cs
@@ -88,6 +88,24 @@ public sealed class AgentConfig
[JsonPropertyName("loopGuard")]
public LoopGuardConfig LoopGuard { get; set; } = new();
+
+ ///
+ /// Prompt-Caching: "auto" (Default), "on" oder "off".
+ ///
+ /// Bei "auto" wird es für Modelle aktiviert, die cache_control unterstützen.
+ /// Der Nutzen ist erheblich, weil jeder Schritt eines Runs den kompletten Prompt
+ /// erneut sendet — System-Prompt und Tool-Definitionen also dutzendfach.
+ ///
+ [JsonPropertyName("promptCaching")]
+ public string PromptCaching { get; set; } = "auto";
+
+ ///
+ /// Maximale Länge eines einzelnen Tool-Ergebnisses in Zeichen, bevor es gekürzt in
+ /// den Kontext wandert. Ohne Grenze kann ein einziger Abruf den gesamten Kontext
+ /// sprengen (ein WebFetch mit 512 KB entspricht etwa 130.000 Tokens).
+ ///
+ [JsonPropertyName("maxToolResultChars")]
+ public int MaxToolResultChars { get; set; } = 16_000;
}
public sealed class SchedulerConfig
@@ -137,6 +155,16 @@ public sealed class LoopGuardConfig
[JsonPropertyName("compactionThreshold")]
public double CompactionThreshold { get; set; } = 0.80;
+ ///
+ /// Modell für die Zusammenfassung beim Kompaktieren. Leer = Modell des Agenten.
+ ///
+ /// Zusammenfassen ist eine anspruchslose Aufgabe; sie mit einem teuren Modell zu
+ /// erledigen kostet leicht mehr als der halbe Run, weil bis zu 30.000 Zeichen
+ /// verarbeitet werden.
+ ///
+ [JsonPropertyName("summaryModel")]
+ public string SummaryModel { get; set; } = "google/gemini-2.5-flash";
+
[JsonIgnore]
public TimeSpan Timeout => TimeSpan.FromSeconds(TimeoutSeconds);
}
diff --git a/src/ClawdDotNet.Core/Engine/AgentEngine.cs b/src/ClawdDotNet.Core/Engine/AgentEngine.cs
index 4f2d993..d93c067 100644
--- a/src/ClawdDotNet.Core/Engine/AgentEngine.cs
+++ b/src/ClawdDotNet.Core/Engine/AgentEngine.cs
@@ -109,13 +109,17 @@ public sealed class AgentEngine : IAgentMessageRouter
messages.Add(ChatMessage.User(userMessage));
string? finalMessage = null;
- var totalTokens = 0;
+ var tally = new TokenTally();
+ var cachingEnabled = PromptCache.IsEnabledFor(agentConfig.PromptCaching, agentConfig.Model);
while (true)
{
ct.ThrowIfCancellationRequested();
loopGuard.RecordStep();
+ if (cachingEnabled)
+ PromptCache.ApplyBreakpoints(messages);
+
var request = new ChatRequest
{
Model = agentConfig.Model,
@@ -128,7 +132,7 @@ public sealed class AgentEngine : IAgentMessageRouter
var promptTokens = 0;
if (response.Usage is not null)
{
- totalTokens += response.Usage.TotalTokens;
+ tally.Add(response.Usage);
promptTokens = response.Usage.PromptTokens;
loopGuard.RecordTokens(response.Usage.TotalTokens);
}
@@ -174,16 +178,21 @@ public sealed class AgentEngine : IAgentMessageRouter
sw.Stop();
logger.LogInformation(
- "Agent run completed: {AgentId}, steps={Steps}, tokens={Tokens}, duration={Duration}ms",
- agentConfig.AgentId, loopGuard.Steps, totalTokens, sw.ElapsedMilliseconds);
+ "Agent run completed: {AgentId}, steps={Steps}, tokens={Tokens} (davon {Cached} aus Cache), duration={Duration}ms",
+ agentConfig.AgentId, loopGuard.Steps, tally.Total, tally.Cached, sw.ElapsedMilliseconds);
var result = new AgentRunResult(
agentConfig.AgentId,
AgentRunStatus.Completed,
finalMessage,
loopGuard.Steps,
- totalTokens,
- sw.Elapsed);
+ tally.Total,
+ sw.Elapsed)
+ {
+ PromptTokens = tally.Prompt,
+ CompletionTokens = tally.Completion,
+ CachedTokens = tally.Cached
+ };
OnRunCompleted?.Invoke(agentConfig.Model, result);
return result;
}
@@ -318,13 +327,17 @@ public sealed class AgentEngine : IAgentMessageRouter
AddChatEntry(agentConfig.AgentId, "user", userMessage, source);
string? finalMessage = null;
- var totalTokens = 0;
+ var tally = new TokenTally();
+ var cachingEnabled = PromptCache.IsEnabledFor(agentConfig.PromptCaching, agentConfig.Model);
while (true)
{
ct.ThrowIfCancellationRequested();
loopGuard.RecordStep();
+ if (cachingEnabled)
+ PromptCache.ApplyBreakpoints(messages);
+
var request = new ChatRequest
{
Model = agentConfig.Model,
@@ -337,7 +350,7 @@ public sealed class AgentEngine : IAgentMessageRouter
var promptTokens = 0;
if (response.Usage is not null)
{
- totalTokens += response.Usage.TotalTokens;
+ tally.Add(response.Usage);
promptTokens = response.Usage.PromptTokens;
loopGuard.RecordTokens(response.Usage.TotalTokens);
}
@@ -386,7 +399,12 @@ public sealed class AgentEngine : IAgentMessageRouter
sw.Stop();
var result = new AgentRunResult(
agentConfig.AgentId, AgentRunStatus.Completed, finalMessage,
- loopGuard.Steps, totalTokens, sw.Elapsed);
+ loopGuard.Steps, tally.Total, sw.Elapsed)
+ {
+ PromptTokens = tally.Prompt,
+ CompletionTokens = tally.Completion,
+ CachedTokens = tally.Cached
+ };
OnRunCompleted?.Invoke(agentConfig.Model, result);
return result;
}
@@ -786,9 +804,18 @@ public sealed class AgentEngine : IAgentMessageRouter
logger.LogDebug("Tool {Tool} completed: success={Success}", toolName, result.Success);
- return result.Success
- ? result.Content
- : JsonSerializer.Serialize(new { error = result.ErrorMessage });
+ if (!result.Success)
+ return JsonSerializer.Serialize(new { error = result.ErrorMessage });
+
+ var content = TruncateToolResult(result.Content, agentConfig.MaxToolResultChars);
+ if (content.Length != result.Content.Length)
+ {
+ logger.LogInformation(
+ "Tool-Ergebnis von {Tool} gekürzt: {Original} → {Limit} Zeichen",
+ toolName, result.Content.Length, agentConfig.MaxToolResultChars);
+ }
+
+ return content;
}
catch (ToolAccessDeniedException ex)
{
@@ -808,6 +835,42 @@ public sealed class AgentEngine : IAgentMessageRouter
}
}
+ /// Sammelt die Token-Zahlen über alle Schritte eines Runs.
+ private sealed class TokenTally
+ {
+ public int Total { get; private set; }
+ public int Prompt { get; private set; }
+ public int Completion { get; private set; }
+ public int Cached { get; private set; }
+
+ public void Add(Usage usage)
+ {
+ Total += usage.TotalTokens;
+ Prompt += usage.PromptTokens;
+ Completion += usage.CompletionTokens;
+ Cached += usage.CachedTokens;
+ }
+ }
+
+ ///
+ /// Kürzt ein Tool-Ergebnis, bevor es in den Kontext wandert.
+ ///
+ /// Ohne diese Grenze kann ein einzelner Aufruf den Kontext sprengen — ein WebFetch
+ /// mit dem Standardlimit von 512 KB entspricht rund 130.000 Tokens in EINER
+ /// Tool-Antwort. Die Compaction greift erst danach, der teure Request ist zu dem
+ /// Zeitpunkt längst bezahlt.
+ ///
+ internal static string TruncateToolResult(string result, int maxChars)
+ {
+ if (maxChars <= 0 || result.Length <= maxChars)
+ return result;
+
+ var omitted = result.Length - maxChars;
+ return result[..maxChars] +
+ $"\n\n[… {omitted:N0} Zeichen gekürzt. Das Ergebnis war zu groß für den Kontext. " +
+ "Grenze die Abfrage ein, wenn du den Rest brauchst.]";
+ }
+
private static List BuildToolDefinitions(IReadOnlyList tools)
{
return tools.Select(t => new ToolDefinition
diff --git a/src/ClawdDotNet.Core/Engine/AgentRunResult.cs b/src/ClawdDotNet.Core/Engine/AgentRunResult.cs
index 66dffc4..42978bb 100644
--- a/src/ClawdDotNet.Core/Engine/AgentRunResult.cs
+++ b/src/ClawdDotNet.Core/Engine/AgentRunResult.cs
@@ -8,7 +8,20 @@ public sealed record AgentRunResult(
int TokensUsed,
TimeSpan Duration,
Exception? Error = null
-);
+)
+{
+ /// Summe der Eingabe-Tokens über alle Schritte des Runs.
+ public int PromptTokens { get; init; }
+
+ /// Summe der Ausgabe-Tokens über alle Schritte des Runs.
+ public int CompletionTokens { get; init; }
+
+ ///
+ /// Anteil der Eingabe-Tokens, der aus dem Prompt-Cache kam. Diese Tokens sind bereits
+ /// in enthalten, kosten aber nur einen Bruchteil.
+ ///
+ public int CachedTokens { get; init; }
+}
public enum AgentRunStatus
{
diff --git a/src/ClawdDotNet.Core/Engine/ContextCompactor.cs b/src/ClawdDotNet.Core/Engine/ContextCompactor.cs
index 0fc099d..469c189 100644
--- a/src/ClawdDotNet.Core/Engine/ContextCompactor.cs
+++ b/src/ClawdDotNet.Core/Engine/ContextCompactor.cs
@@ -69,8 +69,12 @@ public sealed class ContextCompactor
return true;
}
- // Stufe 2: Auto-Compaction via LLM
- await CompactViaLlmAsync(messages, model, ct);
+ // Stufe 2: Auto-Compaction via LLM — bewusst mit dem günstigen Modell.
+ var summaryModel = string.IsNullOrWhiteSpace(guard.SummaryModel)
+ ? model
+ : guard.SummaryModel;
+
+ await CompactViaLlmAsync(messages, summaryModel, ct);
return true;
}
diff --git a/src/ClawdDotNet.Core/Engine/PromptCache.cs b/src/ClawdDotNet.Core/Engine/PromptCache.cs
new file mode 100644
index 0000000..d9548b0
--- /dev/null
+++ b/src/ClawdDotNet.Core/Engine/PromptCache.cs
@@ -0,0 +1,67 @@
+using ClawdDotNet.Core.Api.Models;
+
+namespace ClawdDotNet.Core.Engine;
+
+///
+/// Setzt Prompt-Caching-Breakpoints in die Nachrichtenliste.
+///
+/// Hintergrund: In einem Agenten-Run wird bei JEDEM Schritt der komplette Prompt erneut
+/// gesendet und voll berechnet — inklusive Tool-Definitionen und System-Prompt, die sich
+/// nie ändern. Bei zehn Schritten und einem 15k-Präfix sind das 150.000 Eingabe-Tokens
+/// statt 15.000.
+///
+/// Ein Breakpoint markiert das Ende eines stabilen Prompt-Abschnitts. Alles davor wird
+/// beim nächsten Aufruf aus dem Cache gelesen und kostet nur einen Bruchteil.
+///
+/// Zwei Breakpoints werden gesetzt:
+/// 1. auf den System-Prompt — deckt Tool-Definitionen und System-Prompt ab,
+/// 2. rollierend auf die letzte Nachricht — deckt den bereits gelaufenen Gesprächsverlauf ab.
+///
+public static class PromptCache
+{
+ ///
+ /// Modelle, bei denen "auto" das Caching einschaltet. Andere Anbieter ignorieren
+ /// cache_control entweder oder cachen ohnehin automatisch.
+ ///
+ private static readonly string[] AutoEnabledPrefixes = ["anthropic/"];
+
+ public static bool IsEnabledFor(string setting, string model) => setting?.ToLowerInvariant() switch
+ {
+ "on" => true,
+ "off" => false,
+ _ => AutoEnabledPrefixes.Any(p => model.StartsWith(p, StringComparison.OrdinalIgnoreCase))
+ };
+
+ ///
+ /// Setzt die Breakpoints neu. Vorherige werden entfernt, damit sich pro Schritt
+ /// nie mehr als die beabsichtigten Markierungen ansammeln.
+ ///
+ public static void ApplyBreakpoints(List messages)
+ {
+ foreach (var msg in messages)
+ msg.CacheBreakpoint = false;
+
+ if (messages.Count == 0)
+ return;
+
+ // 1. System-Prompt — der stabilste Teil überhaupt.
+ var system = messages[0].Role == "system" ? messages[0] : null;
+ if (system?.Content is not null)
+ system.CacheBreakpoint = true;
+
+ // 2. Letzte Nachricht mit Inhalt. Beim nächsten Schritt ist alles bis hierher
+ // unverändert und wird aus dem Cache gelesen.
+ // Eine assistant-Nachricht mit tool_calls hat keinen Textinhalt und kann
+ // deshalb keinen Block tragen — in dem Fall bleibt es beim System-Breakpoint.
+ for (var i = messages.Count - 1; i >= 1; i--)
+ {
+ if (messages[i].Content is null)
+ continue;
+
+ if (!ReferenceEquals(messages[i], system))
+ messages[i].CacheBreakpoint = true;
+
+ break;
+ }
+ }
+}
diff --git a/src/ClawdDotNet.Tools.AgentEditor/AgentEditorTool.cs b/src/ClawdDotNet.Tools.AgentEditor/AgentEditorTool.cs
index d533ea2..80a183c 100644
--- a/src/ClawdDotNet.Tools.AgentEditor/AgentEditorTool.cs
+++ b/src/ClawdDotNet.Tools.AgentEditor/AgentEditorTool.cs
@@ -326,13 +326,16 @@ public sealed class AgentEditorTool : IAgentTool
tools = new Dictionary(),
scheduler = (object?)null,
toolJobs = Array.Empty