Prompt-Caching, Tool-Ergebnis-Kappung und Kostenerfassung
T1 — Prompt-Caching. Bisher wurde bei jedem Schritt eines Runs der komplette Prompt neu berechnet, inklusive Tool-Definitionen und System-Prompt, die sich nie aendern. Bei zehn Schritten und einem 15k-Praefix sind das 150.000 statt 15.000 Eingabe-Tokens. ChatMessage bekommt dafuer einen eigenen JsonConverter: Der Inhalt geht weiterhin als String raus, bei gesetztem CacheBreakpoint jedoch als Blockarray mit cache_control. Beim Lesen werden beide Formate akzeptiert, damit bestehende ChatContext.json weiter geladen werden koennen. PromptCache setzt zwei Breakpoints: einen auf den System-Prompt (deckt Tool-Definitionen und System-Prompt ab) und einen rollierenden auf die letzte Nachricht mit Inhalt. Vorherige Markierungen werden vorher entfernt, damit sie sich nicht ansammeln. Aktivierung ueber promptCaching: auto (Default, aktiv fuer Modelle mit Unterstuetzung), on oder off. Der wichtigste Test dazu prueft die Praefix-Stabilitaet: Der System-Prompt muss ueber alle Schritte zeichengleich serialisiert werden. Ein einziger Zeitstempel darin wuerde den Cache still verwerfen — die Kosten blieben unveraendert, ohne dass es irgendwo auffiele. T9 — Usage liest prompt_tokens_details.cached_tokens; die Zahl wird bis in AgentRunResult durchgereicht. Ohne sie liesse sich die Wirkung nicht belegen. T2 — Tool-Ergebnisse werden jetzt zentral in ExecuteToolCallAsync gekappt (maxToolResultChars, Default 16.000). Bisher konnte ein einzelner WebFetch mit dem 512-KB-Standardlimit rund 130.000 Tokens in EINER Antwort erzeugen; die Compaction griff erst danach, bezahlt war der Request laengst. T3 — Die Zusammenfassung beim Kompaktieren laeuft ueber ein konfigurierbares summaryModel (Default gemini-2.5-flash) statt ueber das teure Agentenmodell. B4 — AgentRunResult fuehrt Prompt- und Completion-Tokens getrennt; die Kostenanzeige schaetzte bisher 50/50, real liegt das Verhaeltnis eher bei 95:5. Die veraltete Preistabelle bleibt offen. Neue Einstellungen sind im PropertyGrid sichtbar und werden vom AgentEditor bei neuen Agenten mitgeschrieben. Alle 91 Tests gruen. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
co-authored by
Claude Opus 4.8
parent
6bbe9f9a80
commit
69b5704add
@@ -0,0 +1,159 @@
|
||||
using System.Text.Json;
|
||||
using ClawdDotNet.Core.Api.Models;
|
||||
using ClawdDotNet.Core.Engine;
|
||||
using ClawdDotNet.Core.Tests.Infrastructure;
|
||||
using Shouldly;
|
||||
|
||||
namespace ClawdDotNet.Core.Tests.Engine;
|
||||
|
||||
public sealed class PromptCacheTests
|
||||
{
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// Aktivierung
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Theory]
|
||||
[InlineData("auto", "anthropic/claude-sonnet-4-5", true)]
|
||||
[InlineData("auto", "anthropic/claude-haiku-4.5", true)]
|
||||
[InlineData("auto", "openai/gpt-4o", false)]
|
||||
[InlineData("auto", "google/gemini-2.5-flash", false)]
|
||||
[InlineData("on", "openai/gpt-4o", true)]
|
||||
[InlineData("off", "anthropic/claude-sonnet-4-5", false)]
|
||||
[InlineData("OFF", "anthropic/claude-sonnet-4-5", false)]
|
||||
public void Aktivierung_richtet_sich_nach_Einstellung_und_Modell(string setting, string model, bool expected)
|
||||
{
|
||||
PromptCache.IsEnabledFor(setting, model).ShouldBe(expected);
|
||||
}
|
||||
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// Platzierung der Breakpoints
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Fact]
|
||||
public void Der_SystemPrompt_bekommt_einen_Breakpoint()
|
||||
{
|
||||
var messages = Conversation.Start("System").User("Frage").Build();
|
||||
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
|
||||
messages[0].Role.ShouldBe("system");
|
||||
messages[0].CacheBreakpoint.ShouldBeTrue();
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Die_letzte_Nachricht_mit_Inhalt_bekommt_einen_rollierenden_Breakpoint()
|
||||
{
|
||||
var messages = Conversation.Start().User("A").Assistant("B").User("C").Build();
|
||||
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
|
||||
messages[^1].CacheBreakpoint.ShouldBeTrue();
|
||||
messages[^1].Content.ShouldBe("C");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Eine_AssistantNachricht_ohne_Inhalt_traegt_keinen_Breakpoint()
|
||||
{
|
||||
// assistant mit tool_calls hat keinen Textinhalt und kann keinen Block tragen.
|
||||
var messages = Conversation.Start().User("A").Build();
|
||||
messages.Add(ChatMessage.AssistantWithToolCalls([
|
||||
new ToolCall { Id = "c1", Function = new ToolCallFunction { Name = "T", Arguments = "{}" } }
|
||||
]));
|
||||
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
|
||||
messages[^1].CacheBreakpoint.ShouldBeFalse();
|
||||
messages.Count(m => m.CacheBreakpoint).ShouldBeGreaterThan(0, "der System-Breakpoint muss bleiben");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Es_werden_hoechstens_zwei_Breakpoints_gesetzt()
|
||||
{
|
||||
// Anbieter erlauben nur eine begrenzte Zahl — sie dürfen sich nicht ansammeln.
|
||||
var messages = Conversation.Start().Repeat(10).Build();
|
||||
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
|
||||
messages.Count(m => m.CacheBreakpoint).ShouldBeLessThanOrEqualTo(2);
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Wiederholtes_Anwenden_sammelt_keine_Breakpoints_an()
|
||||
{
|
||||
var messages = Conversation.Start().Repeat(3).Build();
|
||||
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
messages.Add(ChatMessage.User("Noch eine Frage"));
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
messages.Add(ChatMessage.User("Und noch eine"));
|
||||
PromptCache.ApplyBreakpoints(messages);
|
||||
|
||||
messages.Count(m => m.CacheBreakpoint).ShouldBeLessThanOrEqualTo(2);
|
||||
messages[^1].CacheBreakpoint.ShouldBeTrue("der Breakpoint muss mitwandern");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Eine_leere_Liste_fuehrt_nicht_zu_einem_Fehler()
|
||||
{
|
||||
var messages = new List<ChatMessage>();
|
||||
|
||||
Should.NotThrow(() => PromptCache.ApplyBreakpoints(messages));
|
||||
}
|
||||
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// Präfix-Stabilität — der entscheidende Test
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
/// <summary>
|
||||
/// Der gecachte Prompt-Abschnitt muss zwischen zwei Schritten zeichengenau identisch
|
||||
/// sein. Ein einziger Zeitstempel im System-Prompt würde den Cache bei jedem Schritt
|
||||
/// verwerfen — die Kosten blieben unverändert, ohne dass es irgendwo auffiele.
|
||||
/// Genau davor schützt dieser Test.
|
||||
/// </summary>
|
||||
[Fact]
|
||||
public async Task Der_Praefix_bleibt_ueber_alle_Schritte_zeichengleich()
|
||||
{
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning("ok"));
|
||||
var agent = fixture.AddAgent("agent-cache", "TestTool");
|
||||
agent.Model = "anthropic/claude-sonnet-4-5";
|
||||
agent.PromptCaching = "on";
|
||||
|
||||
// Acht Tool-Schritte, dann eine Textantwort.
|
||||
for (var i = 0; i < 8; i++)
|
||||
fixture.Client.RespondsWithToolCall("TestTool");
|
||||
fixture.Client.RespondsWithText("Fertig");
|
||||
|
||||
await fixture.Engine.ChatAsync(agent, "Los", "test-instance", default);
|
||||
|
||||
fixture.Client.ReceivedRequests.Count.ShouldBe(9);
|
||||
|
||||
// Die system-Nachricht ist der stabile Präfix — sie muss in jedem Request
|
||||
// byte-identisch serialisiert werden.
|
||||
var systemPayloads = fixture.Client.ReceivedRequests
|
||||
.Select(r => JsonSerializer.Serialize(r.Messages[0]))
|
||||
.Distinct()
|
||||
.ToList();
|
||||
|
||||
systemPayloads.Count.ShouldBe(1,
|
||||
"der System-Prompt muss über alle Schritte hinweg identisch serialisiert werden:\n" +
|
||||
string.Join("\n", systemPayloads));
|
||||
|
||||
systemPayloads[0].ShouldContain("cache_control");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public async Task Ohne_Caching_enthaelt_der_Request_kein_cache_control()
|
||||
{
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning("ok"));
|
||||
var agent = fixture.AddAgent("agent-nocache", "TestTool");
|
||||
agent.Model = "openai/gpt-4o";
|
||||
agent.PromptCaching = "auto"; // bei diesem Modell also aus
|
||||
|
||||
fixture.Client.RespondsWithText("Fertig");
|
||||
|
||||
await fixture.Engine.ChatAsync(agent, "Los", "test-instance", default);
|
||||
|
||||
var json = JsonSerializer.Serialize(fixture.Client.ReceivedRequests[0].Messages);
|
||||
json.ShouldNotContain("cache_control");
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,161 @@
|
||||
using ClawdDotNet.Core.Api.Models;
|
||||
using ClawdDotNet.Core.Config;
|
||||
using ClawdDotNet.Core.Engine;
|
||||
using ClawdDotNet.Core.Tests.Infrastructure;
|
||||
using Shouldly;
|
||||
|
||||
namespace ClawdDotNet.Core.Tests.Engine;
|
||||
|
||||
public sealed class TokenAccountingTests
|
||||
{
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// B4 — Prompt und Completion getrennt erfassen
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Fact]
|
||||
public async Task Prompt_und_Completion_werden_getrennt_aufsummiert()
|
||||
{
|
||||
// Bisher schätzte die UI 50/50. Real liegt das Verhältnis eher bei 95:5 —
|
||||
// und da Ausgabe-Tokens ein Vielfaches kosten, war die Kostenanzeige
|
||||
// um ein Mehrfaches daneben.
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning("ok"));
|
||||
var agent = fixture.AddAgent("agent-tokens", "TestTool");
|
||||
|
||||
fixture.Client
|
||||
.RespondsWithText("Fertig", new Usage
|
||||
{
|
||||
PromptTokens = 9_500,
|
||||
CompletionTokens = 500,
|
||||
TotalTokens = 10_000
|
||||
});
|
||||
|
||||
var result = await fixture.Engine.ChatAsync(agent, "Frage", "test-instance", default);
|
||||
|
||||
result.PromptTokens.ShouldBe(9_500);
|
||||
result.CompletionTokens.ShouldBe(500);
|
||||
result.TokensUsed.ShouldBe(10_000);
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public async Task Ueber_mehrere_Schritte_wird_korrekt_summiert()
|
||||
{
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning("ok"));
|
||||
var agent = fixture.AddAgent("agent-sum", "TestTool");
|
||||
|
||||
fixture.Client
|
||||
.RespondsWithToolCall("TestTool") // 100 / 20 / 120 laut Fake
|
||||
.RespondsWithToolCall("TestTool")
|
||||
.RespondsWithText("Fertig");
|
||||
|
||||
var result = await fixture.Engine.ChatAsync(agent, "Frage", "test-instance", default);
|
||||
|
||||
result.StepCount.ShouldBe(3);
|
||||
result.PromptTokens.ShouldBe(300);
|
||||
result.CompletionTokens.ShouldBe(60);
|
||||
result.TokensUsed.ShouldBe(360);
|
||||
}
|
||||
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// T9 — Cache-Wirkung messbar machen
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Fact]
|
||||
public async Task Gecachte_Tokens_werden_durchgereicht()
|
||||
{
|
||||
// Ohne diese Zahl liesse sich nicht belegen, ob das Prompt-Caching greift —
|
||||
// ein still wirkungsloser Cache wäre sonst nicht zu bemerken.
|
||||
var fixture = new EngineFixture();
|
||||
var agent = fixture.AddAgent("agent-cached");
|
||||
|
||||
fixture.Client.RespondsWithText("Fertig", new Usage
|
||||
{
|
||||
PromptTokens = 20_000,
|
||||
CompletionTokens = 300,
|
||||
TotalTokens = 20_300,
|
||||
PromptTokensDetails = new PromptTokensDetails { CachedTokens = 18_000 }
|
||||
});
|
||||
|
||||
var result = await fixture.Engine.ChatAsync(agent, "Frage", "test-instance", default);
|
||||
|
||||
result.CachedTokens.ShouldBe(18_000);
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Fehlende_Cache_Angaben_ergeben_null_statt_eines_Fehlers()
|
||||
{
|
||||
var usage = new Usage { PromptTokens = 100, CompletionTokens = 10, TotalTokens = 110 };
|
||||
|
||||
usage.CachedTokens.ShouldBe(0);
|
||||
}
|
||||
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// T3 — Compaction läuft mit dem günstigen Modell
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Fact]
|
||||
public async Task Die_Zusammenfassung_nutzt_das_guenstige_Modell()
|
||||
{
|
||||
var client = new FakeChatClient().AlwaysRespondsWithText("- Zusammenfassung.");
|
||||
var compactor = new ContextCompactor(client, TestLogging.Factory);
|
||||
|
||||
var guard = new LoopGuardConfig
|
||||
{
|
||||
MaxContextTokens = 1_000,
|
||||
CompactionThreshold = 0.5,
|
||||
SummaryModel = "google/gemini-2.5-flash"
|
||||
};
|
||||
|
||||
var messages = Conversation.Start().Repeat(10).Build();
|
||||
|
||||
await compactor.CompactIfNeededAsync(messages, 50_000, guard, "anthropic/claude-opus-4", default);
|
||||
|
||||
client.ReceivedRequests.ShouldNotBeEmpty();
|
||||
client.ReceivedRequests[0].Model.ShouldBe("google/gemini-2.5-flash",
|
||||
"Zusammenfassen ist anspruchslos und darf nicht das teure Agentenmodell belegen");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public async Task Ohne_konfiguriertes_SummaryModel_wird_das_Agentenmodell_verwendet()
|
||||
{
|
||||
var client = new FakeChatClient().AlwaysRespondsWithText("- Zusammenfassung.");
|
||||
var compactor = new ContextCompactor(client, TestLogging.Factory);
|
||||
|
||||
var guard = new LoopGuardConfig
|
||||
{
|
||||
MaxContextTokens = 1_000,
|
||||
CompactionThreshold = 0.5,
|
||||
SummaryModel = ""
|
||||
};
|
||||
|
||||
var messages = Conversation.Start().Repeat(10).Build();
|
||||
|
||||
await compactor.CompactIfNeededAsync(messages, 50_000, guard, "anthropic/claude-opus-4", default);
|
||||
|
||||
client.ReceivedRequests[0].Model.ShouldBe("anthropic/claude-opus-4");
|
||||
}
|
||||
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
// Nur der wegfallende Teil wird zusammengefasst
|
||||
// ═══════════════════════════════════════════════════════════
|
||||
|
||||
[Fact]
|
||||
public async Task Der_erhaltene_Tail_geht_nicht_in_den_Zusammenfassungs_Aufruf()
|
||||
{
|
||||
// Der Tail bleibt wörtlich erhalten — ihn zusätzlich zusammenzufassen
|
||||
// wäre doppelt bezahlter Kontext.
|
||||
var client = new FakeChatClient().AlwaysRespondsWithText("- Zusammenfassung.");
|
||||
var compactor = new ContextCompactor(client, TestLogging.Factory);
|
||||
|
||||
var guard = new LoopGuardConfig { MaxContextTokens = 1_000, CompactionThreshold = 0.5 };
|
||||
|
||||
var messages = Conversation.Start()
|
||||
.Repeat(8)
|
||||
.User("EINZIGARTIGE-LETZTE-NACHRICHT")
|
||||
.Build();
|
||||
|
||||
await compactor.CompactIfNeededAsync(messages, 50_000, guard, "test/model", default);
|
||||
|
||||
var summaryPrompt = client.ReceivedRequests[0].Messages.Last().Content!;
|
||||
summaryPrompt.ShouldNotContain("EINZIGARTIGE-LETZTE-NACHRICHT");
|
||||
}
|
||||
}
|
||||
@@ -0,0 +1,79 @@
|
||||
using ClawdDotNet.Core.Engine;
|
||||
using ClawdDotNet.Core.Tests.Infrastructure;
|
||||
using Shouldly;
|
||||
|
||||
namespace ClawdDotNet.Core.Tests.Engine;
|
||||
|
||||
/// <summary>
|
||||
/// T2 aus der Token-Analyse: Ein einzelnes Tool-Ergebnis konnte den Kontext sprengen.
|
||||
/// Ein WebFetch mit dem Standardlimit von 512 KB entspricht rund 130.000 Tokens in
|
||||
/// EINER Antwort — die Compaction greift erst danach, bezahlt ist der Request längst.
|
||||
/// </summary>
|
||||
public sealed class ToolResultTruncationTests
|
||||
{
|
||||
[Fact]
|
||||
public async Task Ein_riesiges_Toolergebnis_wird_gekappt_bevor_es_in_den_Kontext_geht()
|
||||
{
|
||||
var riesig = new string('x', 500_000);
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning(riesig));
|
||||
var agent = fixture.AddAgent("agent-trunc", "TestTool");
|
||||
agent.MaxToolResultChars = 16_000;
|
||||
|
||||
fixture.Client
|
||||
.RespondsWithToolCall("TestTool")
|
||||
.RespondsWithText("Fertig");
|
||||
|
||||
await fixture.Engine.ChatAsync(agent, "Hol die Daten", "test-instance", default);
|
||||
|
||||
var context = fixture.Engine.GetChatContext(agent.AgentId);
|
||||
var toolMessage = context.Single(m => m.Role == "tool");
|
||||
|
||||
toolMessage.Content!.Length.ShouldBeLessThan(20_000);
|
||||
toolMessage.Content.ShouldContain("gekürzt");
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public async Task Ein_kleines_Toolergebnis_bleibt_unveraendert()
|
||||
{
|
||||
const string klein = "Alles in Ordnung.";
|
||||
var fixture = new EngineFixture().WithTool(FakeTool.Returning(klein));
|
||||
var agent = fixture.AddAgent("agent-klein", "TestTool");
|
||||
|
||||
fixture.Client
|
||||
.RespondsWithToolCall("TestTool")
|
||||
.RespondsWithText("Fertig");
|
||||
|
||||
await fixture.Engine.ChatAsync(agent, "Prüfe", "test-instance", default);
|
||||
|
||||
var context = fixture.Engine.GetChatContext(agent.AgentId);
|
||||
context.Single(m => m.Role == "tool").Content.ShouldBe(klein);
|
||||
}
|
||||
|
||||
[Theory]
|
||||
[InlineData(100, 50)]
|
||||
[InlineData(1_000, 999)]
|
||||
[InlineData(50_000, 16_000)]
|
||||
public void Gekappte_Ergebnisse_nennen_die_Menge_der_entfallenen_Zeichen(int length, int limit)
|
||||
{
|
||||
var result = AgentEngine.TruncateToolResult(new string('a', length), limit);
|
||||
|
||||
result.ShouldStartWith(new string('a', limit));
|
||||
result.ShouldContain((length - limit).ToString("N0"));
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Ohne_Limit_wird_nicht_gekappt()
|
||||
{
|
||||
var original = new string('a', 100_000);
|
||||
|
||||
AgentEngine.TruncateToolResult(original, 0).ShouldBe(original);
|
||||
}
|
||||
|
||||
[Fact]
|
||||
public void Genau_auf_der_Grenze_wird_nicht_gekappt()
|
||||
{
|
||||
var original = new string('a', 1_000);
|
||||
|
||||
AgentEngine.TruncateToolResult(original, 1_000).ShouldBe(original);
|
||||
}
|
||||
}
|
||||
Reference in New Issue
Block a user