T1 — Prompt-Caching. Bisher wurde bei jedem Schritt eines Runs der komplette Prompt neu berechnet, inklusive Tool-Definitionen und System-Prompt, die sich nie aendern. Bei zehn Schritten und einem 15k-Praefix sind das 150.000 statt 15.000 Eingabe-Tokens. ChatMessage bekommt dafuer einen eigenen JsonConverter: Der Inhalt geht weiterhin als String raus, bei gesetztem CacheBreakpoint jedoch als Blockarray mit cache_control. Beim Lesen werden beide Formate akzeptiert, damit bestehende ChatContext.json weiter geladen werden koennen. PromptCache setzt zwei Breakpoints: einen auf den System-Prompt (deckt Tool-Definitionen und System-Prompt ab) und einen rollierenden auf die letzte Nachricht mit Inhalt. Vorherige Markierungen werden vorher entfernt, damit sie sich nicht ansammeln. Aktivierung ueber promptCaching: auto (Default, aktiv fuer Modelle mit Unterstuetzung), on oder off. Der wichtigste Test dazu prueft die Praefix-Stabilitaet: Der System-Prompt muss ueber alle Schritte zeichengleich serialisiert werden. Ein einziger Zeitstempel darin wuerde den Cache still verwerfen — die Kosten blieben unveraendert, ohne dass es irgendwo auffiele. T9 — Usage liest prompt_tokens_details.cached_tokens; die Zahl wird bis in AgentRunResult durchgereicht. Ohne sie liesse sich die Wirkung nicht belegen. T2 — Tool-Ergebnisse werden jetzt zentral in ExecuteToolCallAsync gekappt (maxToolResultChars, Default 16.000). Bisher konnte ein einzelner WebFetch mit dem 512-KB-Standardlimit rund 130.000 Tokens in EINER Antwort erzeugen; die Compaction griff erst danach, bezahlt war der Request laengst. T3 — Die Zusammenfassung beim Kompaktieren laeuft ueber ein konfigurierbares summaryModel (Default gemini-2.5-flash) statt ueber das teure Agentenmodell. B4 — AgentRunResult fuehrt Prompt- und Completion-Tokens getrennt; die Kostenanzeige schaetzte bisher 50/50, real liegt das Verhaeltnis eher bei 95:5. Die veraltete Preistabelle bleibt offen. Neue Einstellungen sind im PropertyGrid sichtbar und werden vom AgentEditor bei neuen Agenten mitgeschrieben. Alle 91 Tests gruen. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
80 lines
2.7 KiB
C#
80 lines
2.7 KiB
C#
using ClawdDotNet.Core.Engine;
|
|
using ClawdDotNet.Core.Tests.Infrastructure;
|
|
using Shouldly;
|
|
|
|
namespace ClawdDotNet.Core.Tests.Engine;
|
|
|
|
/// <summary>
|
|
/// T2 aus der Token-Analyse: Ein einzelnes Tool-Ergebnis konnte den Kontext sprengen.
|
|
/// Ein WebFetch mit dem Standardlimit von 512 KB entspricht rund 130.000 Tokens in
|
|
/// EINER Antwort — die Compaction greift erst danach, bezahlt ist der Request längst.
|
|
/// </summary>
|
|
public sealed class ToolResultTruncationTests
|
|
{
|
|
[Fact]
|
|
public async Task Ein_riesiges_Toolergebnis_wird_gekappt_bevor_es_in_den_Kontext_geht()
|
|
{
|
|
var riesig = new string('x', 500_000);
|
|
var fixture = new EngineFixture().WithTool(FakeTool.Returning(riesig));
|
|
var agent = fixture.AddAgent("agent-trunc", "TestTool");
|
|
agent.MaxToolResultChars = 16_000;
|
|
|
|
fixture.Client
|
|
.RespondsWithToolCall("TestTool")
|
|
.RespondsWithText("Fertig");
|
|
|
|
await fixture.Engine.ChatAsync(agent, "Hol die Daten", "test-instance", default);
|
|
|
|
var context = fixture.Engine.GetChatContext(agent.AgentId);
|
|
var toolMessage = context.Single(m => m.Role == "tool");
|
|
|
|
toolMessage.Content!.Length.ShouldBeLessThan(20_000);
|
|
toolMessage.Content.ShouldContain("gekürzt");
|
|
}
|
|
|
|
[Fact]
|
|
public async Task Ein_kleines_Toolergebnis_bleibt_unveraendert()
|
|
{
|
|
const string klein = "Alles in Ordnung.";
|
|
var fixture = new EngineFixture().WithTool(FakeTool.Returning(klein));
|
|
var agent = fixture.AddAgent("agent-klein", "TestTool");
|
|
|
|
fixture.Client
|
|
.RespondsWithToolCall("TestTool")
|
|
.RespondsWithText("Fertig");
|
|
|
|
await fixture.Engine.ChatAsync(agent, "Prüfe", "test-instance", default);
|
|
|
|
var context = fixture.Engine.GetChatContext(agent.AgentId);
|
|
context.Single(m => m.Role == "tool").Content.ShouldBe(klein);
|
|
}
|
|
|
|
[Theory]
|
|
[InlineData(100, 50)]
|
|
[InlineData(1_000, 999)]
|
|
[InlineData(50_000, 16_000)]
|
|
public void Gekappte_Ergebnisse_nennen_die_Menge_der_entfallenen_Zeichen(int length, int limit)
|
|
{
|
|
var result = AgentEngine.TruncateToolResult(new string('a', length), limit);
|
|
|
|
result.ShouldStartWith(new string('a', limit));
|
|
result.ShouldContain((length - limit).ToString("N0"));
|
|
}
|
|
|
|
[Fact]
|
|
public void Ohne_Limit_wird_nicht_gekappt()
|
|
{
|
|
var original = new string('a', 100_000);
|
|
|
|
AgentEngine.TruncateToolResult(original, 0).ShouldBe(original);
|
|
}
|
|
|
|
[Fact]
|
|
public void Genau_auf_der_Grenze_wird_nicht_gekappt()
|
|
{
|
|
var original = new string('a', 1_000);
|
|
|
|
AgentEngine.TruncateToolResult(original, 1_000).ShouldBe(original);
|
|
}
|
|
}
|