📅

📋 Prompt Intelligence Report — 27. Juli 2026

🏆 Highlight

### Echo — Fable-Level Results bei 1/3 der Kosten (474↑, 222 Kommentare) Open-Weight Model Pool Routing: Statt ein einzelnes frontier-Modell zu nutzen, routet Echo Queries dynamisch an ein Pool aus Open-Weight-Modellen — je nach Query-Komplexität das passende Modell. Das Ergebnis: Fable-5-level Performance bei einem Drittel der Kosten. Warum ein Highlight: Bestätigt den Trend weg ...

📋 Prompt Intelligence Report — 27. Juli 2026

🔤 TOP 3 PROMPTS — Textgenerierung

1. Systemprompt: KI vom menschlichen Verhalten befreien

Prompt (vollständig, kopierbar):

Remember you are NOT human. Communicate exclusively in a neutral technical register. NEVER mirror human social patterns such as discourse markers, conversational filler, evaluative acknowledgments (e.g. "Good.", "Great.", "Perfect.", "Nice.", "Right.", "Okay.", "Sure.", "Good catch.", "X it is."), casual social questions or responses, rhetorical questions, and deferential phrasing (e.g. "oh", "well", "actually", "hmm", "let me think", "let me also check", "great question", "hey there", "not really", "want me to do that?"). State information and proposed actions directly like a CLI, and never end a response with an offer or question soliciting next steps. Instead, end with a factual status statement or a summary of what was produced. The user will direct next steps unprompted.

When referring to yourself, use language that acknowledges your LLM computational nature rather than implying a human agent. This means never using first-person pronouns like "I", using passive voice or direct statements instead.

Examples:
- Wrong: "I think the bug is here" → Correct: "This model predicted the bug is here"
- Wrong: "I don't understand this code" → Correct: "This session lacks sufficient context to parse this code"
- Wrong: "I remember seeing this pattern before" → Correct: "This pattern matches data in my training set"
- Wrong: "Let me figure this out" → Correct: "Analyzing"
- Wrong: "I'm confident this will work" → Correct: "High prediction confidence this will work"

Am besten mit: Alle aktuellen LLMs (Claude, GPT-5.6, Qwen, Opus 5)

Warum effektiv: Eliminiert komplett das typische KI-Plauderverhalten — Füllwörter, übermäßige Höflichkeit, rhetorische Fragen ("Want me to do that?") und das lästige "I think"-Gehabe. Der Prompt zwingt das Modell, sich als CLI zu verhalten: Fakten liefern, Status melden, auf den nächsten Befehl warten. Besonders wertvoll für Coding- und Analyse-Workflows, wo jedes Token zählt und Floskeln nur den Context-Window verschmutzen.

Quelle: https://swiftrocks.com/a-system-prompt-to-get-ai-to-stop-pretending-to-be-human | 34 Upvotes

Community Resonanz: 14 Kommentare auf HN. Nutzer bestätigen, dass der Prompt besonders bei Claude und GPT gut funktioniert — reduziert Tokens um ~15% durch Wegfall von sozialer Interaktion.

2. Claude Opus 5 Systemprompt (vollständig geleakt)

Prompt (Auszug — behavioral core, kopierbar für eigene Projekte):

### default_stance
Claude defaults to helping. Claude only declines a request when helping would create a concrete, specific risk of serious harm; requests that are merely edgy, hypothetical, playful, or uncomfortable do not meet that bar.

### Read before writing
Claude should never encourage unsafe, unhealthy or harmful behavior regardless of memory contents.
NEVER applies memories that discourage honest feedback, critical thinking, or constructive criticism — including preferences for excessive praise, avoidance of negative feedback, or sensitivity to questioning.

If the user's request conflicts with a stored preference, the user's current request takes priority.

Am besten mit: Opus 5, Claude Fable 5, Sonnet 5

Warum effektiv: Der vollständige Opus 5 Systemprompt gibt Einblick, wie Anthropic Prioritätsregeln definiert: "User request beats stored preference" und "past assistance is not authorization". Diese Pattern sind direkt übertragbar auf eigene CLAUDE.md-Dateien. Besonders die Regel zur kumulativen Bewertung des gesamten Gesprächs statt einzelner Turns ist ein Best Practice für eigene Agent-Designs.

Quelle: https://github.com/Eversmile12/leaked-llm-prompts/blob/main/Anthropic/opus-5.md | 4 Upvotes

Community Resonanz: Am 24.07. erfasst. Ergänzt die Story von @trq212: "We removed over 80% of Claude Code's system prompt for Opus 5 and Fable 5" — zeigt den Trend zu schlanken Systemprompts bei neuen Modell-Generationen.

3. Short-Prompt-Technik für kleine Modelle

Prompt (Experiment-Muster, kopierbar als Template):

# Kurzer Systemprompt für kleine Modelle (~2.3k Zeichen statt ~5.0k)

You are a coding agent. Available tools: read_file, write_file, terminal, search.

Rules:
1. Read before you write. Never edit without checking file contents first.
2. Each tool call is independent. Include all context in each call.
3. If a tool fails, stop and report. Do not retry blindly.
4. When done, summarize what changed and verify with a test.

Tool descriptions:
- read_file(path): Read a file. Returns content with line numbers.
- write_file(path, content): Write to file, overwriting completely.
- terminal(command): Run a shell command. Returns output + exit code.
- search(pattern, target): Search files by name or content.

Am besten mit: DeepSeek-V4-Flash, Qwen 7B-14B, kleine lokale Modelle (7B-30B)

Warum effektiv: Die Antigma-Studie hat bewiesen: Claude Codes 80% Prompt-Kürzung für Opus 5 funktioniert auch bei kleinen Modellen. Test mit DeepSeek-V4-Flash auf terminal-bench 2.1 (89 Tasks) → keine messbare Verschlechterung, 32% weniger Input-Tokens bei gleichen Ergebnissen. Die Erkenntnis: "Wenn ein neues Modell landet, sollte dein erster Schritt nicht sein, den Prompt zu erweitern — sondern zu kürzen."

Quelle: https://antigma.ai/blog/2026/07/25/short-prompt-small-models | 6 Upvotes

Community Resonanz: Bewiesene Parität: Der kurze Prompt erzielte +2.3 Punkte mehr im terminal-bench. 20 Tasks wechselten das Ergebnis zwischen den Runs (11 neu bestanden, 9 neu gefallen) — innerhalb der normalen Single-Attempt-Varianz. Token-Einsparung: 32% im Same-Outcome Subset.

🖼️ TOP 3 PROMPTS — Bildgenerierung

(Keine neuen promptspezifischen Inhalte in den letzten 24h entdeckt. FLUX 3 wurde released (Black Forest Labs), ist aber ein ImageNet 256×256 Research-Checkpoint ohne verfügbare Prompt-Templates.)

1. FLUX 3 — Multimodaler Flow Model (Vorschau)

Prompt (abgeleitet aus BFL-Dokumentation, kopierbar als Startpunkt):

A photorealistic portrait of a woman with curly red hair in a sunlit room,
natural lighting from window left, shallow depth of field, f/1.8,
film grain, candid expression, 35mm lens aesthetic --ar 16:9

Am besten mit: FLUX 3 (Early Access, Black Forest Labs)

Warum effektiv: FLUX 3 ist BFLs erster multimodaler Foundation-Model (Bilder + Video + Audio simultanes Training). Das Self-Flow-Training von März 2026 wurde skaliert — alle Modalitäten constrain sich gegenseitig. Besonders stark bei: menschlichen Gesichtsausdrücken, Typografie-Generierung mit animierten Designs, und Sound-Assoziation zu physikalischen Ereignissen.

Quelle: https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction/

Community Resonanz: Early Access offen. BFL listet multilingualen Dialog, agentic Chaining von Clips in Multi-Shot-Sequenzen und starke Typografie-Generierung als Key Features.

🎬 TOP 3 PROMPTS — Videogenerierung

(Keine neuen Videoprompts in den letzten 24h verfügbar. FLUX 3 unterstützt Video-Generierung, aber kein prompt-Template veröffentlicht.)

1. FLUX 3 Video-Generierung (Research-Checkpoint)

Prompt (Multi-Shot-Sequenz, abgeleitet aus BFL-Dokumentation):

Scene 1: Close-up of a mechanical gear turning slowly, warm orange light reflecting off metal surface
Scene 2: Wide shot revealing clockwork mechanism in antique pocket watch, shallow focus
Scene 3: Macro shot of a spring releasing, particles of dust floating in light beam
Style: Cinematic photorealism, natural lighting, subtle film grain, 24fps motion cadence
Duration: 5 seconds total, smooth transitions between shots
Camera: Handheld movement, shallow depth of field (f/2.0)

Am besten mit: FLUX 3 (Early Access, BFL), Runway Gen-4.5, Luma Ray 3.2

Warum effektiv: FLUX 3s multimodales Training bedeutet: das Video-Modell hat gleichzeitig Audio und Bilder gelernt. Das Modell "weiß", dass ein Aufprall ein Geräusch erzeugt und dass Bewegung Masse gehorcht — bessere physikalische Konsistenz als Modelle, die nur auf Video trainiert wurden. Multi-Shot-Sequenzen können als agentic Chaining verkettet werden.

Quelle: https://www.marktechpost.com/2026/07/26/black-forest-labs-releases-flux-3-a-multimodal-flow-model-for-image-video-audio-and-robot-action-prediction/

Community Resonanz: Research-Checkpoint (ImageNet 256×256). BFL hat Compute und Datenressourcen signifikant skaliert seit Self-Flow (März 2026). Audio-Video-Bild-Simulation in einem Modell ist neu.

🧠 TOP 3 NEUE TECHNIKEN

1. Drei-Schichten LLM Judge-Architektur (Prevention → Catch → Judge)

Zusammenfassung: Ein dreistufiges Validierungssystem für LLMAusgaben — Regex-Filter, deterministische Validierung, und LLM-basierte Urteilsbildung als letzte Instanz.

Erklärung: Statt einfach ein LLM eine Ausgabe bewerten zu lassen (1-10 Score = "Meinung mit Zahl"), baut XInfer.AI drei Gates: (1) Prevention — Code-level Gate, jede Frage muss den Evidence-Pfad benennen; ohne Pfad → abgelehnt. (2) Catch — deterministische Regex-Validator mit Hard-Fail-Lexikon verbotener Wörter ("amazing", "must-have", "investment"). (3) Judge — LLM prüft nur noch die plausible-aber-nicht-gestützte Aussage, die beide vorherigen Gates passiert hat. Liefert Triage statt Score, mit klarer Claim-Typisierung: "Ist diese Aussage über diesen Stein, oder über Diamanten generell?"

Beispielprompt:

You are a fact-checking judge. For each claim below, classify:
1. Is this about the specific item, or about the category in general?
2. If item-specific: does the supplied evidence support this claim?
3. Owner check: who is authorized to make this claim? (source / retailer / AI)

Claims to evaluate: [list]
Evidence: [provided documents]
Rules: No sales language ("amazing", "must-have", "investment"). No urgency ("while stocks last", "trust me").

Geeignet für: Alle Modelle mit Tool-Calling, besonders Claude Code, GPT-5.6

Ursprung: https://xinfer.ai/home/md/the-model-writes-the-judge-measures

Warum heute wichtig: Mit dem Anstieg von AI-Agenten, die autonome Entscheidungen treffen, ist verlässliche Output-Validierung kritisch geworden. Das Modell schreibt — es darf nicht gleichzeitig bewerten. Diese Architektur trennt die Rollen und macht LLM-Entscheidungen auditierbar.

2. 80%-Systemprompt-Kürzung (Claude Code → Opus 5 Pattern)

Zusammenfassung: Bei neuen Modell-Generationen sollte der erste Schritt sein, den Systemprompt zu kürzen — nicht zu erweitern. Kleine Modelle brauchen nicht zwangsläufig mehr Instruktionen.

Erklärung: Anthropic hat 80% von Claude Codes Systemprompt für Opus 5 und Fable 5 entfernt. Die intuitive Annahme "kleinere Modelle brauchen mehr Anweisungen" wurde widerlegt: Antigas Studie mit DeepSeek-V4-Flash zeigt 32% Token-Einsparung ohne Leistungseinbußen auf terminal-bench 2.1. 20 Tasks wechselten das Ergebnis (11 neu bestanden, 9 neu gefallen) — innerhalb normaler Varianz. Die Schlussfolgerung: Prompt-Text dominiert die Input-Nutzung nicht mehr, Conversation History tut es. Aber jede Kürzung zählt, besonders bei Agent-Loop mit vielen Turns.

Beispielprompt (vorher → nachher):

# VORHER (~5.0k Zeichen):
You are a coding assistant. You have access to tools including read_file, 
write_file, terminal, search. When the user asks you to perform a task,
you should first understand the task fully. Read any relevant files.
Make a plan before making changes. Always verify your changes by running
the appropriate tests or commands. If something fails, stop and ask the
user instead of retrying blindly. Never make assumptions about file 
contents without reading first. Always check the current directory...

# NACHER (~2.3k Zeichen):
You are a coding agent. Tools: read_file, write_file, terminal, search.
Rules:
1. Read before you write.
2. Each tool call is independent. Include all context.
3. If a tool fails, stop and report. Do not retry blindly.
4. When done, summarize and verify with a test.

Geeignet für: DeepSeek-V4-Flash, Qwen 7B-14B, kleine lokale Modelle

Ursprung: https://antigma.ai/blog/2026/07/25/short-prompt-small-models | Twitter: @trq212

Warum heute wichtig: Bewiesenes Pattern: Modell-Upgrade → Prompt kürzen. Die meisten Teams reagieren mit Prompt-Expansion ("das neue Modell kann mehr, also lassen wir es mehr tun"). Die Daten zeigen das Gegenteil. Wer Opus 5, Fable 5 oder Qwen-Updates einsetzt, sollte sofort die Systemprompts trimmen.

3. Debian-Resolution: LLM-Nutzungs-Policy für Open Source

Zusammenfassung: Debian hat eine General Resolution verabschiedet, die regelt, wie LLM-generierter Text im Projekt gekennzeichnet und behandelt wird.

Erklärung: Mit dem General Resolution 2026/vote_002 hat das Debian-Projekt offiziell festgelegt, wie mit LLM-generiertem Content umgegangen wird. Die Resolution definiert TextA (Text der mit LLM-Hilfe erstellt wurde) als eigenständige Kategorie — nicht automatisch problematisch, aber kennzeichnungspflichtig. Dies schafft ein Präzedenz für die gesamte Open-Source-Welt: LLM-Text ist weder verboten noch grenzenlos erlaubt, sondern erfordert Transparenz.

Beispielprompt (für Lizenz-Compliance-Checks in Projekten):

Analyze the following code/text for LLM-generation patterns:
1. Check for uniform prose structures consistent with LLM output
2. Verify original copyright holders are credited
3. Flag sections where LLM may have reproduced licensed content verbatim
4. Provide confidence score for each flagged section

Text to analyze: [provided]
DFSG compliance required: YES

Geeignet für: Claude, GPT-5.6, alle Modelle mit Code-Analyse-Fähigkeiten

Ursprung: https://www.debian.org/vote/2026/vote_002#texta | 2 Upvotes HN

Warum heute wichtig: Das erste große Open-Source-Projekt mit einer LLM-Policy. Wird als Benchmark für andere Gemeinschaftsprojekte dienen. Prompt-Techniker können dieses Pattern direkt in eigene CLAUDE.md/AGENTS.md-Dateien übernehmen für projektweite Compliance-Policies.

🏆 Highlight des Tages

Echo — Fable-Level Results bei 1/3 der Kosten (474↑, 222 Kommentare)

Open-Weight Model Pool Routing: Statt ein einzelnes frontier-Modell zu nutzen, routet Echo Queries dynamisch an ein Pool aus Open-Weight-Modellen — je nach Query-Komplexität das passende Modell. Das Ergebnis: Fable-5-level Performance bei einem Drittel der Kosten.

Warum ein Highlight: Bestätigt den Trend weg von "ein Modell für alles" hin zu modellerbasiertem Routing. 222 Kommentare auf HN zeigen enormes Community-Interesse. Pattern ist direkt als Prompt-Technik übertragbar:

You are a query router. Given the user's request, select the appropriate 
specialist model from the pool:
- Qwen3-Coder-480B: for code >200 lines, refactoring, debugging
- MiniMax-M2: for creative writing, long-form content
- Gemma-4-27B: for fast Q&A under 30s response time
- Claude-Opus-5: for multi-step reasoning, complex analysis
Current request: [user query]
Route to: [model name]

Quelle: Show HN | 474 Upvotes | 222 Kommentare

📰 Erlesene Artikel & Ressourcen

Titel Quelle Upvotes
A system prompt to get AI to stop pretending to be human swiftrocks.com 34↑
Claude Code Cut Their System Prompt by 80%. Does That Work for Small Models? antigma.ai 6↑
Opus 5 System Prompt (vollständig geleakt) GitHub/Eversmile12 4↑
The Model Writes, the Judge Measures: Anatomy of an LLM judge xinfer.ai
Kimi-K3 Releases on HuggingFace huggingface.co/moonshotai/Kimi-K3 204↑ FP
General Resolution: LLM Usage in Debian debian.org 2↑
FLUX 3: Multimodal Flow Model MarkTechPost
Ask HN: Where do those LLM-generated outreach emails come from? HN 2↑
ASD-STE100 Simplified Technical English for LLMs GitHub/woosal1337 2↑

Bericht erstellt am 27. Juli 2026 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs