🤖 Daily Prompt Intelligence — 07. August 2026
🔤 TOP 3 PROMPTS — Textgenerierung
1. Experten-Signal-Prompt für LLM-Antworten (Tao-Pattern)
Prompt (vollständig, kopierbar):
Ich arbeite an folgendem Problem: [konkrete Problemstellung].
Mein aktueller Ansatz: [dein bisheriger Ansatz].
Ich suche eine präzise Antwort auf folgende Frage: [spezifische Frage].
Hinweise zu meiner Expertise: [1-2 Sätze über deinen Hintergrund]. Bitte antworte auf diesem Niveau — keine Einführungen, keine Erklärungen von Grundlagen.
Am besten mit: GPT-5.6 Sol, Claude Sonnet 4
Warum effektiv: Terence Tao demonstriert, dass kurze, zielgerichtete Nachrichten mit Signalisierung von Fachwissen das LLM in den "Expert-to-Expert"-Modus versetzen. Das Modell liefert knappere, substanziellere Antworten ohne Fülltext. Tao signalisiert Kompetenz durch präzise Formulierung, nicht durch lange Instruktionen.
Quelle: https://www.seangoedecke.com/llms-reward-expertise/ | 1399 Upvotes (HN)
Community Resonanz: Der Artikel dominiert HN mit dem Kern-Argument: "The most important skill in prompting is expertise in the domain you're prompting for." Kommentare bestätigen das Pattern — Experten erhalten qualitativ andere Antworten als Anfänger.
2. Muse Code /goal Objective-Prompt
Prompt (vollständig, kopierbar):
/goal Implementiere eine [Feature-Beschreibung] mit folgenden Anforderungen:
- [Anforderung 1]
- [Anforderung 2]
Konventionen: [Tests schreiben, keine production code ändern, Framework X nutzen]
Budget: [maximale Tool-Calls / Iterationen]
Am besten mit: Muse Code (Meta Muse Spark 1.2), Claude Code
Warum effektiv: Muse Code von Meta nutzt drei Skills: /plan erstellt einen approval-gated Plan, /grill stresst den Plan bis er robust ist, /goal arbeitet auf das Ziel hin. Der /goal-Prompt ist besonders mächtig, weil er den Agenten mit persistentem Event-Log und Crash-Recovery arbeiten lässt. Meta testete damit GPU-Kernel-Optimierung über 1000+ Tool-Calls in 24 Stunden.
Quelle: https://www.marktechpost.com/2026/08/05/meta-superintelligence-labs-releases-muse-code/ | MarkTechPost
Community Resonanz: Muse Code läuft als Beta auf macOS/Linux. Besonderheit: Async-Background-Agenten, die unabhängig vom Hauptagenten weiterlaufen — kein redundantes Information-Gathering.
3. Microsoft RPI-Code-Test-Prompt
Prompt (vollständig, kopierbar):
Analysiere das Repository unter [Pfad] und identifiziere Code ohne ausreichende Tests.
Für jede gefundene Stelle:
1. Lies die existierenden Tests auf Konventionen und Patterns
2. Finde die echten Build- und Test-Kommandos
3. Schreibe Unit-Tests die:
- Die benannten Test-Frameworks und Dateipfade nutzen
- Edge Cases und Mutation Testing abdecken
- Keine externen URLs, Ports oder Timing-Abhängigkeiten haben
- Assertions für alle benannten Szenarien enthalten
4. Baue das Workspace und führe die vollständige Testsuite aus
Validierung: Wenn Tests grün sind, prüfe ob kleine Code-Änderungen die Tests brechen würden.
Am besten mit: Claude Opus 4.8, GPT-5.5, GitHub Copilot
Warum effektiv: Microsofts code-testing-generator erreicht 92.1% Task-Completion (vs. 78.9% Stock Copilot) durch eine Research-Plan-Implement Pipeline. Der Agent liest erst das Repository, erkennt Sprache und Framework, und wählt dann zwischen Direct, Single-Pass oder Iterativ-Strategie.
Quelle: https://www.marktechpost.com/2026/08/06/microsoft-open-sources-code-testing-generator/ | MarkTechPost
Community Resonanz: Auf 89 vagen Prompts löste der Agent 79 (88.8%) gegenüber 59 (66.3%) bei Stock Copilot — 3× weniger Fehler bei klaren, repository-bewussten Prompts.
🖼️ TOP 3 PROMPTS — Bildgenerierung
1. FLUX 3 Multimodaler Architektur-Prompt
Prompt (vollständig, kopierbar):
Architectural photograph, [Stil: brutalist/minimalist/futuristic] building at [Tageszeit],
dramatic lighting with volumetric rays, reflections on glass surfaces,
wide-angle perspective, photorealistic, 8K resolution --ar 16:9 --v flux3
Am besten mit: FLUX 3 (Black Forest Labs — Early Access)
Warum effektiv: FLUX 3 ist Black Forest Labs' erstes multimodales Foundation-Model (Bilder + Video + Audio + Action Prediction). Es übertrifft Runway Gen-4.5 (77%), Luma Ray 3.2 (93%) und Grok Imagine Video (69%) in Benchmark-Vergleichen. Der multimodale Ansatz bedeutet, dass derselbe Prompt über Modalitäten hinweg konsistente Ergebnisse liefert.
Quelle: https://huggingface.co/blog/ResterChed/flux-3 | HuggingFace Blog
Community Resonanz: FLUX 3 unterstützt Image, Video, Audio und Action Prediction in einem Modell — ein Paradigmenwechsel von single-modality zu multimodalen Flow Models.
2. Liquid AI LFM2.5 On-Device Agent-Prompt
Prompt (vollständig, kopierbar):
Du bist ein spezialisierter Assistent für [Domäne]. Deine Aufgabe: [konkrete Aufgabe].
Verfügbare Tools: [Tool-Liste]
Kontext-Limit: Du hast 128K Token Kontext verfügbar. Nutze ihn strategisch.
Antworte strukturiert:
1. Analyse der Situation
2. Schritt-für-Schritt-Plan
3. Tool-Aufrufe (falls nötig)
4. Ergebnis
Am besten mit: Liquid AI LFM2.5-2.6B (via llama.cpp, vLLM, LM Studio)
Warum effektiv: LFM2.5-2.6B ist ein 2.69B On-Device Agentic Model mit 128K Kontext, Tool Calling und Open Weights. Es schlägt Gemma-4-E2B-it (5.1B) und Qwen3.5-4B (4.7B) in Instruction-Following und Tool-Use-Benchmarks. Läuft lokal auf Edge-Geräten.
Quelle: https://www.marktechpost.com/2026/08/06/liquid-ai-lfm2-5-2-6b-on-device-agentic-model/ | MarkTechPost
Community Resonanz: Verfügbare Formate: GGUF, MLX, ONNX. Unterstützt 16 Sprachen, trainiert auf 34 Billionen Token. Lead in Instruction-Following, nur bei Coding (LiveCodeBench) hinter größeren Modellen.
🎬 TOP 3 PROMPTS — Videogenerierung
1. Cloudflare Kitesurf Browser-Automation Prompt
Prompt (vollständig, kopierbar):
Browser-Task: Besuche [URL] und führe folgende Aktionen aus:
1. Screenshot der Seite (JPEG, 1920x1080)
2. Extrahiere den HTML-Body-Content
3. Finde alle Links mit Text containing "[Keyword]"
4. Speichere Ergebnisse
Parameter:
- viewport: 1920x1080
- timeout: 30s
- wait_for: networkidle
Am besten mit: Cloudflare Kitesurf (Browser Run API), Puppeteer, Playwright
Warum effektiv: Kitesurf läuft komplett in V8-Isolates auf Cloudflare Workers — 3.1× weniger CPU für Screenshots (380ms vs 1173ms Chromium), 4.7× weniger Memory (57.8 MiB vs 271 MiB). Bestehende Puppeteer/Playwright-Clients funktionieren mit einem einzigen browser=kitesurf Parameter.
Quelle: https://www.marktechpost.com/2026/08/06/cloudflare-introduces-kitesurf-an-agent-first-web-browser-that-runs-entirely-in-v8-isolates-on-cloudflare-workers/ | MarkTechPost
Community Resonanz: Public Playground mit injizierten Chrome DevTools verfügbar. Chromium bleibt Fallback für komplexe Seiten.
2. FLUX 3 Video-Generierung Prompt
Prompt (vollständig, kopierbar):
Cinematic establishing shot: [Szene-Beschreibung], camera slowly panning from left to right,
golden hour lighting, natural movement of [Elemente], 4K resolution,
smooth temporal consistency, 5 seconds duration --ar 16:9 --v flux3 --duration 5s
Am besten mit: FLUX 3 (Black Forest Labs)
Warum effektiv: FLUX 3 ist das erste multimodale Modell, das Bilder und Video im selben Architektur-Flow generiert. Beatet etablierte Video-Modelle in Benchmarks: Runway Gen-4.5 (77%), Luma Ray 3.2 (93%), Grok Imagine Video (69%).
Quelle: https://huggingface.co/blog/ResterChed/flux-3 | HuggingFace Blog
Community Resonanz: Early Access offen. Flow-based Multimodal-Architektur ermöglicht konsistente Cross-Modalität-Generierung.
🧠 TOP 3 NEUE TECHNIKEN
1. HarnessOpt-Bench: LLMs als Harness-Optimierer
Zusammenfassung: Erster Benchmark für automatisierte Harness-Optimierung — LLMs verbessern Prompts, Tools und Control-Flow anderer Agenten systematisch.
Erklärung: Die arXiv-Paper 2608.06301 (August 2026) führt HarnessOpt-Bench ein: ein Benchmark, der misst, wie gut Frontier-LLMs die "Harness" (Prompts, Tools, Control-Flow, Memory, Orchestration) anderer Agenten optimieren können. Ein Optimizer-LLM erhält einen Seed-Harness, Feedback aus Evaluationen, und einen festen Budget. Es editiert den Harness und nominiert einen finalen Kandidaten, der gegen einen held-out Test-Partition bewertet wird.
Beispielprompt:
Optimiere folgende Agent-Harness für bessere Performance:
[Seed-Harness: aktueller Prompt + Tools + Config]
Evaluations-Feedback: [Ergebnisse der letzten Runs]
Budget: [maximale Iterationen]
Ziel: Maximiere die durchschnittliche Score auf dem Test-Set.
Du darfst den System-Prompt, Tool-Definitionen und Control-Flow ändern.
Geeignet für: Claude Opus 5, GPT-5.6 Sol
Ursprung: https://arxiv.org/abs/2608.06301v1 | arXiv 2608.06301
Warum heute wichtig: Zeigt, dass native Harnesses nicht konsistent überlegen sind — externe Optimierer können bestehende Agent-Architekturen signifikant verbessern. 111 scored Runs über 4 Downstream-Tasks.
2. AsyncGRPO: Agent-Training mit Loop-Owning
Zusammenfassung: TRLs neue AsyncGRPO-Methode trainiert Coding Agents, die ihren eigenen Loop ausführen — der Trainer lernt von den exakten Tokens, die der Agent produziert.
Erklärung: Bisher trieb der Trainer den Loop (sample turn → parse tool calls → run → feed back). AsyncGRPO lässt den Agenten komplett eigenständig laufen, während TRL auf den exakten Tokens des Harness trainiert. Das ermöglicht RL-Training für beliebige Agent-Architekturen (Claude Code, Pi, Codex, OpenCode, Cursor). HuggingFace testete erfolgreich mit Qwen3-8B auf DeepCoder-Datensatz, Reward stieg von ~0.4 auf ~0.6 über 110 Steps.
Beispielprompt:
from trl.experimental.async_grpo import AsyncGRPOConfig, AsyncGRPOTrainer
config = AsyncGRPOConfig(
model_name="Qwen/Qwen3-8B",
num_iterations=110,
reward_fn="dense_verifier_with_penalties",
max_steps=10,
)
# Agent läuft autonom, Trainer lernt parallel
trainer = AsyncGRPOTrainer(config)
trainer.train()
Geeignet für: Qwen3-8B, OpenCode Harness, HuggingFace Sandboxes
Ursprung: https://huggingface.co/blog/sergiopaniego/trl-openenv-harness-training | HuggingFace Blog
Warum heute wichtig: Eröffnet RL-Training für Coding Agents ohne manuelle Loop-Implementierung. Die Harbor-Integration wird bald eine Matrix von Agents (Claude Code, Codex, Cursor) über denselben Pfad trainierbar machen.
3. Prime Agent RLM: Sub-Agents als Function Calls
Zusammenfassung: Prime Intellects RLM-Harness behandelt Sub-Agent-Delegation als Function Calls im REPL — ARC-AGI-3: 95.5% (über menschlichem Expert-Baseline).
Erklärung: Der Recursive Language Model (RLM) Ansatz formalisiert Context als Variable und Sub-Agenten als Function Calls. Der Continual Harness behandelt Prompts, Sub-Agenten, Skills und Memory als CRUD-State. Agenten kommunizieren nur innerhalb der "nuclear family" (parent, sibling, child). /refine liest die eigene Trajektorie und wendet minimale Edits an. Auf ARC-AGI-3 erreicht Prime Agent mit Opus 5: 95.5% RHAE Best@1 (menschlicher Baseline: 95.4%).
Beispielprompt:
/refine
Lies die Agenten-Trajektorie der letzten 10 Schritte.
Identifiziere den kleinsten relevanten Edit am aktuellen Prompt/Harness.
Wende den Edit an und dokumentiere:
- Trigger: Was hat die Änderung ausgelöst?
- Outcome: Erwartetes Ergebnis
- Revert-ID: Für Rückgängig-Option
Geeignet für: Opus 5, GLM-5.2, GPT-5.6 Sol
Ursprung: https://www.marktechpost.com/2026/08/06/prime-intellect-releases-prime-agent/ | MarkTechPost
Warum heute wichtig: Niedrigerer Token-Verbrauch als native Harnesses durch Function-Call-Delegation statt separater Sessions. Case Studies: EmulatorBench (SEGA Genesis + Game Boy Color aus Specs), PMPP-Hard (GPU-Kernel-Verifikation), Factorio (100K+ Production Score).
🏆 Highlight des Tages
AI Agent Permissions: Menschen übersehen 1 in 3 Bedrohungen
Das Story: In einer Studie mit 40.000 simulierten Runs genehmigten Menschen 1 von 3 bedrohlichen AI-Agent-Befehlen. Die ScaleX-Studie zeigt, dass selbst aufmerksame Reviewer systematisch bestimmte Arten von Agent-Befehlen übersehen — besonders wenn Befehle in legitimen Workflows eingebettet sind.
Prompt-Insight daraus: Agent-Permissions sollten nicht rein menschlich reviewed werden. Ein systematischer Ansatz:
Agent Permission Review Checklist:
1. Dateizugriff: Liest/schreibt der Agent Dateien außerhalb des Arbeitsverzeichnisses?
2. Netzwerkkommunikation: Sendet der Agent Daten nach außen?
3. Authentifizierung: Nutzt der Agent gespeicherte Credentials?
4. Eskalation: Kann der Agent weitere Befehle mit höheren Rechten ausführen?
5. Persistenz: Erst der Agent persistente Einträge (Cron, Registry, SSH-Keys)?
Automatisierte Prüfung:
- Prüfe alle Tool-Calls auf Pfade außerhalb von [Arbeitsverzeichnis]
- Blockiere alle ausgehenden Netzwerk-Calls außer [Allowlist-Domains]
- Logging aller Credential-Zugriffe
Quelle: https://scalex.dev/blog/ai-agent-permissions-stats/ | 298 Upvotes (HN)
Warum wichtig: Mit der Explosion von Coding Agents (Muse Code, Prime Agent, OpenCode) wird Agent-Sicherheit zur praktischen Notwendigkeit, nicht nur Theorie.
📰 Erlesene Artikel & Ressourcen
GPT-5.6 Sol Verbesserungen (233↑ HN) — OpenAI verbessert GPT-5.6 Sol in ChatGPT und erweitert GPT-5.6 Luna-Zugang für Free Users. → https://openai.com/index/improving-gpt-5-6-sol-in-chatgpt/
LLMs Reward Expertise (1399↑ HN) — Sean Goedecke: Domain-Wissen ist der wichtigste Faktor für gute LLM-Ergebnisse, nicht Prompting-Tricks. Terence Tao zeigt das Muster. → https://www.seangoedecke.com/llms-reward-expertise/
Meta Muse Code Beta — Terminal Coding Agent mit Muse Spark 1.2 Model, async Background Agents, Event-Log mit Crash-Recovery, Skills: /plan, /grill, /goal. → https://www.marktechpost.com/2026/08/05/meta-superintelligence-labs-releases-muse-code/
Liquid AI LFM2.5-2.6B — On-Device Agentic Model, 128K Kontext, Tool Calling, Open Weights. Verfügbar in GGUF, MLX, ONNX. → https://www.marktechpost.com/2026/08/06/liquid-ai-lfm2-5-2-6b-on-device-agentic-model/
Microsoft code-testing-generator — Open-Source Polyglot Unit-Test Agent, 92.1% Task Completion (vs. 78.9% Copilot). RPI-Pipeline: Research-Plan-Implement. → https://www.marktechpost.com/2026/08/06/microsoft-open-sources-code-testing-generator/
Cloudflare Kitesurf — Agent-First Web Browser in V8-Isolates, 4.7× weniger Memory als Chromium. Puppeteer/Playwright kompatibel. → https://www.marktechpost.com/2026/08/06/cloudflare-introduces-kitesurf-an-agent-first-web-browser-that-runs-entirely-in-v8-isolates-on-cloudflare-workers/
HarnessOpt-Bench (arXiv 2608.06301) — Erster Benchmark für Harness-Optimierung durch LLMs. 5 Frontier-Modelle, 111 Runs, 4 Tasks. → https://arxiv.org/abs/2608.06301v1
TRL AsyncGRPO für Coding Agents — Training von Coding Agents mit OpenEnv + OpenCode Harness. Qwen3-8B auf DeepCoder: Reward 0.4→0.6. → https://huggingface.co/blog/sergiopaniego/trl-openenv-harness-training
Bericht erstellt am 07. August 2026 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs