📅

🤖 Daily Prompt Intelligence — 07. August 2026

🏆 Highlight

### AI Agent Permissions: Menschen übersehen 1 in 3 Bedrohungen Das Story: In einer Studie mit 40.000 simulierten Runs genehmigten Menschen 1 von 3 bedrohlichen AI-Agent-Befehlen. Die ScaleX-Studie zeigt, dass selbst aufmerksame Reviewer systematisch bestimmte Arten von Agent-Befehlen übersehen — besonders wenn Befehle in legitimen Workflows eingebettet sind. **Prompt-Insight daraus:*...

🤖 Daily Prompt Intelligence — 07. August 2026

🔤 TOP 3 PROMPTS — Textgenerierung

1. Experten-Signal-Prompt für LLM-Antworten (Tao-Pattern)

Prompt (vollständig, kopierbar):

Ich arbeite an folgendem Problem: [konkrete Problemstellung].

Mein aktueller Ansatz: [dein bisheriger Ansatz].

Ich suche eine präzise Antwort auf folgende Frage: [spezifische Frage].

Hinweise zu meiner Expertise: [1-2 Sätze über deinen Hintergrund]. Bitte antworte auf diesem Niveau — keine Einführungen, keine Erklärungen von Grundlagen.

Am besten mit: GPT-5.6 Sol, Claude Sonnet 4

Warum effektiv: Terence Tao demonstriert, dass kurze, zielgerichtete Nachrichten mit Signalisierung von Fachwissen das LLM in den "Expert-to-Expert"-Modus versetzen. Das Modell liefert knappere, substanziellere Antworten ohne Fülltext. Tao signalisiert Kompetenz durch präzise Formulierung, nicht durch lange Instruktionen.

Quelle: https://www.seangoedecke.com/llms-reward-expertise/ | 1399 Upvotes (HN)

Community Resonanz: Der Artikel dominiert HN mit dem Kern-Argument: "The most important skill in prompting is expertise in the domain you're prompting for." Kommentare bestätigen das Pattern — Experten erhalten qualitativ andere Antworten als Anfänger.

2. Muse Code /goal Objective-Prompt

Prompt (vollständig, kopierbar):

/goal Implementiere eine [Feature-Beschreibung] mit folgenden Anforderungen:
- [Anforderung 1]
- [Anforderung 2]

Konventionen: [Tests schreiben, keine production code ändern, Framework X nutzen]
Budget: [maximale Tool-Calls / Iterationen]

Am besten mit: Muse Code (Meta Muse Spark 1.2), Claude Code

Warum effektiv: Muse Code von Meta nutzt drei Skills: /plan erstellt einen approval-gated Plan, /grill stresst den Plan bis er robust ist, /goal arbeitet auf das Ziel hin. Der /goal-Prompt ist besonders mächtig, weil er den Agenten mit persistentem Event-Log und Crash-Recovery arbeiten lässt. Meta testete damit GPU-Kernel-Optimierung über 1000+ Tool-Calls in 24 Stunden.

Quelle: https://www.marktechpost.com/2026/08/05/meta-superintelligence-labs-releases-muse-code/ | MarkTechPost

Community Resonanz: Muse Code läuft als Beta auf macOS/Linux. Besonderheit: Async-Background-Agenten, die unabhängig vom Hauptagenten weiterlaufen — kein redundantes Information-Gathering.

3. Microsoft RPI-Code-Test-Prompt

Prompt (vollständig, kopierbar):

Analysiere das Repository unter [Pfad] und identifiziere Code ohne ausreichende Tests.

Für jede gefundene Stelle:
1. Lies die existierenden Tests auf Konventionen und Patterns
2. Finde die echten Build- und Test-Kommandos
3. Schreibe Unit-Tests die:
   - Die benannten Test-Frameworks und Dateipfade nutzen
   - Edge Cases und Mutation Testing abdecken
   - Keine externen URLs, Ports oder Timing-Abhängigkeiten haben
   - Assertions für alle benannten Szenarien enthalten
4. Baue das Workspace und führe die vollständige Testsuite aus

Validierung: Wenn Tests grün sind, prüfe ob kleine Code-Änderungen die Tests brechen würden.

Am besten mit: Claude Opus 4.8, GPT-5.5, GitHub Copilot

Warum effektiv: Microsofts code-testing-generator erreicht 92.1% Task-Completion (vs. 78.9% Stock Copilot) durch eine Research-Plan-Implement Pipeline. Der Agent liest erst das Repository, erkennt Sprache und Framework, und wählt dann zwischen Direct, Single-Pass oder Iterativ-Strategie.

Quelle: https://www.marktechpost.com/2026/08/06/microsoft-open-sources-code-testing-generator/ | MarkTechPost

Community Resonanz: Auf 89 vagen Prompts löste der Agent 79 (88.8%) gegenüber 59 (66.3%) bei Stock Copilot — 3× weniger Fehler bei klaren, repository-bewussten Prompts.

🖼️ TOP 3 PROMPTS — Bildgenerierung

1. FLUX 3 Multimodaler Architektur-Prompt

Prompt (vollständig, kopierbar):

Architectural photograph, [Stil: brutalist/minimalist/futuristic] building at [Tageszeit], 
dramatic lighting with volumetric rays, reflections on glass surfaces, 
wide-angle perspective, photorealistic, 8K resolution --ar 16:9 --v flux3

Am besten mit: FLUX 3 (Black Forest Labs — Early Access)

Warum effektiv: FLUX 3 ist Black Forest Labs' erstes multimodales Foundation-Model (Bilder + Video + Audio + Action Prediction). Es übertrifft Runway Gen-4.5 (77%), Luma Ray 3.2 (93%) und Grok Imagine Video (69%) in Benchmark-Vergleichen. Der multimodale Ansatz bedeutet, dass derselbe Prompt über Modalitäten hinweg konsistente Ergebnisse liefert.

Quelle: https://huggingface.co/blog/ResterChed/flux-3 | HuggingFace Blog

Community Resonanz: FLUX 3 unterstützt Image, Video, Audio und Action Prediction in einem Modell — ein Paradigmenwechsel von single-modality zu multimodalen Flow Models.

2. Liquid AI LFM2.5 On-Device Agent-Prompt

Prompt (vollständig, kopierbar):

Du bist ein spezialisierter Assistent für [Domäne]. Deine Aufgabe: [konkrete Aufgabe].

Verfügbare Tools: [Tool-Liste]
Kontext-Limit: Du hast 128K Token Kontext verfügbar. Nutze ihn strategisch.

Antworte strukturiert:
1. Analyse der Situation
2. Schritt-für-Schritt-Plan
3. Tool-Aufrufe (falls nötig)
4. Ergebnis

Am besten mit: Liquid AI LFM2.5-2.6B (via llama.cpp, vLLM, LM Studio)

Warum effektiv: LFM2.5-2.6B ist ein 2.69B On-Device Agentic Model mit 128K Kontext, Tool Calling und Open Weights. Es schlägt Gemma-4-E2B-it (5.1B) und Qwen3.5-4B (4.7B) in Instruction-Following und Tool-Use-Benchmarks. Läuft lokal auf Edge-Geräten.

Quelle: https://www.marktechpost.com/2026/08/06/liquid-ai-lfm2-5-2-6b-on-device-agentic-model/ | MarkTechPost

Community Resonanz: Verfügbare Formate: GGUF, MLX, ONNX. Unterstützt 16 Sprachen, trainiert auf 34 Billionen Token. Lead in Instruction-Following, nur bei Coding (LiveCodeBench) hinter größeren Modellen.

🎬 TOP 3 PROMPTS — Videogenerierung

1. Cloudflare Kitesurf Browser-Automation Prompt

Prompt (vollständig, kopierbar):

Browser-Task: Besuche [URL] und führe folgende Aktionen aus:
1. Screenshot der Seite (JPEG, 1920x1080)
2. Extrahiere den HTML-Body-Content
3. Finde alle Links mit Text containing "[Keyword]"
4. Speichere Ergebnisse

Parameter:
- viewport: 1920x1080
- timeout: 30s
- wait_for: networkidle

Am besten mit: Cloudflare Kitesurf (Browser Run API), Puppeteer, Playwright

Warum effektiv: Kitesurf läuft komplett in V8-Isolates auf Cloudflare Workers — 3.1× weniger CPU für Screenshots (380ms vs 1173ms Chromium), 4.7× weniger Memory (57.8 MiB vs 271 MiB). Bestehende Puppeteer/Playwright-Clients funktionieren mit einem einzigen browser=kitesurf Parameter.

Quelle: https://www.marktechpost.com/2026/08/06/cloudflare-introduces-kitesurf-an-agent-first-web-browser-that-runs-entirely-in-v8-isolates-on-cloudflare-workers/ | MarkTechPost

Community Resonanz: Public Playground mit injizierten Chrome DevTools verfügbar. Chromium bleibt Fallback für komplexe Seiten.

2. FLUX 3 Video-Generierung Prompt

Prompt (vollständig, kopierbar):

Cinematic establishing shot: [Szene-Beschreibung], camera slowly panning from left to right,
golden hour lighting, natural movement of [Elemente], 4K resolution,
smooth temporal consistency, 5 seconds duration --ar 16:9 --v flux3 --duration 5s

Am besten mit: FLUX 3 (Black Forest Labs)

Warum effektiv: FLUX 3 ist das erste multimodale Modell, das Bilder und Video im selben Architektur-Flow generiert. Beatet etablierte Video-Modelle in Benchmarks: Runway Gen-4.5 (77%), Luma Ray 3.2 (93%), Grok Imagine Video (69%).

Quelle: https://huggingface.co/blog/ResterChed/flux-3 | HuggingFace Blog

Community Resonanz: Early Access offen. Flow-based Multimodal-Architektur ermöglicht konsistente Cross-Modalität-Generierung.

🧠 TOP 3 NEUE TECHNIKEN

1. HarnessOpt-Bench: LLMs als Harness-Optimierer

Zusammenfassung: Erster Benchmark für automatisierte Harness-Optimierung — LLMs verbessern Prompts, Tools und Control-Flow anderer Agenten systematisch.

Erklärung: Die arXiv-Paper 2608.06301 (August 2026) führt HarnessOpt-Bench ein: ein Benchmark, der misst, wie gut Frontier-LLMs die "Harness" (Prompts, Tools, Control-Flow, Memory, Orchestration) anderer Agenten optimieren können. Ein Optimizer-LLM erhält einen Seed-Harness, Feedback aus Evaluationen, und einen festen Budget. Es editiert den Harness und nominiert einen finalen Kandidaten, der gegen einen held-out Test-Partition bewertet wird.

Beispielprompt:

Optimiere folgende Agent-Harness für bessere Performance:

[Seed-Harness: aktueller Prompt + Tools + Config]

Evaluations-Feedback: [Ergebnisse der letzten Runs]

Budget: [maximale Iterationen]

Ziel: Maximiere die durchschnittliche Score auf dem Test-Set.
Du darfst den System-Prompt, Tool-Definitionen und Control-Flow ändern.

Geeignet für: Claude Opus 5, GPT-5.6 Sol

Ursprung: https://arxiv.org/abs/2608.06301v1 | arXiv 2608.06301

Warum heute wichtig: Zeigt, dass native Harnesses nicht konsistent überlegen sind — externe Optimierer können bestehende Agent-Architekturen signifikant verbessern. 111 scored Runs über 4 Downstream-Tasks.

2. AsyncGRPO: Agent-Training mit Loop-Owning

Zusammenfassung: TRLs neue AsyncGRPO-Methode trainiert Coding Agents, die ihren eigenen Loop ausführen — der Trainer lernt von den exakten Tokens, die der Agent produziert.

Erklärung: Bisher trieb der Trainer den Loop (sample turn → parse tool calls → run → feed back). AsyncGRPO lässt den Agenten komplett eigenständig laufen, während TRL auf den exakten Tokens des Harness trainiert. Das ermöglicht RL-Training für beliebige Agent-Architekturen (Claude Code, Pi, Codex, OpenCode, Cursor). HuggingFace testete erfolgreich mit Qwen3-8B auf DeepCoder-Datensatz, Reward stieg von ~0.4 auf ~0.6 über 110 Steps.

Beispielprompt:

from trl.experimental.async_grpo import AsyncGRPOConfig, AsyncGRPOTrainer

config = AsyncGRPOConfig(
    model_name="Qwen/Qwen3-8B",
    num_iterations=110,
    reward_fn="dense_verifier_with_penalties",
    max_steps=10,
)

# Agent läuft autonom, Trainer lernt parallel
trainer = AsyncGRPOTrainer(config)
trainer.train()

Geeignet für: Qwen3-8B, OpenCode Harness, HuggingFace Sandboxes

Ursprung: https://huggingface.co/blog/sergiopaniego/trl-openenv-harness-training | HuggingFace Blog

Warum heute wichtig: Eröffnet RL-Training für Coding Agents ohne manuelle Loop-Implementierung. Die Harbor-Integration wird bald eine Matrix von Agents (Claude Code, Codex, Cursor) über denselben Pfad trainierbar machen.

3. Prime Agent RLM: Sub-Agents als Function Calls

Zusammenfassung: Prime Intellects RLM-Harness behandelt Sub-Agent-Delegation als Function Calls im REPL — ARC-AGI-3: 95.5% (über menschlichem Expert-Baseline).

Erklärung: Der Recursive Language Model (RLM) Ansatz formalisiert Context als Variable und Sub-Agenten als Function Calls. Der Continual Harness behandelt Prompts, Sub-Agenten, Skills und Memory als CRUD-State. Agenten kommunizieren nur innerhalb der "nuclear family" (parent, sibling, child). /refine liest die eigene Trajektorie und wendet minimale Edits an. Auf ARC-AGI-3 erreicht Prime Agent mit Opus 5: 95.5% RHAE Best@1 (menschlicher Baseline: 95.4%).

Beispielprompt:

/refine
Lies die Agenten-Trajektorie der letzten 10 Schritte.
Identifiziere den kleinsten relevanten Edit am aktuellen Prompt/Harness.
Wende den Edit an und dokumentiere:
- Trigger: Was hat die Änderung ausgelöst?
- Outcome: Erwartetes Ergebnis
- Revert-ID: Für Rückgängig-Option

Geeignet für: Opus 5, GLM-5.2, GPT-5.6 Sol

Ursprung: https://www.marktechpost.com/2026/08/06/prime-intellect-releases-prime-agent/ | MarkTechPost

Warum heute wichtig: Niedrigerer Token-Verbrauch als native Harnesses durch Function-Call-Delegation statt separater Sessions. Case Studies: EmulatorBench (SEGA Genesis + Game Boy Color aus Specs), PMPP-Hard (GPU-Kernel-Verifikation), Factorio (100K+ Production Score).

🏆 Highlight des Tages

AI Agent Permissions: Menschen übersehen 1 in 3 Bedrohungen

Das Story: In einer Studie mit 40.000 simulierten Runs genehmigten Menschen 1 von 3 bedrohlichen AI-Agent-Befehlen. Die ScaleX-Studie zeigt, dass selbst aufmerksame Reviewer systematisch bestimmte Arten von Agent-Befehlen übersehen — besonders wenn Befehle in legitimen Workflows eingebettet sind.

Prompt-Insight daraus: Agent-Permissions sollten nicht rein menschlich reviewed werden. Ein systematischer Ansatz:

Agent Permission Review Checklist:
1. Dateizugriff: Liest/schreibt der Agent Dateien außerhalb des Arbeitsverzeichnisses?
2. Netzwerkkommunikation: Sendet der Agent Daten nach außen?
3. Authentifizierung: Nutzt der Agent gespeicherte Credentials?
4. Eskalation: Kann der Agent weitere Befehle mit höheren Rechten ausführen?
5. Persistenz: Erst der Agent persistente Einträge (Cron, Registry, SSH-Keys)?

Automatisierte Prüfung:
- Prüfe alle Tool-Calls auf Pfade außerhalb von [Arbeitsverzeichnis]
- Blockiere alle ausgehenden Netzwerk-Calls außer [Allowlist-Domains]
- Logging aller Credential-Zugriffe

Quelle: https://scalex.dev/blog/ai-agent-permissions-stats/ | 298 Upvotes (HN)

Warum wichtig: Mit der Explosion von Coding Agents (Muse Code, Prime Agent, OpenCode) wird Agent-Sicherheit zur praktischen Notwendigkeit, nicht nur Theorie.

📰 Erlesene Artikel & Ressourcen

GPT-5.6 Sol Verbesserungen (233↑ HN) — OpenAI verbessert GPT-5.6 Sol in ChatGPT und erweitert GPT-5.6 Luna-Zugang für Free Users. → https://openai.com/index/improving-gpt-5-6-sol-in-chatgpt/

LLMs Reward Expertise (1399↑ HN) — Sean Goedecke: Domain-Wissen ist der wichtigste Faktor für gute LLM-Ergebnisse, nicht Prompting-Tricks. Terence Tao zeigt das Muster. → https://www.seangoedecke.com/llms-reward-expertise/

Meta Muse Code Beta — Terminal Coding Agent mit Muse Spark 1.2 Model, async Background Agents, Event-Log mit Crash-Recovery, Skills: /plan, /grill, /goal. → https://www.marktechpost.com/2026/08/05/meta-superintelligence-labs-releases-muse-code/

Liquid AI LFM2.5-2.6B — On-Device Agentic Model, 128K Kontext, Tool Calling, Open Weights. Verfügbar in GGUF, MLX, ONNX. → https://www.marktechpost.com/2026/08/06/liquid-ai-lfm2-5-2-6b-on-device-agentic-model/

Microsoft code-testing-generator — Open-Source Polyglot Unit-Test Agent, 92.1% Task Completion (vs. 78.9% Copilot). RPI-Pipeline: Research-Plan-Implement. → https://www.marktechpost.com/2026/08/06/microsoft-open-sources-code-testing-generator/

Cloudflare Kitesurf — Agent-First Web Browser in V8-Isolates, 4.7× weniger Memory als Chromium. Puppeteer/Playwright kompatibel. → https://www.marktechpost.com/2026/08/06/cloudflare-introduces-kitesurf-an-agent-first-web-browser-that-runs-entirely-in-v8-isolates-on-cloudflare-workers/

HarnessOpt-Bench (arXiv 2608.06301) — Erster Benchmark für Harness-Optimierung durch LLMs. 5 Frontier-Modelle, 111 Runs, 4 Tasks. → https://arxiv.org/abs/2608.06301v1

TRL AsyncGRPO für Coding Agents — Training von Coding Agents mit OpenEnv + OpenCode Harness. Qwen3-8B auf DeepCoder: Reward 0.4→0.6. → https://huggingface.co/blog/sergiopaniego/trl-openenv-harness-training


Bericht erstellt am 07. August 2026 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs