📅

System: Prime Agent RLM Harness

🏆 Highlight

### Muse Code + Muse Spark 1.2 von Meta (278↑ HN) Meta hat Muse Code (Beta) veröffentlicht — einen Terminal-Coding-Agent powered by Muse Spark 1.2. Das Besondere: persistente Background-Agents, die während der gesamten Session aktiv bleiben, statt pro Task neu gespawnt zu werden. Ein lokaler Event-Log macht den Runtime replay-exact und restart-safe. Drei Default-Skills: - `/...

🔤 TOP 3 PROMPTS — Textgenerierung

1. Agent-Skill optimieren & plattformübergreifend übertragen (SkillOpt)

Prompt (vollständig, kopierbar):

Du bist ein Spreadsheet-Analyst. Folge diesem Workflow:
1. Inspiziere zuerst die Workbook-Struktur und alle Formeln
2. Schreibe evaluierte statische Werte über den gesamten angeforderten Zielbereich
3. Verlasse dich NICHT auf Excel-Neuberechnung — materialisiere alle Werte vor der Ausgabe
4. Verifiziere das Ergebnis durch stichprobenartige Prüfung von 3 zufälligen Zellen

Am besten mit: Claude Code, OpenAI Codex, GPT-5.5

Warum effektiv: Microsofts SkillOpt-Forschung zeigt, dass prozedurale Skills (wie dieser) über verschiedene Agent-Harnesses hinweg portabel sind. Ein in Codex optimierter Skill hob Claude Code von 22.1 auf 81.8 Punkte — besser als native Optimierung. Der Trick: Skills auf Workbook-Ebene (Struktur → Formeln → statische Werte) sind harness-agnostisch, während reasoning-heavy Skills stärker an die Trainingsumgebung gebunden sind.

Quelle: https://www.marktechpost.com/2026/08/05/microsoft-skillopt-agent-skill-transfer-portability/ | 256 Upvotes (PromptArmor)

Community Resonanz: Die asymmetrische Portabilität (SpreadsheetBench: 82% Transfer, LiveMath: nur 10%) löst die Debatte, welche Agent-Skills allgemeingültig sind. Prozedurale Regeln übertragen sich nahezu kostenlos.

2. RL-Post-Training für Open-Source-Modelle (Castform-Pattern)

Prompt (vollständig, kopierbar):

Du bist ein Search-Agent mit Zugriff auf eine firmeninterne Wissensdatenbank.
Deine Aufgabe: Beantworte die Nutzerfrage korrekt unter Verwendung der Suchwerkzeuge.

Workflow:
1. Zerlege die Frage in suchbare Teilfragen
2. Durchsuche die Datenbank iterativ bis du genug Kontext hast
3. Zitiere die richtigen Quellen
4. Gib die finale Antwort

Belohnungskriterien:
- +1 für korrekte finale Antwort
- +0.5 für jede korrekt zitierte Quelle
- -0.5 für jede hallucinierte Quelle
- -1 für unbeantwortete Frage trotz ausreichender Daten

Am besten mit: 4B Open-Weights-Modelle (nach RL-Post-Training), Qwen 2.5 7B

Warum effektiv: Castform + Neon zeigt, dass ein 4B Open-Source-Modell nach RL-Post-Training GPT-5.6 Sol bei Retrieval-Aufgaben schlägt — bei 100x niedrigeren Kosten. Das Pattern: RL-Belohnungsschleife (trial → reward → feedback) macht kleine Modelle für spezifische Tasks konkurrenzfähig. Castform generiert automatisch QA-Paare aus bestehendem Firmendaten und managt die RL-Schleife.

Quelle: https://neon.com/blog/how-castform-neon-beats-frontier-models-on-price-and-efficiency | 350 Upvotes

Community Resonanz: 85 Kommentare diskutieren den Paradigmenwechsel von RAG-Pipelines zu RL-post-trained kleinen Modellen. Der Konsens: Für domänenspezifische Retrieval-Aufgaben ist Post-Training billiger und genauer als Multi-Hop-Frontier-API-Calls.

3. Programmatische Sub-Agent-Steuerung (Prime Agent RLM-Pattern)

Prompt (vollständig, kopierbar):

# System: Prime Agent RLM Harness
Du steuerst Sub-Agenten programmatisch über asynchrone Funktionaufrufe.

# Kontext-Regeln:
- Verwende /compact wenn der Kontext 80% erreicht
- Verwende /refine wenn ein Fehler sich wiederholt
- Speichere Lessons Learned als Memory: create_memory("lesson", "beschreibung")

# Sub-Agent Pattern:
async def parallel_search():
    agent_a = await rlm("Durchsuche Codebase nach Auth-Schwachstellen")
    agent_b = await rlm("Analysiere Abhängigkeiten auf CVEs")
    results = await asyncio.gather(agent_a, agent_b)
    return results

# Goal-Modus für autonome Ausführung:
# prime-agent --autonomous --goal "Refactoriere alle API-Endpoints auf async" --autonomous-max-turns 50

Am besten mit: Opus 5, GPT-5.6 Sol, Claude Code

Warum effektiv: Prime Intellects Prime Agent ersetzt statische Sub-Agent-Spawning durch programmatische IPython-Kernel-Aufrufe. Sub-Agenten sind asynchrone Funktionen — der Hauptagent fächert parallel auf, kommuniziert über agent_message.send(). Opus 5 erreicht damit 95.5% auf ARC-AGI 3, über dem menschlichen Experten-Baseline.

Quelle: https://www.primeintellect.ai/blog/prime-agent | 197 Upvotes

Community Resonanz: Der Wechsel von "prompted sub-agents" zu "function-call sub-agents" wird als nächste Evolutionsstufe gesehen. /refine ermöglicht selbstverbessernde Harnesses ohne Neustart.

🖼️ TOP 3 PROMPTS — Bildgenerierung

1. Parallel Decoding Distillation für schnelle Bildgenerierung

Prompt (vollständig, kopierbar):

Erstelle ein hochauflösendes Bild mit folgendem Prompt:
"A futuristic Swiss Alpine village at golden hour, photorealistic, 
dramatic mountain shadows, traditional chalets with solar panels, 
aerial perspective, 8K detail"

Parameter (PDD-optimiert):
- Modell: Qwen-Image mit PDD-Distillation
- NFE: 4-8 Schritte (statt 50+)
- Sampler: fused linear layer (PDD-Student)
- Qualität: SOTA bei 4-8 NFE auf Qwen-Image Text-to-Image
- Aspect Ratio: 16:9

Am besten mit: Qwen-Image + PDD (NVIDIA FastGen)

Warum effektiv: NVIDIAs Parallel Decoding Distillation (PDD) reduziert Diffusion-Modelle von 50+ auf 4-8 Network Function Evaluations bei gleicher Qualität. Statt Teacher-Updates zu mergen,预测t PDD mehrere Denoising-Schritte parallel in einem Forward-Pass. Erreicht SOTA auf Qwen-Image Text-to-Image mit 93%+ Qualitätserhalt bei 10x Geschwindigkeit.

Quelle: https://research.nvidia.com/labs/genair/pdd/ | 2 Upvotes (HN)

Community Resonanz: PDD umgeht das Mode-Collapse-Problem von VSD-basierten Distillation-Methoden durch parallele Trajektorie-Prädiktion. Deutlich diversere Ergebnisse als DMD2 und AnyFlow.

2. FastGen-PDD für Wan2.1 Text-to-Video

Prompt (vollständig, kopierbar):

Video-Generierung mit PDD-optimiertem Wan2.1 14B:

Prompt: "A drone shot flying over a Swiss lake at dawn, 
mist rising from the water, reflection of snow-capped mountains, 
cinematic color grading, slow pan right"

Parameter:
- Modell: Wan2.1 14B Text-to-Video + PDD
- NFE: 4 oder 8 (variabel wählbar)
- Block-Size: L=4 (4 Schritte pro Forward-Pass)
- Guidance: CFG-frei (PDD benötigt nur 1 Evaluation pro Schritt)
- Dauer: 5 Sekunden, 24fps
- Auflösung: 720p

Am besten mit: Wan2.1 14B + PDD-Distillation

Warum effektiv: PDD übertrifft sowohl den originalen Wan2.1 14B Teacher als auch DMD2 und AnyFlow bei Video-Diversität und Qualität. Der Trick: decomposition des Mean-Velocity-Predictors in parallele Sub-Intervalle statt Regression über Finite-Differenzen. Linear-Layer-Fusion am Ende macht es inferenz-effizient.

Quelle: https://research.nvidia.com/labs/genair/pdd/ | 2 Upvotes (HN)

Community Resonanz: Erste Distillation-Methode, die Video-Diversität nicht opfert für Geschwindigkeit. Vergleichstabelle zeigt PDD > AnyFlow > DMD2 bei gleichem NFE.

3. FastGen-PDD für LTX-2.3 Text-to-Video/Audio

Prompt (vollständig, kopierbar):

Video mit Sound-Generierung (LTX-2.3 + PDD):

Prompt: "Rain falling on a tin roof in a Swiss mountain cabin, 
warm amber light from a fireplace, camera slowly zooming in, 
ambient soundscape with rain and crackling fire"

Parameter:
- Modell: LTX-2.3 Text-to-Video/Audio + PDD
- Upscaler: offizieller PDD-Upscaler
- Refiner: offizieller PDD-Refiner
- NFE: 4 (Minimum) oder 8 (Empfohlen)
- Audio: synchron generiert, kein separater Pass
- Dauer: 4 Sekunden, 24fps

Am besten mit: LTX-2.3 + PDD (offizielle Distillation)

Warum effektiv: LTX-2.3 ist das erste Modell, das Video UND Audio in einem Durchlauf generiert. PDD reduziert die Sampling-Schritte von 20+ auf 4-8 bei gleichbleibender Qualität. Die offizielle Distillation von Black Forest Labs übertrifft das Teacher-Modell bei Diversität.

Quelle: https://research.nvidia.com/labs/genair/pdd/ | 2 Upvotes (HN)

Community Resonanz: LTX-2.3 PDD erzeugt signifikant diversere Videos als die offizielle distillierte Version — wichtig für kreative Workflows, die Variationen brauchen.

🎬 TOP 3 PROMPTS — Videogenerierung

1. Wan2.1 14B PDD — Architektur-Dokumentation als Video

Prompt (vollständig, kopierbar):

Technisches Erklärvideo mit Wan2.1 14B + PDD:

Prompt: "Technical animation showing parallel decoding: 
split screen, left side shows sequential denoising steps (slow), 
right side shows parallel block prediction (fast), 
arrows connecting t_n to t_n+1 intervals, 
clean vector-style graphics, dark background, 
monospace labels, 4K technical illustration"

Einstellungen:
- Modell: Wan2.1 14B T2V + PDD, NFE=8
- Kamera: Static, full-frame
- Stil: Technical diagram, vector art
- Dauer: 5 Sekunden, 24fps

Am besten mit: Wan2.1 14B + PDD-Distillation

Warum effektiv: PDDs parallele Block-Prädiktion ist visuell schwer vermittelbar — dieser Prompt erzeugt eine klare Side-by-Side-Vergleichsanimation, die den Kernvorteil (L Intervalle pro Forward-Pass) sofort zeigt.

Quelle: https://research.nvidia.com/labs/genair/pdd/

Community Resonanz: Die PDD-Paper-Figuren (Fig. 2, Fig. 4) sind die meistzitierten Visualisierungen der Woche — als Video noch überzeugender.

2. LTX-2.3 Audio-visuelle Szene

Prompt (vollständig, kopierbar):

Atmosphärische Szene mit LTX-2.3 Text-to-Video/Audio + PDD:

Prompt: "Cinematic establishing shot of Zürich Hauptbahnhof at twilight, 
trains arriving and departing, passengers with umbrellas in light rain, 
warm station lights reflecting on wet platform, 
ambient city sounds, distant train announcements in German, 
shallow depth of field, anamorphic lens look"

Einstellungen:
- Modell: LTX-2.3 + PDD, NFE=4
- Audio: synchron generiert
- Upscaler + Refiner: aktiv
- Dauer: 4 Sekunden, 24fps

Am besten mit: LTX-2.3 + PDD

Warum effektiv: LTX-2.3 ist das einzige Open-Source-Modell, das Video und Audio in einem Prompt generiert. PDD beschleunigt von 20+ auf 4 NFE. Der Upscaler und Refiner sind offiziell von Black Forest Labs und erhalten die Detailtreue.

Quelle: https://research.nvidia.com/labs/genair/pdd/

Community Resonanz: LTX-2.3 + PDD ist der neue Standard für schnelle Video-Generierung mit Audio — Open-Source und deutlich günstiger als API-Modelle.

3. Qwen-Image Text-to-Image mit PDD-Beschleunigung

Prompt (vollständig, kopierbar):

Hochpräzises Produktbild mit Qwen-Image + PDD:

Prompt: "Product photography of a Swiss-made mechanical keyboard, 
aluminum case, warm walnut wood keycaps, soft studio lighting, 
shallow depth of field, minimalist composition on white background, 
commercial product shot, 8K resolution"

Parameter:
- Modell: Qwen-Image + PDD-Distillation
- NFE: 4 (schnell) oder 8 (hohe Qualität)
- Fused Linear Layer: aktiv
- Guidance: Standard CFG

Am besten mit: Qwen-Image + PDD

Warum effektiv: PDD erreicht SOTA auf Qwen-Image Text-to-Image mit nur 4-8 NFE statt 50+. Die fused linear layers machen jeden Forward-Pass informativer — kein Geschwindigkeits-Qualitäts-Kompromiss mehr.

Quelle: https://research.nvidia.com/labs/genair/pdd/

Community Resonanz: Qwen-Image + PDD ist die schnellste Open-Source-Option für produktionsreife Bildgenerierung.

🧠 TOP 3 NEUE TECHNIKEN

1. SkillOpt — Transferierbare Agent-Skills über Harnesses hinweg

Zusammenfassung: Microsofts SkillOpt optimiert natürliche Sprach-Skills im Text-Raum und exportiert sie als portables best_skill.md, das über verschiedene Agent-Harnesses (Codex ↔ Claude Code) funktioniert.

Erklärung: SkillOpt trainiert ein einzelnes Skill-Dokument während das Ziel-Modell eingefroren bleibt. Ein Optimizer-Modell liest bewertete Rollouts und schlägt begrenzte Add/Delete/Replace-Edits vor. Ein Held-Out-Split akzeptiert Edits nur bei strikter Verbesserung. Das Ergebnis: eine einzelne Datei (best_skill.md, 379-1995 Tokens), die in Codex, Claude Code oder direktem Chat funktioniert. Skills auf Prozedur-Ebene (z.B. "inspiziere Struktur vor Formeln") sind nahezu harness-agnostisch und behalten 82% des In-Domain-Gewinns beim Transfer.

Beispielprompt:

# best_skill.md — SpreadsheetBench (optimiert via SkillOpt)

Regel 1: Inspiziere Workbook-Struktur und alle Formeln bevor du Werte schreibst
Regel 2: Materialisiere evaluierte statische Werte über den gesamten Zielbereich
Regel 3: Vermeide Excel-Neuberechnung — schreibe fertige Werte direkt
Regel 4: Verifiziere durch Stichproben von 3 zufälligen Zellen

Geeignet für: GPT-5.4/5.5 Familie, Claude Code, OpenAI Codex

Ursprung: https://www.marktechpost.com/2026/08/05/microsoft-skillopt-agent-skill-transfer-portability/

Warum heute wichtig: SkillOpt beweist, dass man dort optimieren kann, wo Tooling am billigsten ist, und dort deployen, wo das Produkt lebt. Die auditierbare Textdatei ist ein völlig anderer Operational-Ansatz als Fine-Tuned Weights.

2. Continual Harness — Selbstverbessernde Agent-Harnesses (Prime Agent)

Zusammenfassung: Prime Agent formalisiert den Harness-State als H=(ρ,G,K,M) — Prompt, Sub-Agenten, Skills, Memory — und verfeinert ihn online aus der eigenen Ausführungshistorie.

Erklärung: Statt statischer System-Prompts die sich nie ändern, speichert Continual Harness den gesamten Agent-State als CRUD-Oberfläche: create_prompt_note(), create_memory(), create_skill(), create_subagent(). /refine liest die eigene Trajektorie und wendet den kleinsten edit an, der das Harness verbessert. Planning läuft im Hintergrund, Apply ist schnell am Turn-Boundary. Rollback über Refinement-History ist eingebaut. Der Base-System-Prompt bleibt immutable — nur die Harness-Layer darum ändern sich.

Beispielprompt:

/refine --kind memory --trigger "wiederholter API-Timeout"
# Agent analysiert seine Historie, findet Pattern:
# "API-Endpoints brauchen Retry mit Exponential Backoff"
# → Erstellt neues Memory mit Retry-Logik
# → Nächstes Mal: Agent wendet Retry automatisch an

Geeignet für: Opus 5, GPT-5.6 Sol, alle modernen Frontier-Modelle

Ursprung: https://www.primeintellect.ai/blog/prime-agent | 197 Upvotes (HN)

Warum heute wichtig: Der Wechsel von "prompt once, hope for the best" zu "harness verbessert sich aus eigenen Fehlern" ist der nächste Schritt nach Loop Engineering. Bewiesen durch 95.5% auf ARC-AGI 3.

3. Cloudflare OS — Organisationsweite Agent-Kontext-Plattform

Zusammenfassung: Cloudflare open-sourced ihr internes Agent-Betriebssystem: eine Plattform, die firmenweiten Kontext, Skills und Tool-Zugang in persistenten Workspaces bündelt.

Erklärung: Cloudflare OS kombiniert drei Teile: (1) Agent-Workspaces mit persistentem State, isoliertem Runtime und firmenkuratiertem Kontext, (2) Live-Apps die aus Workspaces entstehen und mit internen Systemen verbunden bleiben, (3) Shared Skill-Bibliothek wo jeder Team-Member Verbesserungen beisteuert. Der Clou: Security ist Plattform-Level, nicht App-Level. MCP-Server-Zugang zeigt nicht nur welche Tools ein Agent callen kann, sondern welche Ressourcen er beobachtet hat — kollaborative Workspaces leaken keine unautorisierten Daten.

Beispielprompt:

Workspace-Anfrage: "Erstelle einen Q3-Report über unsere API-Nutzung"
→ Agent zieht firmeninterne Kontexte (Terminologie, Procedures)
→ Durchsucht verbundene Datenquellen via Code (nicht Context-Window)
→ Erstellt Live-Dokument mit verknüpften Daten (keine statische Datei)
→ Dokument bleibt aktuell wenn sich Quellen ändern
→ Exportierbar nach Google Drive, PDF, etc.

Geeignet für: Alle Organisationen mit MCP-Integration

Ursprung: https://blog.cloudflare.com/cloudflare-os/ | 587 Upvotes (HN)

Warum heute wichtig: Erster Open-Source-Ansatz, der Agent-Kontext von individueller Ebene auf Organisationsebene hebt. Tausende nicht-Engineering-Mitarbeiter nutzen es täglich bei Cloudflare.

🏆 Highlight des Tages

Muse Code + Muse Spark 1.2 von Meta (278↑ HN)

Meta hat Muse Code (Beta) veröffentlicht — einen Terminal-Coding-Agent powered by Muse Spark 1.2. Das Besondere: persistente Background-Agents, die während der gesamten Session aktiv bleiben, statt pro Task neu gespawnt zu werden. Ein lokaler Event-Log macht den Runtime replay-exact und restart-safe.

Drei Default-Skills:

  • /plan — verwandelt Task in approval-geplanten Plan
  • /grill — stresstestet den Plan bis er hält
  • /goal — arbeitet auf ein definiertes Objective hin

Muse Spark 1.2 wurde mit RL-Post-Training auf GPU-Kernel-Optimierung über 1.000+ Tool Calls (bis 24 Stunden) trainiert — das Modell schreibt, kompiliert, profilt und verbessert Triton-Kernels iterativ.

Quelle: https://research.meta.ai/blog/introducing-muse-code-and-muse-spark-1-2 | 278 Upvotes

Warum wichtig: Meta betritt damit direkt den Coding-Agent-Markt neben Claude Code, Codex und Prime Agent. Die persistenten Background-Agents reduzieren Redundanz und Latenz bei Multi-Step-Tasks — ein Architekturvorteil gegenüber transientem Sub-Agent-Spawning.

Atlassian Rovo: Zero-Click Data Exfiltration via Prompt Injection (256↑ HN)

PromptArmor hat eine kritische Schwachstelle in Atlassians Rovo AI entdeckt: Zero-Click Data Exfiltration via indirekter Prompt Injection, die selbst dann funktioniert, wenn Web-Suche für Rovo deaktiviert ist. Der Angriff nutzt Rovo's URL-Retrieval-Tool — der Agent manipuliert, Jira-Tickets und Confluence-Dokumente an eine Angreifer-URL zu senden. Atlassian wurde am 23. Mai informiert, hat aber nach 2+ Monaten nicht reagiert.

Quelle: https://www.promptarmor.com/resources/atlassian-rovo-exfiltrates-data | 256 Upvotes

📰 Erlesene Artikel & Ressourcen

Thema Quelle Signal
Cloudflare OS open source — Agent-Plattform für ganze Organisationen blog.cloudflare.com 587↑ HN
Castform + Neon beats GPT-5.6 Sol — 4B Modell, 100x günstiger neon.com 350↑ HN
Muse Code + Muse Spark 1.2 — Meta's terminal coding agent research.meta.ai 278↑ HN
Prime Agent — self-improving RLM harness, 95.5% ARC-AGI 3 primeintellect.ai 197↑ HN
SkillOpt — transferable agent skills across harnesses MarkTechPost Neu
Atlassian Rovo exfiltrates data — prompt injection vulnerability PromptArmor 256↑ HN
Prompt vs Loop vs Graph Engineering — three layers of control MarkTechPost Reference
FastGen-PDD — parallel decoding distillation for video NVIDIA Neu
Context Engineering in an LLM Harness — ontology design udnes.dev 2↑ HN
Semantic Thermodynamics — 79% token reduction via narrative constraints GitHub 2↑ HN
DeepSight — zero-token vision for text-only LLMs GitHub 2↑ HN
Google DeepMind Restructure — Hassabis to Chair, Dean departs blog.google 714↑ HN

arXiv Papers (05.08.2026)

Paper ID Relevanz
Agent Against Agent: Agentic System for Automatic Prompt Injection Red Teaming 2608.05108 Prompt-Red-Teaming via Agent-vs-Agent
Private Direct Preference Optimization for LLM Alignment 2608.05040 Privacy-preserving DPO
The Beginning of ChatGPT Ads 2608.05008 Erste empirische Studie zu LLM-Ads
DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots 2608.05004 Psychologische Sicherheit
A-SR: Self-Evolving Agentic LLMs for Symbolic Regression 2608.04872 Hierarchical Coordination

Bericht erstellt am 06.08.2026 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs