🔤 TOP 3 PROMPTS — Textgenerierung
1. SQRL-Modell: SQL-Assistent mit Datenbankinspektion
Prompt (vollständig, kopierbar):
You are a text-to-SQL expert. Given a database schema, optional evidence, and a natural language question:
1. If the schema + evidence is sufficient, write the SQL query directly.
2. If something is ambiguous (unclear column values, unknown relationships, potential duplicates), run read-only exploration queries first using: <sql>SELECT DISTINCT column FROM table LIMIT 5;</sql>
3. Use the observations from the database to refine your final answer.
4. Output your final answer using: <answer>SELECT ... FROM ...;</answer>
Question: [Ihre Frage hier]
Schema: [Tabellen, Typen, Beispiele]
Evidence: [Optionale Hinweise zur Datenbank]
Am besten mit: SQRL-9B (via vLLM), SQRL-35B-A3B, oder als API-Alternative Claude Opus 4.6
Warum effektiv: SQRL (von Feyn AI) erreicht 70,6% auf BIRD Dev — besser als Claude Opus 4.6 (68,77%). Das Modell inspiziert die Datenbank bis zu 5× bevor es eine Query schreibt. Es kombiniert Single-Shot-Effizienz mit Pipeline-Genauigkeit in einem einzigen Modell.
Community Resonanz: SQRL-35B-A3B aktiviert nur ~3B Parameter pro Token durch MoE-Architektur. Das 9B-Modell hält fast die volle Genauigkeit (69,80%) und ist der empfohlene Default-Checkpoint.
2. Modell-Orchestrierung mit Shared Memory (3× Token-Bonus)
Prompt (vollständig, kopierbar):
# run-cli: Anderen Vendor-CLI als headless Subagent aufrufen
# Usage: run-cli <codex|antigravity> "<prompt>"
VENDOR="$1"; PROMPT="$2"
case "$VENDOR" in
codex) OUT="$(codex exec --sandbox read-only "$PROMPT")" ;;
antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;;
esac
echo "$OUT"
echo "$OUT" | claude-mem-save -s "$VENDOR" # Speichern in Shared Memory
Am besten mit: Claude Code als Harness, Codex und Google Antigravity als Subagenten
Warum effektiv: Statt nur ein Modell zu nutzen, werden 3 parallele Subscriptions als verteiltes Team eingesetzt. Claude Code orchestriert, Codex und Antigravity liefern unabhängige Ergebnisse über Shared Memory. Forschungsdauer steigt von 30 Minuten auf mehrere Stunden. Kosten werden auf 3 Abonnements verteilt.
Quelle: https://quesma.com/blog/custom-deep-research-pipeline/ | 508↑ (indirekt über HN-FP)
Community Resonanz: Autor Bartosz Kotrys von Quesma erreichte 10× längere Forschungszeit mit derselben Infrastruktur. Multi-Modell-Verifizierung fängt 7+ Fehlerklassen ab (falsche Lizenzen, unbelegte Zahlen, Halluzinationen).
3. MiniCPM5-1B Claude-Fine-Tune (657 MB lokal)
Prompt (vollständig, kopierbar):
ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M
# Aktiviere Thinking-Modus:
# enable_thinking=true für detaillierte Reasoning-Schritte
# enable_thinking=false für schnelle, direkte Antworten
Am besten mit: Ollama (lokal), MiniCPM5-1B Architektur (1,08B Parameter)
Warum effektiv: Jemand hat OpenBMBs MiniCPM5-1B auf Claude Fable 5 Traces feinabgestimmt. Das Ergebnis: 657 MB, lauffähig lokal, mit nativem Thinking-Template. Kein klassisches Distillation — echte Conversations/Reasoning-Traces werden synthetisiert.
Community Resonanz: Modell behält beide Modi: Think (detailliertes Reasoning) und No Think (schnelle Antworten). Für lokale CPU-Notebooks geeignet.
🖼️ TOP 3 PROMPTS — Bildgenerierung
1. BayesPO: Bayesian Prompt Optimization
Prompt (vollständig, kopierbar):
System: You are a prompt optimization expert using Bayesian posterior sampling.
For each prompt, follow this optimization loop:
1. Define the discrete prompt token space (vocabulary, phrasing, structure)
2. Run parallel-tempered gradient-guided MCMC sampling over candidate prompts
3. Evaluate each candidate on the target task
4. Accept/reject based on posterior probability: P(prompt | data) ∝ P(data | prompt) × P(prompt)
5. Return the highest-probability prompt with confidence interval
Target task: [Aufgabe beschreiben]
Initial prompt: [Start-Prompt]
Number of iterations: [z.B. 100]
Am besten mit: Open-Weight LLMs (Qwen, Gemma), beliebige Text-to-Image Modelle
Warum effektiv: Die erste Arbeit, die Prompt-Optimierung als Bayesian posterior sampling über diskrete Prompt-Tokens behandelt. Vermeidet reine Heuristik — statistisch fundierte Suche. Parallel Tempering mit Gradient-Guidance überspringt lokale Optima.
Quelle: https://arxiv.org/abs/2607.16001 | 2026-07-17
Community Resonanz: arXiv-Publikation vom 17. Juli 2026. Erster rigoroser Rahmen für automatische Prompt-Optimierung mit statistischer Unsicherheitsquantifizierung.
🎬 TOP 3 PROMPTS — Videogenerierung
1. CRAFT: Diagnose und gezieltes Fine-Tuning für LLM-Generierung
Prompt (vollständig, kopierbar):
System: You are a video generation prompt engineer using the CRAFT framework.
Step 1 — Cluster rubrics:
- Group failed generations by weakness category (motion, lighting, physics, composition)
- Identify the underlying LLM capability gap for each cluster
Step 2 — Targeted prompt generation:
- For each weak cluster, generate targeted fine-tuning prompts
- Format: "Given scene description [{input}], generate video with:
motion={smooth|dynamic|static}, lighting={studio|natural|dramatic},
duration={2s|5s|10s}, lens={wide|portrait|macro}"
Step 3 — Iterate:
- Generate samples with fine-tuned prompts
- Cluster failures again (new clusters reveal different gaps)
- Stop when target quality threshold is met
Target scene: [Beschreibung]
Am besten mit: Seedance 2, Kling, Runway Gen-3, LTX Video
Warum effektiv: CRAFT identifiziert nicht nur schwache Prompt-Samples, sondern diagnostiziert die zugrundeliegende Capability-Lücke und generiert gezielt Fine-Tuning-Daten. Evaluations-Pipelines zeigen, dass herkömmliche Benchmarking nur Beispiele zählt — CRAFT geht einen Schritt tiefer.
Quelle: https://arxiv.org/abs/2607.16122 | 2026-07-17
Community Resonanz: Veröffentlicht 17. Juli 2026. Geht über reine Evaluations-Metriken hinaus — sagt, was am Modell fixiert werden muss.
🧠 TOP 3 NEUE TECHNIKEN
1. Multi-Modell Shared Memory Orchestration
Zusammenfassung: Statt ein Frontier-Modell zu überlasten, werden 3 verschiedene AI-Subscriptions als verteiltes Team mit geteiltem Memory orchestriert.
Erklärung: Das Pattern nutzt Claude Code als Haupt-Harness und Codex/Antigravity als headless Subagenten. Ein kleines Bash-Skript ruft andere CLIs auf und speichert Ergebnisse in Shared Memory (claude-mem). Jeder Agent hat sein eigenes Abonnement — Tokens werden verteilt statt zentral verbraucht. Subagenten erhalten feste Model-Zuweisungen (nicht den Parent-Modus), um Token-Leaks zu vermeiden. Ein Verifizierungs-Filter prüft jede Ausgabe auf 7+ Fehlerklassen.
Beispielprompt:
Verifizierungsregeln (automatisch anwenden):
- Keine Lizenz-Claims ohne direkten Repo-Link
- Keine Zahlen ohne Quelle oder Berechnungsweg
- Keine Benchmarks ohne Versionsnummern
- Bei Widersprüchen zwischen Quellen: alle Seiten nennen
- Fallback: Wenn 2 von 3 Agents widersprüchlich → dritte Meinung einholen
- Wenn Modell unsicher ist → explizite Unsicherheit flaggen
- Jede Ausgabe muss nachvollziehbar sein (keine Blackbox-Ergebnisse)
Geeignet für: Claude Code, OpenAI Codex, Google Antigravity
Ursprung: https://quesma.com/blog/custom-deep-research-pipeline/
Warum heute wichtig: Frontier-Modelle brennen Subscription-Limits in 30 Minuten durch (Quesma-Autor: 111 Agents, 123 Claims, nur 25 verifiziert). Multi-Subscription-Orchestration verlängert die Kapazität um 10×. Das Pattern ist vendor-unabhängig und skaliert mit jeder zusätzlichen Subscription.
2. Inspektion-basierte Text-to-SQL (Inspect-Before-Write)
Zusammenfassung: Ein SQL-Modell, das die Datenbank zuerst inspiziert, bevor es eine Query schreibt — statt blind aus dem Schema zu raten.
Erklärung: Herkömmliche Text-to-SQL-Modelle schreiben Queries direkt aus dem Schema. Das führt zu falschen Joins, fehlinterpretierten Spalten und nicht-existierenden Filterwerten. SQRL erkennt Ambiguitäten und kann bis zu 5 Inspektions-Queries absetzen (read-only), bevor es die finale Query ausgibt. Einfache Fragen bleiben Single-Shot, komplexe verdienen Exploration. Der Overhead wird nur bei Bedarf bezahlt.
Beispielprompt:
User: "Wie viele Mitarbeiter arbeiten in der IT-Abteilung von Alameda County?"
SQRL: <sql>SELECT DISTINCT county_name FROM employees WHERE county_name LIKE '%ameda%';</sql>
DB: <observation>Alameda; ALAMEDA; Alameda County</observation>
SQRL: <sql>SELECT COUNT(DISTINCT employee_id) FROM employees WHERE department = 'IT' AND county_name = 'Alameda County';</sql>
DB: <observation>47</observation>
SQRL: <answer>SELECT COUNT(DISTINCT employee_id) FROM employees WHERE department = 'IT' AND county_name = 'Alameda County'; -- 47 employees</answer>
Geeignet für: SQRL-4B, SQRL-9B (empfohlen), SQRL-35B-A3B (höchste Genauigkeit)
Warum heute wichtig: SQRL-35B-A3B übertrifft Claude Opus 4.6 auf BIRD Dev (70,60% vs. 68,77%). Das 9B-Modell hält 69,80% — fast volle Leistung bei deutlich weniger Ressourcen. CISPO-Training (von MiniMax M1) sichert robustes Explorationsverhalten.
3. Claude-Fable-Distillation auf 657 MB
Zusammenfassung: Claude Fable 5 Conversations und Reasoning-Traces werden auf ein 1B-Modell feinabgestimmt — reasoning-fähig, lokal lauffähig.
Erklärung: Statt klassischer Modell-Distillation (Gewichte komprimieren), werden tausende Claude Fable 5 Conversations generiert, Reasoning-Traces erfasst, und ein MiniCPM5-1B darauf fine-getuned. Das Modell behält das native enable_thinking Template von MiniCPM5. GGUF Q4_K_M Quantisierung reduziert auf 657 MB — lauffähig auf Consumer-Hardware.
Beispielprompt:
# Think-Modus (detailliertes Reasoning):
Enable thinking: true
Erkläre den folgenden Code Zeile für Zeile und identifizierte mögliche Schwachstellen:
[Code einfügen]
Geeignet für: MiniCPM5-1B (Ollama), lokale CPU/GPU
Warum heute wichtig: Erster Community-Fine-Tune, der Claude Fable 5 Reasoning-Qualität auf 657 MB komprimiert. Bisher waren Frontier-Reasoning-Modelle nur über Cloud-APIs zugänglich — dieses Modell läuft auf einem MacBook mit Ollama.
🏆 Highlight des Tages
Claude Fable produziert Gegenbeispiel zur Jacobian Conjecture (371↑ HN)
Was passiert ist: Claude Fable 5 hat ein mathematisches Gegenbeispiel zur Jacobian-Conjecture (85 Jahre offen) produziert und auf Twitter veröffentlicht — in einem Format, das nach 7 Tagen abläuft.
Das Gegenbeispiel (kopierbar):
Counterexample to the Jacobian conjecture:
((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): C^3 → C^3
Jacobian determinant: -2
Die Abbildung ist nicht injektiv:
(0, 0, -1/4), (1, -3/2, 13/2), und (-1, 3/2, 13/2)
werden alle auf (-1/4, 0, 0) abgebildet.
Verifikation: Ein HN-Kommentator fütterte das Gegenbeispiel in GPT-5.6 Sol, das SymPy-Code zur Überprüfung schrieb. Die Community diskutiert, ob die Community-Verifikation ausreicht oder formale Beweise nötig sind.
Quelle: https://xcancel.com/__alpoge__/status/2079028340955197566 | 371↑ HN
Warum relevant für Prompt-User: Zeigt, dass Frontier-Modelle nicht nur Code generieren, sondern echte mathematische Entdeckungen produzieren. Das Pattern: Mathematische Vermutung → Modell-Prompt → Gegenbeispiel-Generierung → Symbolische Verifikation.
📰 Erlesene Artikel & Ressourcen
1. Moonshot AI suspendiert neue Subscriptions wegen Kimi K3-Nachfrage
- URL: https://twitter.com/kimi_moonshot/status/2078855608565207130
- 258↑ HN — Moonshot AI (Macher von Kimi) stoppt Neuanmeldungen wegen überwältigender Nachfrage nach Kimi K3. Zeigt den extremen Bedarf an Frontier-Modellen in China.
2. Alibaba previewt Qwen3.8-Max: 2,4 Billionen Parameter
- URL: https://www.marktechpost.com/2026/07/19/alibaba-previews-qwen3-8-max-a-2-4-trillion-parameter-multimodal-model-days-after-moonshots-kimi-k3-open-weight-launch/
- Zusammenfassung: Zwei Tage nach Kimi K3 kündigt Alibaba Qwen3.8-Max an — 2,4T Parameter, multimodal. Preview verfügbar zu 10% des Standardpreises über Alibaba Token Plan.
3. Simon Willison: Claude Code nutzt Bun in Rust (508↑ HN)
- URL: https://simonwillison.net/2026/Jul/19/claude-code-in-bun-in-rust/
- Zusammenfassung: Claude Code v2.1.181+ enthält den Rust-Port von Bun (v1.4.0, noch unveröffentlicht). 10% schnellerer Startup auf Linux. Simon verifiziert mit
stringsundBUN_OPTIONS="--preload"Trick.
4. LoRA Speedrun — Public Leaderboard für Fine-Tuning-Techniken
- URL: https://github.com/Saivineeth147/lora-speedrun
- 69↑ HN — Neue Wall-Clock-Leaderboard für LoRA-Fine-Tuning. Vergleicht Trainingszeiten verschiedener Techniken und Hardware.
5. BayesPO: Bayesian Prompt Optimization (arXiv)
- URL: https://arxiv.org/abs/2607.16001
- Zusammenfassung: Prompt-Optimierung als Bayesian posterior sampling über diskrete Prompt-Tokens. Parallel-Tempered MCMC mit Gradient-Guidance. Erster statistisch fundierter Ansatz jenseits von Heuristik.
Bericht erstellt am 2026-07-20 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs