📅

run-cli: Anderen Vendor-CLI als headless Subagent aufrufen

🏆 Highlight

### Claude Fable produziert Gegenbeispiel zur Jacobian Conjecture (371↑ HN) Was passiert ist: Claude Fable 5 hat ein mathematisches Gegenbeispiel zur Jacobian-Conjecture (85 Jahre offen) produziert und auf Twitter veröffentlicht — in einem Format, das nach 7 Tagen abläuft. Das Gegenbeispiel (kopierbar): ``` Counterexample to the Jacobian conjecture: ((1+xy)^3 z + y^2 (1+xy) (4+...

🔤 TOP 3 PROMPTS — Textgenerierung

1. SQRL-Modell: SQL-Assistent mit Datenbankinspektion

Prompt (vollständig, kopierbar):

You are a text-to-SQL expert. Given a database schema, optional evidence, and a natural language question:
1. If the schema + evidence is sufficient, write the SQL query directly.
2. If something is ambiguous (unclear column values, unknown relationships, potential duplicates), run read-only exploration queries first using: <sql>SELECT DISTINCT column FROM table LIMIT 5;</sql>
3. Use the observations from the database to refine your final answer.
4. Output your final answer using: <answer>SELECT ... FROM ...;</answer>

Question: [Ihre Frage hier]
Schema: [Tabellen, Typen, Beispiele]
Evidence: [Optionale Hinweise zur Datenbank]

Am besten mit: SQRL-9B (via vLLM), SQRL-35B-A3B, oder als API-Alternative Claude Opus 4.6

Warum effektiv: SQRL (von Feyn AI) erreicht 70,6% auf BIRD Dev — besser als Claude Opus 4.6 (68,77%). Das Modell inspiziert die Datenbank bis zu 5× bevor es eine Query schreibt. Es kombiniert Single-Shot-Effizienz mit Pipeline-Genauigkeit in einem einzigen Modell.

Quelle: https://www.marktechpost.com/2026/07/19/feyn-ai-releases-sqrl-a-text-to-sql-model-family-that-inspects-the-database-before-writing-a-query/

Community Resonanz: SQRL-35B-A3B aktiviert nur ~3B Parameter pro Token durch MoE-Architektur. Das 9B-Modell hält fast die volle Genauigkeit (69,80%) und ist der empfohlene Default-Checkpoint.

2. Modell-Orchestrierung mit Shared Memory (3× Token-Bonus)

Prompt (vollständig, kopierbar):

# run-cli: Anderen Vendor-CLI als headless Subagent aufrufen
# Usage: run-cli <codex|antigravity> "<prompt>"
VENDOR="$1"; PROMPT="$2"
case "$VENDOR" in
  codex)       OUT="$(codex exec --sandbox read-only "$PROMPT")" ;;
  antigravity) OUT="$(agy --model "Gemini 3.1 Pro (High)" -p "$PROMPT")" ;;
esac
echo "$OUT"
echo "$OUT" | claude-mem-save -s "$VENDOR" # Speichern in Shared Memory

Am besten mit: Claude Code als Harness, Codex und Google Antigravity als Subagenten

Warum effektiv: Statt nur ein Modell zu nutzen, werden 3 parallele Subscriptions als verteiltes Team eingesetzt. Claude Code orchestriert, Codex und Antigravity liefern unabhängige Ergebnisse über Shared Memory. Forschungsdauer steigt von 30 Minuten auf mehrere Stunden. Kosten werden auf 3 Abonnements verteilt.

Quelle: https://quesma.com/blog/custom-deep-research-pipeline/ | 508↑ (indirekt über HN-FP)

Community Resonanz: Autor Bartosz Kotrys von Quesma erreichte 10× längere Forschungszeit mit derselben Infrastruktur. Multi-Modell-Verifizierung fängt 7+ Fehlerklassen ab (falsche Lizenzen, unbelegte Zahlen, Halluzinationen).

3. MiniCPM5-1B Claude-Fine-Tune (657 MB lokal)

Prompt (vollständig, kopierbar):

ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M
# Aktiviere Thinking-Modus:
# enable_thinking=true für detaillierte Reasoning-Schritte
# enable_thinking=false für schnelle, direkte Antworten

Am besten mit: Ollama (lokal), MiniCPM5-1B Architektur (1,08B Parameter)

Warum effektiv: Jemand hat OpenBMBs MiniCPM5-1B auf Claude Fable 5 Traces feinabgestimmt. Das Ergebnis: 657 MB, lauffähig lokal, mit nativem Thinking-Template. Kein klassisches Distillation — echte Conversations/Reasoning-Traces werden synthetisiert.

Quelle: https://www.marktechpost.com/2026/07/19/someone-fine-tuned-openbmbs-minicpm5-1b-on-claude-fable-5-traces-to-ship-a-657mb-local-thinking-model/

Community Resonanz: Modell behält beide Modi: Think (detailliertes Reasoning) und No Think (schnelle Antworten). Für lokale CPU-Notebooks geeignet.

🖼️ TOP 3 PROMPTS — Bildgenerierung

1. BayesPO: Bayesian Prompt Optimization

Prompt (vollständig, kopierbar):

System: You are a prompt optimization expert using Bayesian posterior sampling.

For each prompt, follow this optimization loop:
1. Define the discrete prompt token space (vocabulary, phrasing, structure)
2. Run parallel-tempered gradient-guided MCMC sampling over candidate prompts
3. Evaluate each candidate on the target task
4. Accept/reject based on posterior probability: P(prompt | data) ∝ P(data | prompt) × P(prompt)
5. Return the highest-probability prompt with confidence interval

Target task: [Aufgabe beschreiben]
Initial prompt: [Start-Prompt]
Number of iterations: [z.B. 100]

Am besten mit: Open-Weight LLMs (Qwen, Gemma), beliebige Text-to-Image Modelle

Warum effektiv: Die erste Arbeit, die Prompt-Optimierung als Bayesian posterior sampling über diskrete Prompt-Tokens behandelt. Vermeidet reine Heuristik — statistisch fundierte Suche. Parallel Tempering mit Gradient-Guidance überspringt lokale Optima.

Quelle: https://arxiv.org/abs/2607.16001 | 2026-07-17

Community Resonanz: arXiv-Publikation vom 17. Juli 2026. Erster rigoroser Rahmen für automatische Prompt-Optimierung mit statistischer Unsicherheitsquantifizierung.

🎬 TOP 3 PROMPTS — Videogenerierung

1. CRAFT: Diagnose und gezieltes Fine-Tuning für LLM-Generierung

Prompt (vollständig, kopierbar):

System: You are a video generation prompt engineer using the CRAFT framework.

Step 1 — Cluster rubrics:
- Group failed generations by weakness category (motion, lighting, physics, composition)
- Identify the underlying LLM capability gap for each cluster

Step 2 — Targeted prompt generation:
- For each weak cluster, generate targeted fine-tuning prompts
- Format: "Given scene description [{input}], generate video with:
  motion={smooth|dynamic|static}, lighting={studio|natural|dramatic},
  duration={2s|5s|10s}, lens={wide|portrait|macro}"

Step 3 — Iterate:
- Generate samples with fine-tuned prompts
- Cluster failures again (new clusters reveal different gaps)
- Stop when target quality threshold is met

Target scene: [Beschreibung]

Am besten mit: Seedance 2, Kling, Runway Gen-3, LTX Video

Warum effektiv: CRAFT identifiziert nicht nur schwache Prompt-Samples, sondern diagnostiziert die zugrundeliegende Capability-Lücke und generiert gezielt Fine-Tuning-Daten. Evaluations-Pipelines zeigen, dass herkömmliche Benchmarking nur Beispiele zählt — CRAFT geht einen Schritt tiefer.

Quelle: https://arxiv.org/abs/2607.16122 | 2026-07-17

Community Resonanz: Veröffentlicht 17. Juli 2026. Geht über reine Evaluations-Metriken hinaus — sagt, was am Modell fixiert werden muss.

🧠 TOP 3 NEUE TECHNIKEN

1. Multi-Modell Shared Memory Orchestration

Zusammenfassung: Statt ein Frontier-Modell zu überlasten, werden 3 verschiedene AI-Subscriptions als verteiltes Team mit geteiltem Memory orchestriert.

Erklärung: Das Pattern nutzt Claude Code als Haupt-Harness und Codex/Antigravity als headless Subagenten. Ein kleines Bash-Skript ruft andere CLIs auf und speichert Ergebnisse in Shared Memory (claude-mem). Jeder Agent hat sein eigenes Abonnement — Tokens werden verteilt statt zentral verbraucht. Subagenten erhalten feste Model-Zuweisungen (nicht den Parent-Modus), um Token-Leaks zu vermeiden. Ein Verifizierungs-Filter prüft jede Ausgabe auf 7+ Fehlerklassen.

Beispielprompt:

Verifizierungsregeln (automatisch anwenden):
- Keine Lizenz-Claims ohne direkten Repo-Link
- Keine Zahlen ohne Quelle oder Berechnungsweg
- Keine Benchmarks ohne Versionsnummern
- Bei Widersprüchen zwischen Quellen: alle Seiten nennen
- Fallback: Wenn 2 von 3 Agents widersprüchlich → dritte Meinung einholen
- Wenn Modell unsicher ist → explizite Unsicherheit flaggen
- Jede Ausgabe muss nachvollziehbar sein (keine Blackbox-Ergebnisse)

Geeignet für: Claude Code, OpenAI Codex, Google Antigravity

Ursprung: https://quesma.com/blog/custom-deep-research-pipeline/

Warum heute wichtig: Frontier-Modelle brennen Subscription-Limits in 30 Minuten durch (Quesma-Autor: 111 Agents, 123 Claims, nur 25 verifiziert). Multi-Subscription-Orchestration verlängert die Kapazität um 10×. Das Pattern ist vendor-unabhängig und skaliert mit jeder zusätzlichen Subscription.

2. Inspektion-basierte Text-to-SQL (Inspect-Before-Write)

Zusammenfassung: Ein SQL-Modell, das die Datenbank zuerst inspiziert, bevor es eine Query schreibt — statt blind aus dem Schema zu raten.

Erklärung: Herkömmliche Text-to-SQL-Modelle schreiben Queries direkt aus dem Schema. Das führt zu falschen Joins, fehlinterpretierten Spalten und nicht-existierenden Filterwerten. SQRL erkennt Ambiguitäten und kann bis zu 5 Inspektions-Queries absetzen (read-only), bevor es die finale Query ausgibt. Einfache Fragen bleiben Single-Shot, komplexe verdienen Exploration. Der Overhead wird nur bei Bedarf bezahlt.

Beispielprompt:

User: "Wie viele Mitarbeiter arbeiten in der IT-Abteilung von Alameda County?"
SQRL: <sql>SELECT DISTINCT county_name FROM employees WHERE county_name LIKE '%ameda%';</sql>
DB: <observation>Alameda; ALAMEDA; Alameda County</observation>
SQRL: <sql>SELECT COUNT(DISTINCT employee_id) FROM employees WHERE department = 'IT' AND county_name = 'Alameda County';</sql>
DB: <observation>47</observation>
SQRL: <answer>SELECT COUNT(DISTINCT employee_id) FROM employees WHERE department = 'IT' AND county_name = 'Alameda County'; -- 47 employees</answer>

Geeignet für: SQRL-4B, SQRL-9B (empfohlen), SQRL-35B-A3B (höchste Genauigkeit)

Ursprung: https://www.marktechpost.com/2026/07/19/feyn-ai-releases-sqrl-a-text-to-sql-model-family-that-inspects-the-database-before-writing-a-query/

Warum heute wichtig: SQRL-35B-A3B übertrifft Claude Opus 4.6 auf BIRD Dev (70,60% vs. 68,77%). Das 9B-Modell hält 69,80% — fast volle Leistung bei deutlich weniger Ressourcen. CISPO-Training (von MiniMax M1) sichert robustes Explorationsverhalten.

3. Claude-Fable-Distillation auf 657 MB

Zusammenfassung: Claude Fable 5 Conversations und Reasoning-Traces werden auf ein 1B-Modell feinabgestimmt — reasoning-fähig, lokal lauffähig.

Erklärung: Statt klassischer Modell-Distillation (Gewichte komprimieren), werden tausende Claude Fable 5 Conversations generiert, Reasoning-Traces erfasst, und ein MiniCPM5-1B darauf fine-getuned. Das Modell behält das native enable_thinking Template von MiniCPM5. GGUF Q4_K_M Quantisierung reduziert auf 657 MB — lauffähig auf Consumer-Hardware.

Beispielprompt:


# Think-Modus (detailliertes Reasoning):
Enable thinking: true

Erkläre den folgenden Code Zeile für Zeile und identifizierte mögliche Schwachstellen:
[Code einfügen]

Geeignet für: MiniCPM5-1B (Ollama), lokale CPU/GPU

Ursprung: https://www.marktechpost.com/2026/07/19/someone-fine-tuned-openbmbs-minicpm5-1b-on-claude-fable-5-traces-to-ship-a-657mb-local-thinking-model/

Warum heute wichtig: Erster Community-Fine-Tune, der Claude Fable 5 Reasoning-Qualität auf 657 MB komprimiert. Bisher waren Frontier-Reasoning-Modelle nur über Cloud-APIs zugänglich — dieses Modell läuft auf einem MacBook mit Ollama.

🏆 Highlight des Tages

Claude Fable produziert Gegenbeispiel zur Jacobian Conjecture (371↑ HN)

Was passiert ist: Claude Fable 5 hat ein mathematisches Gegenbeispiel zur Jacobian-Conjecture (85 Jahre offen) produziert und auf Twitter veröffentlicht — in einem Format, das nach 7 Tagen abläuft.

Das Gegenbeispiel (kopierbar):

Counterexample to the Jacobian conjecture:

((1+xy)^3 z + y^2 (1+xy) (4+3xy), y + 3 x (1+xy)^2 z + 3 x y^2 (4+3xy), 2 x - 3 x^2 y - x^3 z): C^3 → C^3

Jacobian determinant: -2

Die Abbildung ist nicht injektiv:
(0, 0, -1/4), (1, -3/2, 13/2), und (-1, 3/2, 13/2)
werden alle auf (-1/4, 0, 0) abgebildet.

Verifikation: Ein HN-Kommentator fütterte das Gegenbeispiel in GPT-5.6 Sol, das SymPy-Code zur Überprüfung schrieb. Die Community diskutiert, ob die Community-Verifikation ausreicht oder formale Beweise nötig sind.

Quelle: https://xcancel.com/__alpoge__/status/2079028340955197566 | 371↑ HN

Warum relevant für Prompt-User: Zeigt, dass Frontier-Modelle nicht nur Code generieren, sondern echte mathematische Entdeckungen produzieren. Das Pattern: Mathematische Vermutung → Modell-Prompt → Gegenbeispiel-Generierung → Symbolische Verifikation.

📰 Erlesene Artikel & Ressourcen

1. Moonshot AI suspendiert neue Subscriptions wegen Kimi K3-Nachfrage

2. Alibaba previewt Qwen3.8-Max: 2,4 Billionen Parameter

3. Simon Willison: Claude Code nutzt Bun in Rust (508↑ HN)

4. LoRA Speedrun — Public Leaderboard für Fine-Tuning-Techniken

5. BayesPO: Bayesian Prompt Optimization (arXiv)

  • URL: https://arxiv.org/abs/2607.16001
  • Zusammenfassung: Prompt-Optimierung als Bayesian posterior sampling über diskrete Prompt-Tokens. Parallel-Tempered MCMC mit Gradient-Guidance. Erster statistisch fundierter Ansatz jenseits von Heuristik.

Bericht erstellt am 2026-07-20 Quellen: Hacker News, AI News Portals, arXiv, GitHub, Personal Blogs