Originaltitel: Dünner Harness, Dicke Fähigkeiten
Originalautor: Garry Tan
Übersetzung: Peggy, BlockBeats


Wenn „stärkere Modelle“ zur Standardantwort der Branche werden, bietet dieser Artikel eine andere Beurteilung: Der wahre Unterschied in der Produktivitätssteigerung um das 10-, 100- oder sogar 1000-Fache liegt nicht im Modell selbst, sondern in dem gesamten Systemdesign, das um das Modell herum aufgebaut ist.


Der Autor dieses Artikels, Garry Tan, ist derzeit Präsident und CEO von Y Combinator und hat sich lange mit AI und frühen Startökosystemen beschäftigt. Er hat das Framework „fat skills + thin harness“ entwickelt, das AI-Anwendungen in Schlüsselkomponenten wie Skills, Betriebsframework, Kontext-Routing, Aufgabenverteilung und Wissenskompression zerlegt.


In diesem System ist das Modell nicht mehr die gesamte Fähigkeit, sondern nur die Ausführungseinheit im System; was die Ausgabequalität wirklich bestimmt, ist, wie Sie den Kontext organisieren, Prozesse festigen und wie Sie die Grenze zwischen „Urteilen“ und „Berechnen“ ziehen.


Noch wichtiger ist, dass diese Methode nicht auf der konzeptionellen Ebene bleibt, sondern in realen Szenarien validiert wird: Angesichts der Datenverarbeitung und Matching-Aufgaben von Tausenden von Gründern hat das System durch den Zyklus „Lesen – Organisieren – Urteilen – Zurückschreiben“ die Fähigkeit erreicht, die nahe an der eines menschlichen Analysten liegt, und optimiert sich kontinuierlich selbst, ohne dass der Code neu geschrieben werden muss. Dieses „lernende System“ hat AI von einem einmaligen Tool in eine Infrastruktur mit Zinseszinseffekt verwandelt.


Daraus wird die zentrale Erinnerung, die der Artikel gibt, klar: In der AI-Ära hängt der Effizienzunterschied nicht mehr davon ab, ob Sie das fortschrittlichste Modell verwenden, sondern davon, ob Sie ein System aufgebaut haben, das kontinuierlich Fähigkeiten ansammelt und sich automatisch weiterentwickelt.


Hier ist der Originaltext:


Steve Yegge sagte, dass die Effizienz von Personen, die AI-Programm-Agenten verwenden, „10 bis 100 Mal so hoch ist wie die von Ingenieuren, die nur Cursor und Chat-Tools verwenden, etwa 1000 Mal so hoch wie die von Google-Ingenieuren im Jahr 2005.“


Hinweis: Steve Yegge ist ein einflussreicher Software-Ingenieur, Technik-Blogger und Kommentator der Engineering-Kultur im Silicon Valley, bekannt für seine scharfsinnigen, langen, stark personalisierten technischen Artikel. Er war Senior Engineer bei Unternehmen wie Amazon und Google; später trat er Salesforce bei, bevor er in Startups und den Bereich AI wechselte; er war auch einer der frühen Förderer des Dart-Projekts.


Das ist keine Übertreibung. Ich habe es mit eigenen Augen gesehen und selbst erlebt. Aber wenn die Leute von solchen Unterschieden hören, neigen sie oft dazu, in die falsche Richtung zu deuten: stärkere Modelle, intelligentere Claude, mehr Parameter.


Tatsächlich nutzen die Personen, die ihre Effizienz um das 2-fache steigern, und die, die sie um das 100-fache steigern, dasselbe Modell. Der Unterschied liegt nicht in der „Intelligenz“, sondern in der „Architektur“, und diese Architektur ist so einfach, dass sie auf eine Karte geschrieben werden kann.


Harness (Betriebsframework) ist das Produkt selbst.


Am 31. März 2026 hat Anthropic versehentlich den vollständigen Quellcode von Claude Code auf npm veröffentlicht - insgesamt 512.000 Zeilen. Ich habe es einmal durchgelesen. Das hat das bestätigt, was ich immer bei YC (Y Combinator) gesagt habe: Das wahre Geheimnis liegt nicht im Modell, sondern in der „Schicht, die das Modell umgibt“.


Echtzeit-Code-Repository-Kontext, Prompt-Cache, für spezifische Aufgaben gestaltete Tools, so viel wie möglich redundanten Kontext komprimieren, strukturierte Gesprächserinnerungen, parallel laufende Sub-Agenten - all dies wird das Modell nicht intelligenter machen. Aber sie können dem Modell den „richtigen Kontext“ zur „richtigen Zeit“ geben und gleichzeitig verhindern, dass es von irrelevanten Informationen überwältigt wird.


Diese Schicht des „Wickelns“ wird als Harness (Betriebsframework) bezeichnet. Und die eigentliche Frage, die sich alle AI-Entwickler stellen sollten, ist: Was sollte ins Harness, und was sollte draußen bleiben?


Diese Frage hat tatsächlich eine sehr spezifische Antwort - ich nenne sie: dünnes Framework (thin harness), dicke Fähigkeiten (fat skills).


Fünf Definitionen


Der Engpass liegt nie in der Intelligenz des Modells. Das Modell weiß tatsächlich schon, wie man schlussfolgert, Informationen integriert und Code schreibt.


Sie scheitern, weil sie Ihre Daten nicht verstehen - Ihr Schema, Ihre Vereinbarungen, wie Ihr Problem konkret aussieht. Und die folgenden fünf Definitionen sind genau dazu gedacht, dieses Problem zu lösen.


1. Skill-Datei (Fähigkeitsdatei)


Eine Skill-Datei ist ein wiederverwendbares Markdown-Dokument, das dem Modell beibringt, „wie man eine Aufgabe erledigt“. Beachten Sie, dass es nicht sagt, „was zu tun ist“ - dieser Teil wird vom Benutzer bereitgestellt. Die Skill-Datei bietet den Prozess.


Der Schlüsselpunkt, den die meisten Menschen übersehen, ist: Die Skill-Datei ist tatsächlich wie ein Methodenaufruf. Sie kann Parameter empfangen. Sie können sie mit verschiedenen Parametern aufrufen. Der gleiche Prozess kann aufgrund unterschiedlicher übergebener Parameter völlig unterschiedliche Fähigkeiten demonstrieren.


Zum Beispiel gibt es ein Skill namens /investigate. Es umfasst sieben Schritte: Datenumfang definieren, Zeitachse erstellen, für jedes Dokument diarize, zusammenfassen, von beiden Seiten argumentieren, Quellen zitieren. Es akzeptiert drei Parameter: TARGET, QUESTION und DATASET.


Wenn Sie es auf einen Sicherheitswissenschaftler und 2.100.000 forensische E-Mails richten, wird es zu einem medizinischen Forschungsanalytiker, der beurteilt, ob ein Whistleblower unterdrückt wurde.


Wenn Sie es auf ein Briefkastenunternehmen und Dokumente der Federal Election Commission (FEC) ausrichten, wird es zu einem juristischen forensischen Ermittler, der politischen Spenden von koordinierten Aktionen nachverfolgt.


Es ist immer noch dasselbe Skill. Immer noch die gleichen sieben Schritte. Immer noch dasselbe Markdown-Dokument. Das Skill beschreibt einen Entscheidungsprozess, und was es tatsächlich in der realen Welt umsetzt, sind die Parameter, die bei der Ausführung übergeben werden.


Das ist kein Prompt Engineering, sondern Software-Design: Es wird einfach Markdown als Programmiersprache verwendet und menschliche Urteilsfähigkeit als Laufzeitumgebung. Tatsächlich eignet sich Markdown sogar besser als starrer Quellcode zur Kapselung von Fähigkeiten, denn es beschreibt Prozesse, Urteile und Kontexte, und das sind die Sprachen, die das Modell am besten „versteht“.


2. Harness (Betriebsframework)


Harness ist die Schicht des Programms, das LLM betreibt. Es macht nur vier Dinge: Es lässt das Modell im Zyklus laufen, liest und schreibt Ihre Dateien, verwaltet den Kontext und führt Sicherheitsbeschränkungen aus.


Das ist alles. Das ist „thin (dünn)“.


Das gegenteilige Muster ist: dickes Harness, dünne Skills.


Sie haben bestimmt schon so etwas gesehen: Über 40 Werkzeugdefinitionen, allein die Erläuterungen nehmen die Hälfte des Kontextfensters ein; ein Alleskönner-God-Tool braucht 2 bis 5 Sekunden für einen Hin- und Rücklauf durch MCP; oder jedes Endpoint der REST-API wird als einzelnes Tool verpackt. Das Ergebnis ist, dass der Tokenverbrauch dreimal so hoch ist, die Verzögerung dreimal so hoch und die Fehlerrate ebenfalls dreimal so hoch ist.


Die wirklich ideale Vorgehensweise besteht darin, Werkzeuge zu verwenden, die für den Zweck geschaffen, schnell und funktionell sind.


Zum Beispiel ein Playwright CLI, das für jede Browseraktion nur 100 Millisekunden benötigt; anstatt ein Chrome MCP, das einen Screenshot macht → findet → klickt → wartet → liest, was 15 Sekunden dauert. Ersteres ist 75-mal schneller.


Die heutige Software muss nicht mehr „bis ins kleinste Detail ausgefeilt“ werden. Was Sie tun sollten, ist: nur das zu bauen, was Sie wirklich brauchen, und nicht mehr.


3. Resolver


Der Resolver ist im Wesentlichen eine Kontext-Routing-Tabelle. Wenn die Aufgabentyp X auftritt, wird das Dokument Y priorisiert geladen. Skills sagen dem Modell, „wie man es macht“; Resolver sagen dem Modell, „wann man was laden sollte“.


Zum Beispiel, wenn ein Entwickler einen Prompt ändert. Ohne Resolver könnte er nach der Änderung einfach veröffentlichen. Mit Resolver würde das Modell zuerst die docs/EVALS.md lesen. Und dieses Dokument besagt: Zuerst das Bewertungsset ausführen und die Ergebnisse vergleichen; wenn die Genauigkeit um mehr als 2 % sinkt, zurückrollen und die Ursache untersuchen. Dieser Entwickler wusste ursprünglich nicht einmal, dass es ein Bewertungsset gibt. Der Resolver hat zur richtigen Zeit den richtigen Kontext geladen.


Claude Code hat einen eingebauten Resolver. Jedes Skill hat ein Beschreibung-Feld, und das Modell wird automatisch die Benutzerabsicht mit der Beschreibung des Skills abgleichen. Sie müssen sich nicht daran erinnern, ob dieses Skill „/ship“ existiert - die Beschreibung selbst ist der Resolver.


Um ehrlich zu sein: Mein früheres CLAUDE.md hatte über 20.000 Zeilen. Alle Eigenheiten, alle Muster, alle Erfahrungen, die ich gemacht habe, wurden darin untergebracht. Absurdität pur. Die Qualität der Aufmerksamkeit des Modells hat merklich nachgelassen. Claude Code hat mich sogar direkt aufgefordert, es zu kürzen.


Die letzte Reparaturlösung besteht wahrscheinlich nur aus 200 Zeilen - sie behält einige Dokumentenzeiger bei. Für welches Dokument auch immer Sie wirklich benötigen, lassen Sie den Resolver es zur kritischen Zeit laden. So können 20.000 Zeilen Wissen weiterhin nach Bedarf verwendet werden, ohne das Kontextfenster zu verschmutzen.


4. Latent und deterministisch (latenter Raum und Determinismus)


In Ihrem System gehört jeder Schritt entweder zu dieser Kategorie oder zu jener. Und die Verwirrung zwischen diesen beiden ist der häufigste Fehler im Design von Agenten.


Latent Space ist der Ort, an dem Intelligenz vorhanden ist. Das Modell liest, versteht, urteilt und trifft Entscheidungen. Hier geht es um: Urteile, Zusammenfassungen, Mustererkennung.

Deterministisch ist der Ort, an dem Verlässlichkeit existiert. Gleiche Eingaben, immer die gleiche Ausgabe. SQL-Abfragen, kompilierter Code, arithmetische Operationen gehören zu dieser Seite.


Ein LLM kann Ihnen helfen, 8 Personen für ein Abendessen zu platzieren, während es die Persönlichkeit und sozialen Beziehungen jeder Person berücksichtigt. Aber wenn Sie es bitten, 800 Personen zu platzieren, wird es ernsthaft einen „scheinbar vernünftigen, aber tatsächlich völlig falschen“ Sitzplan erstellen. Denn das ist nicht das Problem, das im latenten Raum behandelt werden sollte, sondern ein deterministisches Problem, das gewaltsam in den latenten Raum gepresst wurde - ein Kombinationsoptimierungsproblem.


Die schlechtesten Systeme haben immer die Arbeit auf der falschen Seite dieser Grenze. Die besten Systeme ziehen die Grenze sehr klar.


5. Diarisierung (Dokumentenerstellung / Themenbild)


Die Diarisierung ist der Schritt, der AI tatsächlich Wert im Bereich des realen Wissensarbeit bringt.


Das bedeutet: Das Modell liest alle Materialien, die zu einem Thema gehören, und erstellt ein strukturiertes Bild. Mit einer Seite Papier komprimiert es Urteile aus Dutzenden oder sogar Hunderten von Dokumenten.


Das ist nichts, was SQL-Abfragen erzeugen können. Das ist auch nichts, was RAG-Pipelines erzeugen können. Das Modell muss wirklich lesen, widersprüchliche Informationen gleichzeitig im Kopf behalten, bemerken, was sich geändert hat, wann es sich geändert hat, und diese Informationen in strukturierte Intelligenz integrieren.


Das ist der Unterschied zwischen Datenbankabfragen und Analystenbriefings.


Diese Architektur


Diese fünf Konzepte können zu einer sehr einfachen dreischichtigen Architektur kombiniert werden.


Die oberste Schicht sind dicke Fähigkeiten: Prozesse, die in Markdown geschrieben sind und Urteile, Methodologien und Fachwissen tragen. 90 % des Wertes liegen in dieser Schicht.
In der Mitte befindet sich eine dünne CLI-Harness: etwa 200 Zeilen Code, Eingabe von JSON, Ausgabe von Text, standardmäßig nur lesend.
Die unterste Schicht ist Ihr Anwendungssystem: QueryDB, ReadDoc, Search, Timeline - das sind deterministische Infrastrukturen.


Das Kernprinzip ist zielgerichtet: Versuchen Sie, die „Intelligenz“ so weit wie möglich zu den Skills zu verschieben; drücken Sie die „Ausführung“ so weit wie möglich in die deterministischen Werkzeuge; und halten Sie das Harness leicht.


Das Ergebnis dieser Vorgehensweise ist: Jedes Mal, wenn sich die Fähigkeiten des Modells verbessern, werden alle Skills automatisch stärker; und das zugrunde liegende deterministische System bleibt stabil und zuverlässig.


Lernende Systeme


Hier zeige ich mit einem realen System, das wir bei YC aufbauen, wie diese fünf Definitionen zusammenarbeiten.


Im Juli 2026 fand das Startup School mit 6000 Gründern statt. Jeder hatte strukturierte Antragsunterlagen, Antworten auf Fragebögen, Transkripte von 1:1-Gesprächen mit Mentoren und öffentliche Signale: Posts auf X, GitHub-Einreichungen, Aufzeichnungen zur Nutzung von Claude Code (die Entwicklungsgeschwindigkeit zeigen).


Die traditionelle Vorgehensweise besteht darin, dass ein Projektteam von 15 Personen die Anträge einzeln liest, intuitiv urteilt und dann eine Tabelle aktualisiert.


Diese Methode funktioniert bei 200 Personen, aber bei 6000 Personen versagt sie vollständig. Kein Mensch kann so viele Bilder gleichzeitig im Kopf behalten und sich bewusst sein: Die drei besten Kandidaten in der Richtung der AI-Agent-Infrastruktur sind der Gründer von Entwicklungswerkzeugen in Lagos, ein Compliance-Gründer in Singapur und ein CLI-Tool-Entwickler in Brooklyn - und sie haben in verschiedenen 1:1-Gesprächen dasselbe Schmerzproblem völlig unterschiedlich formuliert.


Das Modell kann das. So geht es:


Enrichment (Informationsanreicherung)


Es gibt ein Skill namens /enrich-founder, das alle Datenquellen abruft, Informationen anreichert, diarisiert und die Unterschiede zwischen dem, was „der Gründer sagt“, und dem, was „tatsächlich gemacht wird“, kennzeichnet.


Das zugrunde liegende deterministische System ist verantwortlich für: SQL-Abfragen, GitHub-Daten, Browser-Tests von Demo-URLs, das Abrufen sozialer Signale, CrustData-Abfragen usw. Eine geplante Aufgabe wird einmal täglich ausgeführt. 6000 Gründer-Porträts bleiben immer auf dem neuesten Stand.


Die Ausgabe der Diarisierung kann Informationen erfassen, die durch Schlüsselwortsuche völlig unentdeckt bleiben:


Gründer: Maria Santos Firma: Contrail (contrail.dev) Selbstbeschreibung: "AI-Agent von Datadog" tatsächlich macht: 80 % der Codeeinreichungen konzentrieren sich auf Abrechnungsmodule → im Grunde handelt es sich um ein FinOps-Tool, das als beobachtbares Werkzeug verkleidet ist.


Dieser Unterschied zwischen „Sagen“ und „tatsächlichem Verhalten“ erfordert, dass sowohl die GitHub-Commit-Historie, die Antragsunterlagen als auch die Gesprächsprotokolle gleichzeitig gelesen werden und im Kopf integriert werden. Keine Embedding-Ähnlichkeitssuche kann das tun, auch keine Schlüsselwortfilterung. Das Modell muss alles vollständig lesen und dann urteilen. (Das ist die Aufgabe, die in den latenten Raum gehört!)


Matching


Hier ist der Ort, an dem „Skill = Methodenaufruf“ seine Kraft entfaltet.


Das gleiche Matching-Skill kann dreimal aufgerufen werden und völlig unterschiedliche Strategien erzeugen:


/match-breakout: Bearbeitung von 1200 Personen, nach Bereichen clustering, jede Gruppe 30 Personen (Embedding + deterministische Zuweisung)


/match-lunch: Bearbeitung von 600 Personen, interdisziplinäres „Zufall-Matching“, jeder Tisch 8 Personen und nicht wiederholend - das Thema wird zuerst von LLM generiert, dann werden die Plätze von deterministischen Algorithmen zugewiesen.


/match-live: Bearbeitung von Live-Teilnehmern vor Ort, basierend auf den nächsten Nachbarn-Embedding, innerhalb von 200 ms 1:1-Matching durchführen und bereits bekannte Personen ausschließen.


Und das Modell kann Urteile fällen, die traditionelle Cluster-Algorithmen nicht treffen können:

„Santos und Oram gehören beide zur AI-Infrastruktur, sind aber keine Konkurrenten - Santos macht Kostenattribution, Oram macht Orchestrierung. Sie sollten in derselben Gruppe sein.“
„Kim hat bei der Bewerbung geschrieben, dass es ein Entwickler-Tool ist, aber im 1:1-Gespräch zeigt sich, dass er an der Automatisierung der SOC2-Compliance arbeitet. Sollte neu klassifiziert werden zu FinTech / RegTech.“


Diese Neubewertung kann von Embedding nicht vollständig erfasst werden. Das Modell muss das gesamte Bild lesen.


Lernschleife


Nach Abschluss der Veranstaltung wird ein /improve-Skill die NPS-Umfrageergebnisse lesen, um Feedback zu den „in Ordnung“ Rückmeldungen zu diarize - nicht negative Bewertungen, sondern die „fast gut“ sind - und Muster extrahieren.


Dann wird es neue Regeln vorschlagen und in das Matching-Skill zurückschreiben:


Wenn Teilnehmer sagen „AI-Infrastruktur“, aber mehr als 80 % ihres Codes Module zur Abrechnung sind:
→ Klassifizieren als FinTech, nicht als AI Infra

Wenn bereits zwei Personen in der gleichen Gruppe sich kennen:
→ Matching-Gewichtung reduzieren
Neue Beziehungen priorisieren


Diese Regeln werden in die Skill-Datei zurückgeschrieben. Bei der nächsten Ausführung treten sie automatisch in Kraft. Skills „schreiben sich selbst um“. Im Juli betrug der Anteil der „in Ordnung“-Bewertungen 12 %; bei der nächsten Veranstaltung fiel er auf 4 %.


Die Skill-Datei hat gelernt, was „in Ordnung“ bedeutet, während das System ohne menschliches Neuschreiben von Code besser wurde.


Dieses Muster kann in jedem Bereich übertragen werden:


Suchen → Lesen → Diarisierung → Zählen → Zusammenfassen


Dann: Umfrage → Untersuchung → Diarisierung → Skill neu schreiben


Wenn Sie fragen möchten, was die wertvollste Schleife im Jahr 2026 ist, dann ist es dieses System. Es kann in fast allen Wissensarbeits-Szenarien angewendet werden.


Skills werden permanent verbessert.


Ich habe kürzlich auf X einen Befehl an OpenClaw gesendet, der mehr Resonanz erzeugte als erwartet:


Prompt: Sie dürfen keine einmalige Arbeit leisten. Wenn ich Sie bitte, etwas zu tun, was in der Zukunft wiederholt werden muss, müssen Sie: Zuerst 3 bis 10 Beispiele manuell verarbeiten und mir das Ergebnis zeigen; wenn ich zustimme, erstellen Sie eine Skill-Datei; wenn es automatisch laufen sollte, fügen Sie es zu den geplanten Aufgaben hinzu. Das Kriterium ist: Wenn ich zweimal fragen muss, haben Sie versagt.


Dieser Inhalt erhielt Tausende von Likes und über 2000 Speicherungen. Viele Menschen glauben, dass dies eine Technik des Prompt Engineering ist.


Das ist es nicht, das ist die Architektur, von der ich zuvor gesprochen habe. Jedes Skill, das Sie niedergeschrieben haben, ist ein dauerhaftes Upgrade des Systems. Es wird nicht degradiert, es wird nicht vergessen. Es wird um 3 Uhr morgens automatisch ausgeführt. Und wenn die nächste Modellgeneration veröffentlicht wird, werden alle Skills sofort stärker - die Urteilsfähigkeit des latenten Teils wird verbessert, während der deterministische Teil stabil und zuverlässig bleibt.


Das ist die Quelle der 100-fachen Effizienz, von der Yegge spricht.

Nicht schlauere Modelle, sondern: dicke Fähigkeiten, dünnes Framework (Thin Harness, Fat Skills) und die Disziplin, alles in Fähigkeiten zu verankern.


Das System wird kumulativ wachsen. Einmal aufgebaut, läuft es langfristig.


[Original-Link]