AGENTS.md im Benchmark: Wie viel Repository-Kontext Coding Agents wirklich brauchen
45 Coding-Agent-Runs zeigen: AGENTS.md machte Kimi K3 nicht korrekter, sparte bei verstecktem Repository-Wissen aber deutlich Sucharbeit.
4 Beiträge
45 Coding-Agent-Runs zeigen: AGENTS.md machte Kimi K3 nicht korrekter, sparte bei verstecktem Repository-Wissen aber deutlich Sucharbeit.
40.000 Spieler übersahen ein Drittel gefährlicher Agent-Befehle. Das eigentliche Problem liegt aber tiefer: Approval Prompts sind keine belastbare Sicherheitsgrenze für autonome Coding-Agenten.
Eine neue Studie vergleicht semantische Repository-Indizes mit delegierter Grep-Suche. Die Zahlen sprechen klar für Retrieval, aber nur in einem eng definierten Szenario.
Ein neuer SlopCodeBench-Lauf sieht Opus 5 deutlich vor Opus 4.8 und Sonnet 5. Trotzdem löst keines der Modelle eine Aufgabe vollständig. Eine Einordnung des Benchmarks und der Zahlen.