Der zunehmende Einsatz autonom agierender Programmierwerkzeuge sorgt in der Softwarebranche für wachsende Besorgnis. Entwickler und Branchenexperten warnen davor, dass der Aufstieg agentischer Coding-Tools handwerkliche Kernkompetenzen, grundlegende technische Fähigkeiten und den Teamzusammenhalt untergräbt. Während der reine Ausstoß an Programmcode wächst, verlagern sich die operativen Engpässe zunehmend auf die Prüfung und Fehlerbehebung.
Wachsender Prüfaufwand bremst Produktivitätsgewinne
Die technischen Folgen der automatisierten Code-Erstellung schlagen sich bereits in Branchenerhebungen nieder. Laut dem aktuellen Technologiebericht von Bain & Co., für den rund 300 leitende Technologie-Führungskräfte befragt wurden, steigern KI-gestützte Coding-Tools die Anzahl der erledigten Aufgaben um rund 21 Prozent.
Gleichzeitig kletterte die für Reviews benötigte Zeit um 91 Prozent nach oben. Zudem müssen Entwickler 47 Prozent mehr parallele Arbeitsstränge koordinieren.
Während Führungskräfte für die kommenden ein bis zwei Jahre eine Steigerung der Release-Zyklen um 148 Prozent und ein Produktivitätsplus von 95 Prozent erwarten, liegt der real erzielte Zuwachs derzeit bei 20 bis 27 Prozent. Bain-Partner Purna Doddapaneni betonte, der Flaschenhals habe sich vom Schreiben des Codes hin zum Vertrauen in den Code verschoben.
Der Einsatz von KI-Systemen in der Softwareentwicklung bringt nicht nur technische Hürden, sondern auch komplexe rechtliche Vorgaben wie die neue EU-KI-Verordnung mit sich. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle neuen Pflichten, Fristen und Risikoklassen. EU AI Act in 5 Schritten verstehen
Ähnliche Diskrepanzen dokumentiert eine weltweite Qualitätsstudie von SmartBear unter 1.436 Fach- und Führungskräften aus den USA und Großbritannien. Demnach haben 46 Prozent der Teams bereits KI-generierten Code produktiv ausgespielt, der im laufenden Betrieb fehlschlug; von diesen behalten dennoch 69 Prozent großes oder vollständiges Vertrauen in die Technologie.
Während 73 Prozent der Führungskräfte KI-Code vertrauen, teilen nur 52 Prozent der Praktiker diese Haltung. Lediglich 46 Prozent validieren Spezifikationen vor der Generierung. Zudem räumen 47 Prozent ein, den Beitrag einer KI zu Fehlern oder Vorfällen nicht erklären zu können – nach der Auslieferung steigt dieser Wert sogar auf 73 Prozent.
Zwar gehen 95 Prozent der Führungskräfte und 86 Prozent der Praktiker von ausreichenden Überprüfungen aus, doch nur 25 Prozent der Teams lassen mehr als 80 Prozent der Agenten-Ergebnisse tatsächlich durch Menschen gegenprüfen.
Wer KI-Tools professionell einsetzt, muss heute genau wissen, welche Systeme als Hochrisiko eingestuft werden und welche Dokumentationspflichten damit verbunden sind. Erfahren Sie in diesem kostenlosen Report, wie Sie die Anforderungen der EU-KI-Verordnung rechtssicher in Ihren Projekten umsetzen. Kostenlosen Umsetzungsleitfaden zum EU AI Act anfordern
Warnung vor dem Verlust praktischer Erfahrung
Technologieverantwortliche sehen durch den Wegfall grundlegender Programmierarbeiten auch die Ausbildung gefährdet. Inbal Shani, Chief Product & Technology Officer bei Twilio, warnt vor einem Zusammenbruch der traditionellen Nachwuchsausbildung.
KI-Systeme automatisierten Einstiegsarbeiten, während das manuelle Debugging unverzichtbar bleibe, um mentale Modelle komplexer Systeme aufzubauen. R&D-Leiter sollten daher die menschliche Urteilskraft ins Zentrum stellen statt reiner Nutzungs- oder Lizenzzahlen.
Wenn 30 Prozent mehr Code den doppelten Aufwand für Fehlerbehebungen und Rollbacks nach sich ziehe, werde der Produktivitätsgewinn neutralisiert. Shani betonte, in fünf Jahren liege der Engpass nicht mehr in den Fähigkeiten der künstlichen Intelligenz, sondern im menschlichen Urteilsvermögen.
Auch im Bildungsbereich und bei Open-Source-Projekten zeichnen sich Umbrüche ab. Bildungsanbieter für Webentwicklung verzeichnen massive Einnahmenrückgänge durch Chatbots und Web-Crawler, während Kursersteller und Autoren Umsatzeinbrüche von über 50 Prozent melden.
Zugleich weisen akademische Untersuchungen strukturelle Defizite nach: Ein Audit über 3.000 Zyklen im Rahmen des RepoReuse-Benchmarks zeigte, dass Agenten bestehende Repositories kaum noch explorieren und selbst eigene Verläufe ignorieren.
In 50,8 Prozent der Aufgabenketten hinterließen die Systeme duplizierte Logik, was Forderungen nach neuen Metriken für Code-Wiederverwendung und Redundanz laut werden lässt.

