← Wróć do Wiedzy

AI pisze kod cztery razy szybciej i dziesięć razy więcej luk

W czerwcu 2025 r. kod generowany przez AI wprowadzał ponad 10 tysięcy nowych podatności bezpieczeństwa miesięcznie, dziesięć razy więcej niż pół roku wcześniej. Szybkość rośnie, ale ryzyko rośnie szybciej. Oto dlaczego review i testy stają się ważniejsze, nie mniej ważne.

Michał Lubański
Kluczowy wniosek

Kod generowany przez AI powstaje szybciej, ale niesie mierzalnie więcej luk bezpieczeństwa: podatności w 45% próbek według testu ponad 100 modeli (Veracode, 2025). To nie argument przeciw AI, tylko przeciw wdrażaniu jej bez warstwy przeglądu, testów i bezpieczeństwa.

Jest taka wygodna narracja: AI pisze kod, więc software robi się tańszy i szybszy. Pierwsza połowa zdania jest prawdziwa. Druga bywa pułapką. Dane z 2025 roku pokazują, że tam, gdzie rośnie prędkość, potrafi jeszcze szybciej rosnąć ryzyko.

Firma Apiiro przeanalizowała kod od ponad 7 tysięcy deweloperów w 62 tysiącach repozytoriów. Wniosek: w czerwcu 2025 roku kod generowany przez AI wprowadzał ponad 10 tysięcy nowych „security findings" miesięcznie, dziesięciokrotnie więcej niż pół roku wcześniej. Co ciekawe, trywialne błędy składni spadły o 76%, a błędy logiczne o ponad 60%. Znikają drobiazgi, rosną rzeczy poważne.

To jest dokładnie ten rodzaj problemu, który trudno wychwycić okiem. AI usuwa literówki i naprawia oczywiste potknięcia, więc kod na pierwszy rzut oka wygląda czyściej. Pod spodem przybywa jednak luk, które wymagają myślenia o systemie jako całości, a nie o pojedynczej funkcji.

„Narzędzia AI nie są zaprojektowane, żeby oceniać. Nie myślą o ścieżkach eskalacji uprawnień, o bezpiecznych wzorcach architektury ani o niuansach zgodności."

Zahra Timsah, CEO i-GENTIC AI (komentarz do ustaleń Apiiro)

To nie jest odosobniony wynik

Gdyby chodziło o jedną firmę i jej silnik analityczny, można by machnąć ręką. Ale niezależne badania idą w tę samą stronę. Veracode przetestował ponad 100 modeli językowych w czterech językach programowania. 45% próbek kodu nie przechodziło testów bezpieczeństwa, bo wprowadzało podatności z listy OWASP Top 10. Dla Javy wskaźnik niepowodzeń sięgał 72%.

Do tego dochodzi badanie opublikowane w IEEE, w którym sześć modeli wygenerowało 600 fragmentów kodu JavaScript na podstawie stu identycznych poleceń. Podatności znaleziono w 275 z 600 fragmentów, łącznie 602 luki w 28 klasach CWE. Wniosek autorów jest zwięzły: wszystkie badane modele wprowadzają podatności do generowanego kodu.

Dług, którego nie widać przy odbiorze

Jest jeszcze cichszy koszt, mniej efektowny niż podatność, ale równie realny. Analiza GitClear obejmująca 211 milionów zmienionych linii kodu pokazała, że w 2024 roku ośmiokrotnie wzrosła częstotliwość zduplikowanych bloków, a udział refaktoryzacji spadł. Po raz pierwszy w historii tych pomiarów liczba linii kopiuj-wklej przekroczyła liczbę linii realnie przepracowanych. To jest definicja długu technicznego: dziś szybciej, jutro trudniej cokolwiek zmienić.

Uczciwie zaznaczmy granice tych danych. Apiiro, GitClear i część pozostałych to telemetria obserwacyjna, a nie eksperyment z grupą kontrolną, więc pokazują korelację z upowszechnieniem AI, nie twardą przyczynowość. Znaleźli się też krytycy kwestionujący skalę wzrostu podatności podawaną przez Apiiro. Nawet z tymi zastrzeżeniami kierunek jest zgodny w kilku niezależnych źródłach, a to już trudno zbyć wzruszeniem ramion.

Co z tym robić

Wniosek nie brzmi „nie używać AI". My jej używamy codziennie. Brzmi: prędkość generowania przesuwa wąskie gardło w dół procesu, do przeglądu kodu, testów i bezpieczeństwa. Jeśli firma przyspiesza pisanie, ale nie wzmacnia tych warstw, produkuje ryzyko szybciej, niż produkuje wartość.

Dlatego przy budowie systemów traktujemy AI jak narzędzie pod nadzorem, a nie wykonawcę zostawionego samemu sobie. Bazy projektujemy sami, klucze nie trafiają do przeglądarki, a kod przechodzi review i testy, zanim dotknie produkcji. Pisaliśmy o tym szerzej przy okazji aplikacji, które wystawiają dane klientów na widok, i przy wtyczce, która okazała się malware. Tani kod z AI nie jest tani, jeśli spłacasz go awarią.

Źródła
  1. Apiiro, „4x Velocity, 10x Vulnerabilities", 09.2025 (telemetria).
  2. Veracode, „2025 GenAI Code Security Report", 07.2025.
  3. GitClear, „AI Copilot Code Quality 2025" (211 mln linii).
Michał Lubański
Michał Lubański

CTO i współzałożyciel LUNOLAB

CTO i współzałożyciel LUNOLAB. Odpowiada za całą technologię firmy: architekturę budowanych systemów, infrastrukturę i sprzęt, jakość kodu oraz bezpieczeństwo. Decyduje, jakie technologie i modele AI trafiają do projektów, i pilnuje zasady, że liczby liczy kod, a nie model. Pisze o tym, co dzieje się pod maską wdrożeń AI.

Masz pomysł na wdrożenie technologii u siebie?

Umów bezpłatną rozmowę