Die Abgrenzung
Wo Anwendung aufhört und Entwicklung anfängt.
Kaum ein Bereich wird bei der Forschungszulage so häufig falsch eingeschätzt wie KI. Der Einsatz eines Modells ist keine Forschung, auch wenn das Ergebnis beeindruckend ist. Förderfähig wird es erst, wenn ihr selbst an einem Verfahren gearbeitet habt, dessen Erfolg zu Beginn nicht feststand.
Die Grenze verläuft zwischen Nutzung und Entwicklung. Ein Systemprompt, eine Chain und ein Vektorindex aus einer Bibliothek sind Anwendung bekannter Bausteine. Eine eigene Evaluationslogik, ein Verfahren zur Reduktion von Halluzinationen mit belegbarer Wirkung oder eine Retrieval-Architektur, die an einer gemessenen Qualitätsgrenze scheitert und neu entworfen werden musste, können dagegen technische Unsicherheit enthalten.
Entscheidend ist fast immer eine Zahl. Wer eine Zielgröße benennen kann – Genauigkeit, Trefferquote, Fehlerrate, Latenz, Halluzinationsrate – und zeigt, dass sie mit verfügbaren Mitteln nicht erreichbar war, hat die Grundlage für einen belastbaren Antrag. Wer nur beschreibt, was das System kann, hat sie nicht.
Auch hier gilt: bewusst abgrenzen. Datenaufbereitung, Annotation, Infrastrukturbetrieb, Modell-Deployment und Monitoring gehören zum Vorhaben, sind aber selten der förderfähige Kern. Ein Antrag, der den experimentellen Teil klar herausarbeitet, ist prüffähiger als einer, der die gesamte KI-Initiative einreicht.
Die drei Kriterien bei KI-Projekten
Neuheit
Kein verfügbares Modell, kein veröffentlichtes Verfahren erfüllt die Anforderung. Der Stand der Technik ist mit Quelle oder Benchmark benannt.
Technische Unsicherheit
Ob die Zielmetrik erreichbar ist, steht vor dem Experiment nicht fest. Rechenkosten und Datenbeschaffung allein zählen nicht.
Systematik
Hypothese, Experiment, Messung, Iteration – nachvollziehbar in Experiment Logs, Metriken und Datensatzversionen.
Achtzehn Tätigkeiten
Was in KI-Projekten wie eingeordnet wird.
Die folgende Einordnung beschreibt typische Fälle. Maßgeblich ist immer das konkrete Vorhaben.
Tätigkeit
Befund
Worauf es ankommt
Nachweis
Entwicklung einer eigenen Modellarchitektur oder eines eigenen Trainingsverfahrens
Förderfähig
Veröffentlichte Ansätze müssen nachweislich an der Anforderung gescheitert sein
Experiment Logs, Vergleichsbenchmarks, verworfene Ansätze
Training oder Fine-Tuning mit eigenem Verfahren zur Erreichung einer vorab unsicheren Zielmetrik
Förderfähig
Die Zielgröße muss benannt und zu Beginn nicht sicher erreichbar gewesen sein
Metrikverläufe, Hyperparameter-Suche, Datensatzversionen
Entwicklung einer Evaluations- und Absicherungslogik für generative Systeme
Förderfähig
Eigenes Bewertungsverfahren, nicht die Übernahme bekannter Benchmarks
Evaluationsdesign, Testkorpora, Fehlerquoten
Entwicklung eines Retrieval-Verfahrens, das an einer gemessenen Qualitätsgrenze etablierter Ansätze scheitert
Förderfähig
Die Grenze muss belegt und der eigene Ansatz messbar besser sein
Trefferquoten vorher und nachher, Ablationsstudien
Entwicklung einer agentischen Entscheidungs- oder Planungslogik mit unsicherem Zuverlässigkeitsverhalten
Förderfähig
Zuverlässigkeit unter realen Bedingungen muss vorab offen gewesen sein
Laufprotokolle, Erfolgsquoten, Fehleranalysen
Experimentreihe, die nach Auswertung verworfen wurde
Förderfähig
Scheitern schadet nicht – entscheidend sind Systematik und Dokumentation
Versuchsplan, Metriken, Abbruchentscheidung
Aufbau einer Trainings- und Experimentierinfrastruktur
Einzelfall
Nur wenn die Infrastruktur selbst eine ungelöste technische Frage enthält
Anforderungsprofil, Architekturentscheidungen
Optimierung von Inferenzlatenz oder Modellgröße
Einzelfall
Nur wenn der Zielwert zu Beginn als nicht sicher erreichbar galt
Ausgangs- und Zielwerte, Quantisierungs- und Kompressionsversuche
Erzeugung oder Aufbereitung von Trainingsdaten mit eigenem Verfahren
Einzelfall
Reine Annotation reicht nicht, das Verfahren muss neuartig sein
Verfahrensbeschreibung, Qualitätsmessungen
Entwicklung eigener Verfahren für Fairness, Robustheit oder Erklärbarkeit
Einzelfall
Kritisch bei Anwendung bekannter Bibliotheken, relevant bei neuartigen Anforderungen
Testdesign, Ergebnisse, Vergleichswerte
Multimodale Verarbeitung durch Kombination bestehender Modelle
Einzelfall
Nur wenn die Kombination eine eigene, unsichere technische Frage aufwirft
Architekturvergleich, Messreihen
Nutzung einer LLM-API einschließlich Prompt-Engineering und System-Prompts
Nicht förderfähig
Anwendung bekannter Bausteine, kein eigener Erkenntnisgewinn
—
Aufbau eines Chatbots oder Assistenten mit verfügbaren Frameworks
Nicht förderfähig
Integration und Konfiguration, keine Modellentwicklung
—
Standard-RAG mit etablierter Vektordatenbank und Standard-Chunking
Nicht förderfähig
Bekannter Lösungsweg, technischer Erfolg von Beginn an absehbar
—
Auswahl, Vergleich und Einkauf verfügbarer Modelle
Nicht förderfähig
Evaluation zur Beschaffung ist keine Forschung
—
Annotation und Labeling von Trainingsdaten
Nicht förderfähig
Notwendige Vorarbeit, aber kein eigenständiges FuE-Vorhaben
—
Deployment, Monitoring und Betrieb bestehender Modelle
Nicht förderfähig
Laufender Betrieb im Rahmen bekannter Lösungswege
—
Nachtraining eines Modells auf neue Daten ohne Verfahrensänderung
Nicht förderfähig
Wiederholung eines bekannten Ablaufs, keine offene technische Frage
—
Dieselbe Tätigkeit kann in einem Vorhaben förderfähig und in einem anderen Routine sein. Entscheidend ist nicht, was gemacht wurde, sondern ob zu Beginn offen war, ob es funktioniert.
Häufige Ablehnungsgründe
Woran KI-Anträge typischerweise scheitern.
KI als Begründung statt als Gegenstand
Der Antrag beschreibt, dass KI eingesetzt wurde, nicht welches Verfahren entwickelt wurde. Die BSFZ liest daraus eine Anwendung verfügbarer Technologie.
Keine messbare Zielgröße
Ohne benannte Metrik und Ausgangswert lässt sich technische Unsicherheit nicht belegen. Qualitative Aussagen über bessere Ergebnisse reichen nicht.
Stand der Technik nicht abgegrenzt
Es fehlt der Nachweis, dass verfügbare Modelle oder veröffentlichte Verfahren die Anforderung nicht erfüllen. Genau daran scheitern viele KI-Anträge.
Datenarbeit als FuE eingereicht
Beschaffung, Annotation und Bereinigung machen den größten Teil des Aufwands aus, sind aber selten der förderfähige Kern. Der experimentelle Teil muss getrennt ausgewiesen sein.
Dokumentation
Die Experimente sind der Nachweis.
KI-Teams dokumentieren in der Regel gründlicher als andere Entwicklungsteams – nur eben für sich selbst. Experiment Logs, Metrikverläufe, Hyperparameter-Suchen, Datensatzversionen und Modellstände enthalten fast alles, was BSFZ und Finanzamt brauchen.
Was fehlt, ist die Verbindung zur Fragestellung. Aus einer Reihe von Läufen muss hervorgehen, welche Hypothese geprüft wurde, was der Ausgangswert war, welche Zielgröße galt und warum ein Ansatz verworfen wurde. Verworfene Experimente sind dabei oft wertvoller als erfolgreiche.
Für rückwirkende Jahre gilt: Rekonstruktion ist möglich, aber sie braucht Anker in vorhandenen Artefakten und eine dokumentierte Methodik. Wo Experimente nicht versioniert wurden, wird die Argumentation schnell dünn.
Was wir typischerweise auswerten
Experiment Logs und Metrikverläufe
Datensatzversionen und Modellstände
Evaluationsergebnisse und Benchmarks
Rollen, Stundensätze und Personalstammdaten
Rechenbeispiel
Was ein KI-Team typischerweise erreicht.
Beispielrechnung zur Veranschaulichung. Der FuE-Anteil ergibt sich aus der konkreten Abgrenzung und der Zeiterfassung, nicht aus einer Pauschale. 42 % ist kein gesetzlicher Satz, sondern der rechnerische Effektivwert aus 35 % Fördersatz und dem Gemeinkostenzuschlag.
Branchenlogik allein reicht nicht.
GrantonomyOS
Die Einordnung ist der Anfang. Belastbar wird ein Antrag erst, wenn Projektstruktur, Stunden, Kosten und Dokumentation über Jahre zusammenpassen — und einer Prüfung standhalten.
Vorprüfung
Vorprüfung der Vorhaben gegen die drei Kriterien, bevor Aufwand entsteht.
Antrags-Copilot
Projektbeschreibungen für die BSFZ, aus euren technischen Artefakten hergeleitet.
Zeiterfassung
Stunden und Rollen nach GoBD-Grundsätzen, monatlich festgeschrieben.
Audit-Ready AI
Simulierte Prüfung vor der Einreichung: wo die Argumentation noch nicht trägt.
FAQ
Fragen zur Forschungszulage bei KI-Projekten.
Ist der Einsatz von KI automatisch förderfähig?
Nein. Die Nutzung verfügbarer Modelle einschließlich Prompt-Engineering gilt als Anwendung. Förderfähig kann sein, wer selbst ein Modell, ein Trainings- oder ein Evaluationsverfahren entwickelt und dabei technische Unsicherheit überwindet.