Die Evidenzbewertung im Joint Clinical Assessment (JCA) untersucht die relative klinische Wirksamkeit und Sicherheit eines Arzneimittels anhand der im Assessment Scope festgelegten PICO-Fragestellungen. Entscheidend sind die Eignung der verfügbaren Studien, die Validität direkter und indirekter Vergleiche sowie die Unsicherheit der Ergebnisse. Besonders hohe methodische Anforderungen entstehen, wenn direkte Vergleichsdaten fehlen und die Bewertung auf populationsadjustierten indirekten Vergleichen oder nicht randomisierter Evidenz beruht.
Die ersten veröffentlichten JCA-Berichte zeigen, dass die methodische Beurteilung weit über die Darstellung klinischer Studienergebnisse hinausgeht. Die Auswahl prognostischer Faktoren und Effektmodifikatoren, die Vergleichbarkeit von Studienpopulationen, nachträglich geplante Analysen und die statistische Präzision können die Aussagekraft einer Evidenzsynthese erheblich beeinflussen.
Für pharmazeutische Unternehmer beginnt die methodische Vorbereitung deshalb bereits während der klinischen Entwicklung. Die Verfügbarkeit geeigneter Comparator-Daten, die Planung relevanter Analysen und die Dokumentation zentraler Annahmen bestimmen, in welchem Umfang die klinische Evidenz später für die europäischen PICO-Fragestellungen genutzt werden kann.
Methodischer Rahmen der klinischen Evidenzbewertung im JCA
Das Joint Clinical Assessment bewertet die relative klinische Wirksamkeit und Sicherheit einer Gesundheitstechnologie auf Grundlage der verfügbaren klinischen Evidenz. Die Bewertung erfolgt entlang der im Assessment Scope definierten Populationen, Interventionen, Comparatoren und Outcomes.
Die Verordnung (EU) 2021/2282 schafft dafür einen gemeinsamen europäischen Bewertungsrahmen. Die methodische Durchführung wird durch ergänzende Durchführungsbestimmungen und Leitlinien konkretisiert.
Das JCA beschreibt klinische Effekte und die damit verbundenen Unsicherheiten. Es trifft keine Entscheidung über den nationalen Zusatznutzen, die Erstattung oder die Preisbildung eines Arzneimittels.
Bewertung der klinischen Evidenz entlang der PICO-Fragestellungen
Die PICO-Struktur bestimmt, welche klinischen Vergleiche für die Bewertung relevant sind.
Für jede PICO-Fragestellung muss untersucht werden, welche Studien und Analysen geeignet sind, die relative klinische Wirksamkeit und Sicherheit der Intervention gegenüber dem jeweiligen Comparator zu beschreiben.
Eine klinische Studie kann mehrere PICO-Fragestellungen adressieren. Umgekehrt kann ein PICO zusätzliche Evidenz aus mehreren Studien oder indirekten Vergleichen erfordern.
Die methodische Bewertung berücksichtigt insbesondere, ob die untersuchten Populationen, Interventionen, Vergleichstherapien und Endpunkte den Anforderungen des Assessment Scope entsprechen.
Die Entstehung und Konsolidierung dieser Anforderungen wird im Leitfaden zum JCA-Scoping und PICO behandelt.
Direkte und indirekte vergleichende Evidenz im JCA
Direkte vergleichende Evidenz entsteht, wenn Intervention und Comparator innerhalb derselben Studie untersucht werden.
Indirekte Vergleiche nutzen dagegen Ergebnisse aus unterschiedlichen Studien, um relative Behandlungseffekte abzuleiten.
Die methodischen Voraussetzungen unterscheiden sich erheblich. Bei randomisierten direkten Vergleichen kann die Randomisierung bekannte und unbekannte prognostische Faktoren zwischen den Behandlungsarmen ausgleichen. Bei indirekten Vergleichen muss die Vergleichbarkeit der Studien und Populationen gesondert begründet werden.
Die Wahl der Evidenzsynthese hängt deshalb von der verfügbaren Studienlandschaft und den Eigenschaften der jeweiligen PICO-Fragestellung ab.
Methodische Unsicherheit und Grenzen der Schlussfolgerungen
Die Aussagekraft eines klinischen Vergleichs hängt von der internen Validität der zugrunde liegenden Studien und den Annahmen der Evidenzsynthese ab.
Unsicherheiten können unter anderem aus Verzerrungsrisiken, fehlenden Daten, heterogenen Studienpopulationen, unzureichender statistischer Präzision oder nicht überprüfbaren Modellannahmen entstehen.
Eine statistisch signifikante Effektschätzung beseitigt diese Unsicherheiten nicht automatisch.
Für die JCA-Evidenzbewertung ist deshalb entscheidend, ob die beobachteten Behandlungseffekte methodisch belastbar geschätzt wurden und welche Einschränkungen bei ihrer Interpretation bestehen.
Randomisierte kontrollierte Studien als Grundlage der JCA-Evidenzbewertung
Randomisierte kontrollierte Studien (RCTs) ermöglichen bei geeigneter Durchführung einen direkten Vergleich zwischen Intervention und Comparator und reduzieren zentrale Verzerrungsrisiken. Sie bilden deshalb eine wichtige Grundlage für die vergleichende klinische Evidenzbewertung.
Die Randomisierung allein gewährleistet jedoch noch keine uneingeschränkte Aussagekraft. Studiendurchführung, Analysepopulationen, fehlende Daten und die statistische Planung beeinflussen ebenfalls die Validität der Ergebnisse.
Randomisierung, Allocation Concealment und Verblindung
Die Randomisierung soll gewährleisten, dass sich bekannte und unbekannte prognostische Faktoren zwischen den Behandlungsarmen möglichst gleichmäßig verteilen.
Eine angemessene verdeckte Zuteilung, das Allocation Concealment, verhindert, dass die Kenntnis der bevorstehenden Gruppenzuweisung die Aufnahme von Patientinnen und Patienten beeinflusst.
Verblindung kann zusätzliche Verzerrungen bei der Behandlung, Erhebung und Bewertung klinischer Endpunkte reduzieren.
Welche Bedeutung fehlende Verblindung besitzt, hängt unter anderem von der Art des Endpunkts ab. Objektiv erhobene Mortalitätsdaten können anderen Verzerrungsrisiken unterliegen als subjektiv berichtete Symptome oder Lebensqualitätsendpunkte.
Intention-to-Treat-Prinzip und Analysepopulationen
Das Intention-to-Treat-Prinzip (ITT) sieht vor, randomisierte Patientinnen und Patienten grundsätzlich entsprechend ihrer ursprünglichen Gruppenzuweisung auszuwerten.
Dadurch soll der durch die Randomisierung geschaffene Vergleich erhalten bleiben.
Abweichende Analysepopulationen können zusätzliche Verzerrungen verursachen, insbesondere wenn Ausschlüsse nach der Randomisierung mit der Behandlung oder der Prognose zusammenhängen.
Für die Evidenzbewertung ist deshalb relevant, welche Population in der jeweiligen Analyse berücksichtigt wurde und wie Abweichungen vom geplanten Vorgehen begründet werden.
Präspezifizierte Analysen und statistische Fehlerkontrolle
Präspezifizierte Analysen sind vor der Kenntnis der relevanten Studienergebnisse im Studienprotokoll oder statistischen Analyseplan festgelegt. Sie reduzieren das Risiko, dass analytische Entscheidungen nachträglich anhand beobachteter Ergebnisse getroffen werden.
Besondere Bedeutung besitzen die Definition primärer Endpunkte, die geplanten Hypothesentests und der Umgang mit multiplen statistischen Vergleichen.
Werden mehrere Hypothesen getestet, kann ohne geeignete Fehlerkontrolle die Wahrscheinlichkeit falsch positiver Ergebnisse steigen.
Hierarchische Testverfahren oder andere Verfahren zur Kontrolle des multiplen Testens können diesem Risiko begegnen.
Nachträglich durchgeführte Analysen können zusätzliche Erkenntnisse liefern. Ihre Ergebnisse müssen jedoch unter Berücksichtigung des explorativen Charakters interpretiert werden.
Datenschnitte und Reife der klinischen Evidenz
Die Interpretation klinischer Ergebnisse hängt auch vom Zeitpunkt der Datenerhebung und dem Reifegrad der verfügbaren Daten ab.
Bei zeitabhängigen Endpunkten wie Gesamtüberleben oder progressionsfreiem Überleben können unterschiedliche Datenschnitte zu veränderten Effektschätzungen führen.
Für die Bewertung ist deshalb relevant, ob ein Datenschnitt präspezifiziert wurde, welche Ereigniszahl vorliegt und ob die Ergebnisse durch zusätzliche Nachbeobachtung gestützt werden.
Spätere Datenschnitte liefern nicht automatisch die methodisch maßgebliche Analyse. Entscheidend sind die statistische Planung, die Datenreife und der Status der jeweiligen Auswertung.
Indirekte Vergleiche im JCA: NMA, MAIC und weitere Verfahren
Indirekte Vergleiche können relative Behandlungseffekte schätzen, wenn keine geeignete direkte Vergleichsstudie zwischen Intervention und Comparator vorliegt. Ihre Validität hängt von der Vergleichbarkeit der Studienpopulationen, den verfügbaren Daten und den Annahmen des gewählten statistischen Verfahrens ab.
Im JCA können indirekte Vergleiche besonders relevant werden, wenn der Assessment Scope mehrere Comparatoren umfasst, die in den pivotalen Studien nicht direkt untersucht wurden.
Anchored und unanchored indirect treatment comparisons
Ein anchored indirect treatment comparison nutzt einen gemeinsamen Brückenkomparator, über den zwei Interventionen indirekt miteinander verglichen werden können.
Wenn beispielsweise Studie A die Intervention X mit Behandlung C und Studie B die Intervention Y ebenfalls mit C vergleicht, kann unter geeigneten Voraussetzungen ein indirekter Vergleich zwischen X und Y abgeleitet werden.
Ein unanchored indirect treatment comparison verfügt dagegen über keinen gemeinsamen Brückenkomparator.
Bei unanchored Vergleichen müssen Unterschiede zwischen den Populationen wesentlich umfassender berücksichtigt werden, weil der Schutz durch eine gemeinsame randomisierte Vergleichsstruktur fehlt.
Insbesondere müssen relevante prognostische Faktoren und Effektmodifikatoren angemessen berücksichtigt werden. Nicht gemessene oder nicht verfügbare Variablen können die Validität erheblich einschränken.
Netzwerk-Metaanalysen im JCA
Eine Netzwerk-Metaanalyse (Network Meta-Analysis, NMA) verbindet direkte und indirekte Evidenz aus einem Netzwerk klinischer Studien.
Voraussetzung ist, dass die eingeschlossenen Studien hinsichtlich relevanter klinischer und methodischer Merkmale ausreichend vergleichbar sind.
Das Transitivitätsprinzip verlangt, dass Unterschiede zwischen den Studien die indirekten Vergleiche nicht systematisch verzerren.
Wenn sowohl direkte als auch indirekte Evidenz für denselben Vergleich vorliegt, kann zusätzlich die Konsistenz der Ergebnisse untersucht werden.
Heterogene Populationen, unterschiedliche Endpunktdefinitionen oder abweichende Behandlungssituationen können die Voraussetzungen einer Netzwerk-Metaanalyse beeinträchtigen.
Matching-adjusted indirect comparisons
Matching-adjusted indirect comparisons (MAIC) verwenden individuelle Patientendaten aus mindestens einer Studie, um Unterschiede gegenüber einer Vergleichspopulation auszugleichen, für die häufig nur aggregierte Studiendaten vorliegen.
Dazu werden Patientinnen und Patienten anhand ausgewählter Kovariaten gewichtet, sodass die gewichtete Population hinsichtlich dieser Merkmale besser mit der Vergleichsstudie übereinstimmt.
Die Methode kann insbesondere dann relevant sein, wenn ein klassischer indirekter Vergleich aufgrund unterschiedlicher Studienpopulationen nicht ausreichend geeignet erscheint.
Die Validität hängt jedoch von der Auswahl der Adjustierungsvariablen, der Verfügbarkeit geeigneter Daten und den Annahmen über verbleibende Unterschiede zwischen den Populationen ab.
Ein MAIC kann nicht für unbekannte oder nicht erhobene Variablen adjustieren.
Population-adjusted indirect comparisons
Neben MAIC können weitere populationsadjustierte Verfahren eingesetzt werden, darunter die Simulated Treatment Comparison (STC) und die Multi-Level Network Meta-Regression (ML-NMR).
Diese Verfahren unterscheiden sich hinsichtlich Modellstruktur, Datenanforderungen und der Art, wie Unterschiede zwischen Studienpopulationen berücksichtigt werden.
ML-NMR kann beispielsweise individuelle Patientendaten und aggregierte Studiendaten innerhalb eines gemeinsamen Modellrahmens verbinden.
Die Anwendung komplexerer statistischer Verfahren beseitigt jedoch nicht die grundlegenden Anforderungen an die Vergleichbarkeit der Evidenz.
Insbesondere müssen Modellannahmen, Variablenauswahl und mögliche Verzerrungsquellen nachvollziehbar begründet werden.
Methodische Voraussetzungen indirekter Vergleiche
Für indirekte Vergleiche sind insbesondere folgende Voraussetzungen relevant:
|
Prüfbereich |
Methodische Bedeutung |
|---|---|
|
Vergleichbarkeit der Populationen |
Unterschiede dürfen die Effektschätzung nicht unangemessen verzerren |
|
Comparator-Struktur |
Der Vergleich muss zur gewählten indirekten Methode passen |
|
Prognostische Faktoren |
Relevante Einflussgrößen auf den Outcome müssen berücksichtigt werden |
|
Effektmodifikatoren |
Unterschiede in der relativen Behandlungswirkung müssen adressiert werden |
|
Endpunktdefinitionen |
Ergebnisse müssen klinisch und methodisch ausreichend vergleichbar sein |
|
Modellannahmen |
Statistische Voraussetzungen müssen begründet und geprüft werden |
|
Sensitivitätsanalysen |
Die Robustheit der Ergebnisse muss gegenüber plausiblen Alternativannahmen untersucht werden |
Die Erfüllung dieser Voraussetzungen ist für die Interpretation entscheidender als die statistische Komplexität des eingesetzten Verfahrens.
Prognostische Faktoren und Effektmodifikatoren in indirekten Vergleichen
Prognostische Faktoren beeinflussen den klinischen Verlauf unabhängig von der untersuchten Behandlung, während Effektmodifikatoren die relative Behandlungswirkung verändern können. Beide Variablentypen sind für die Bewertung der Vergleichbarkeit von Studienpopulationen relevant.
Bei populationsadjustierten indirekten Vergleichen kann eine unzureichende Auswahl dieser Variablen zu verzerrten Effektschätzungen führen.
Unterschied zwischen prognostischen Faktoren und Effektmodifikatoren
Ein prognostischer Faktor ist mit dem klinischen Outcome verbunden, unabhängig davon, welche Behandlung angewendet wird.
Ein Effektmodifikator beeinflusst dagegen, wie stark sich der Behandlungseffekt zwischen unterschiedlichen Patientengruppen unterscheidet.
Ein Merkmal kann sowohl prognostisch relevant sein als auch den relativen Behandlungseffekt modifizieren.
Die Unterscheidung ist besonders wichtig, weil die Anforderungen an die Adjustierung vom gewählten indirekten Vergleichsverfahren abhängen.
Bei unanchored Vergleichen ist die Kontrolle relevanter prognostischer Faktoren und Effektmodifikatoren besonders anspruchsvoll.
Identifikation relevanter Variablen
Die Auswahl von Adjustierungsvariablen sollte auf klinischer Evidenz, vorhandener Literatur und einer nachvollziehbaren methodischen Begründung beruhen.
Mögliche Quellen sind systematische Literaturrecherchen, klinische Studien, Registerdaten und wissenschaftliche Erkenntnisse zur Erkrankung.
Die Identifikation darf sich nicht ausschließlich auf statistische Signifikanztests innerhalb eines einzelnen Datensatzes stützen.
Ein fehlender statistisch signifikanter Zusammenhang bedeutet insbesondere bei kleinen Stichproben nicht, dass eine Variable klinisch irrelevant ist.
Kausale Zusammenhänge und Variablenauswahl
Kausale Diagramme, beispielsweise Directed Acyclic Graphs (DAGs), können helfen, angenommene Beziehungen zwischen Behandlung, Patientenmerkmalen und klinischen Outcomes strukturiert darzustellen.
Sie können die Auswahl relevanter Adjustierungsvariablen unterstützen und auf mögliche Verzerrungen durch unangemessene Adjustierung hinweisen.
Ein kausales Diagramm ersetzt jedoch keine empirische Evidenz über die zugrunde liegenden Zusammenhänge.
Seine Aussagekraft hängt von der Plausibilität und Vollständigkeit der angenommenen Beziehungen ab.
Nicht erhobene Variablen und verbleibendes Confounding
Wenn relevante prognostische Faktoren oder Effektmodifikatoren in einer Vergleichsstudie nicht erhoben wurden, können sie in der Analyse häufig nicht angemessen berücksichtigt werden.
Dadurch verbleibt das Risiko, dass beobachtete Unterschiede zwischen den Behandlungen zumindest teilweise auf Unterschiede zwischen den Studienpopulationen zurückzuführen sind.
Statistische Gewichtungsverfahren können dieses Problem nicht vollständig beheben.
Für die Evidenzbewertung muss deshalb transparent dargestellt werden, welche Variablen berücksichtigt wurden, welche Informationen fehlen und wie sich die verbleibende Unsicherheit auf die Interpretation auswirkt.
Statistische Präzision und Effective Sample Size bei MAIC-Analysen
Die Effective Sample Size (ESS) zeigt bei gewichteten MAIC-Analysen, wie stark ungleiche Patientengewichte die effektive Stichprobengröße verringern. Eine kleine ESS weist auf eine starke Konzentration der Gewichte hin und kann mit geringerer statistischer Präzision verbunden sein. Sie belegt jedoch weder die Vergleichbarkeit der Studienpopulationen noch die Abwesenheit von Verzerrungen.
Gewichtung und effektive Stichprobengröße
Bei einem MAIC erhalten Patientinnen und Patienten unterschiedliche Gewichte, um die Verteilung ausgewählter Kovariaten an eine externe Vergleichspopulation anzupassen.
Wenn die Ausgangspopulation stark von der Vergleichspopulation abweicht, können einzelne Beobachtungen sehr hohe Gewichte erhalten.
Dadurch sinkt die effektive Informationsmenge.
Eine häufig verwendete Berechnung der ESS lautet:
ESS = (Summe der Gewichte)² / Summe der quadrierten Gewichte.
Die Kennzahl beschreibt die Gewichtsverteilung, nicht die vollständige Unsicherheit des Behandlungseffekts. Eine geringe ESS kann auf geringe Überlappung zwischen Populationen hindeuten; nicht gemessene Effektmodifikatoren und Confounding lassen sich aus der ESS allein nicht beurteilen.
Kovariatenbalance und Standardized Mean Differences
Standardized Mean Differences (SMD) werden verwendet, um Unterschiede in der Verteilung von Kovariaten zwischen Studienpopulationen zu beschreiben.
Nach der Gewichtung sollte geprüft werden, in welchem Umfang die angestrebte Balance erreicht wurde.
Eine gute Balance der berücksichtigten Kovariaten gewährleistet jedoch nicht, dass die Populationen insgesamt vergleichbar sind.
Nicht gemessene Variablen können weiterhin Unterschiede verursachen, die durch die Gewichtung nicht kontrolliert werden.
Konfidenzintervalle und statistische Unsicherheit
Eine geringe ESS kann zu einer reduzierten statistischen Präzision und breiteren Konfidenzintervallen führen.
Die Interpretation muss deshalb sowohl die Größe der geschätzten Behandlungseffekte als auch ihre Unsicherheit berücksichtigen.
Eine große Effektschätzung bei geringer ESS kann methodisch weniger belastbar sein, als der Punktschätzer zunächst vermuten lässt.
Die ESS allein erlaubt jedoch keine abschließende Bewertung der Validität eines MAIC. Zusätzlich sind die Variablenauswahl, die zugrunde liegenden Modellannahmen und mögliche Verzerrungen zu berücksichtigen.
Nicht randomisierte Evidenz und externe Kontrollgruppen im JCA
Nicht randomisierte Studien und externe Kontrollgruppen können vergleichende klinische Evidenz ergänzen, wenn randomisierte direkte Vergleiche fehlen. Ihre Aussagekraft hängt wesentlich davon ab, ob Unterschiede zwischen den untersuchten Populationen und weitere Verzerrungsquellen angemessen berücksichtigt werden können.
Besondere Bedeutung können solche Daten bei seltenen Erkrankungen, kleinen Patientenpopulationen und klinischen Entwicklungssituationen besitzen, in denen randomisierte Vergleichsstudien nur eingeschränkt verfügbar sind.
Single-Arm-Studien und fehlende interne Kontrollgruppen
Single-Arm-Studien untersuchen eine Intervention ohne parallel randomisierte Kontrollgruppe.
Sie können Informationen über klinische Ergebnisse, Sicherheit und den Verlauf unter Behandlung liefern.
Ein kausaler relativer Behandlungseffekt lässt sich aus einer solchen Studie allein jedoch nicht unmittelbar ableiten.
Für einen Vergleich mit alternativen Therapien werden zusätzliche Daten benötigt.
Historische und externe Vergleichskohorten
Externe Kontrollgruppen können aus früheren klinischen Studien, Registern oder anderen Datenquellen gebildet werden.
Die Vergleichbarkeit hängt unter anderem von Einschlusskriterien, Krankheitsstadium, Vorbehandlungen, Endpunktdefinitionen und Beobachtungszeiträumen ab.
Historische Daten können zusätzlich durch Veränderungen der Versorgungspraxis beeinflusst werden.
Für die Bewertung ist deshalb relevant, ob die externe Vergleichskohorte die klinische Fragestellung des jeweiligen PICO ausreichend abbildet.
Real-World Data und Registerdaten
Real-World Data können Informationen über Behandlungen und klinische Ergebnisse außerhalb randomisierter Studien liefern.
Mögliche Quellen sind Krankheitsregister, elektronische Patientenakten und weitere strukturierte Versorgungsdaten.
Ihre Eignung für vergleichende Analysen hängt von der Datenqualität, der Vollständigkeit relevanter Variablen und der methodischen Kontrolle möglicher Verzerrungen ab.
Die Verfügbarkeit großer Datenmengen ersetzt keine geeignete Studienkonzeption.
Confounding und Selektionsbias
Confounding entsteht, wenn Faktoren sowohl mit der Behandlungszuordnung als auch mit dem klinischen Outcome zusammenhängen und dadurch die Effektschätzung verzerren können.
Selektionsbias kann entstehen, wenn sich die eingeschlossenen Populationen systematisch unterscheiden oder die Auswahl von Patientinnen und Patienten mit Behandlung und Outcome zusammenhängt.
Statistische Adjustierungsverfahren können gemessene Unterschiede berücksichtigen.
Nicht gemessenes Confounding bleibt jedoch eine zentrale Einschränkung nicht randomisierter Vergleiche.
Verzerrungspotenzial und interne Validität der JCA-Evidenz
Die interne Validität beschreibt, inwieweit beobachtete Behandlungseffekte ohne wesentliche systematische Verzerrung geschätzt wurden. Die Bewertung des Risk of Bias ist deshalb ein zentraler Bestandteil der methodischen Einordnung klinischer Evidenz.
Verzerrungsrisiken können sowohl randomisierte als auch nicht randomisierte Studien betreffen, unterscheiden sich jedoch hinsichtlich ihrer Ursachen und Kontrollmöglichkeiten.
Risk of Bias bei randomisierten Studien
Bei randomisierten Studien sind insbesondere die Durchführung der Randomisierung, Abweichungen von der vorgesehenen Behandlung, fehlende Outcome-Daten und die Messung der Endpunkte relevant.
Auch die Auswahl berichteter Ergebnisse kann das Verzerrungspotenzial beeinflussen.
Die Bewertung muss sich auf die konkrete Studie, den jeweiligen Endpunkt und die untersuchte Analyse beziehen.
Eine pauschale Einstufung der gesamten Studie reicht nicht immer aus, um unterschiedliche Risiken einzelner Ergebnisse abzubilden.
Verzerrungsrisiken nicht randomisierter Studien
Bei nicht randomisierten Studien kommt der Kontrolle von Confounding und Selektionsprozessen besondere Bedeutung zu.
Zusätzliche Risiken können durch unterschiedliche Beobachtungszeiträume, unvollständige Datenerhebung und abweichende Endpunktdefinitionen entstehen.
Für die Bewertung muss nachvollziehbar sein, wie die Vergleichsgruppen gebildet wurden und welche Maßnahmen zur Reduktion systematischer Unterschiede eingesetzt wurden.
Fehlende Daten und Missingness
Fehlende Daten können die Ergebnisse klinischer Analysen verzerren, wenn die Wahrscheinlichkeit fehlender Beobachtungen mit Behandlung, Prognose oder Outcome zusammenhängt.
Die Auswirkungen hängen vom Umfang und den Ursachen der fehlenden Daten sowie vom eingesetzten statistischen Verfahren ab.
Eine vollständige Fallanalyse kann beispielsweise problematisch sein, wenn sich Patientinnen und Patienten mit fehlenden Daten systematisch von den übrigen Studienteilnehmenden unterscheiden.
Für die Evidenzbewertung sind deshalb die Annahmen zum Missing-Data-Mechanismus und die Robustheit gegenüber alternativen Annahmen relevant.
Endpunkte und Subgruppenanalysen in der JCA-Evidenzbewertung
Die methodische Aussagekraft klinischer Endpunkte hängt von ihrer Definition, Erhebung und statistischen Auswertung ab. Für die JCA-Evidenzbewertung ist entscheidend, ob die verfügbaren Ergebnisse die im Assessment Scope festgelegten klinischen Fragestellungen ausreichend adressieren.
Mortalität, Morbidität und gesundheitsbezogene Lebensqualität
Klinische Endpunkte können unterschiedliche Dimensionen des Behandlungseffekts abbilden.
Mortalitätsendpunkte untersuchen beispielsweise das Gesamtüberleben. Morbiditätsendpunkte können krankheitsbezogene Symptome, funktionelle Einschränkungen oder klinische Ereignisse erfassen.
Die gesundheitsbezogene Lebensqualität beschreibt Auswirkungen der Erkrankung und Behandlung auf das körperliche, psychische und soziale Wohlbefinden.
Für die Interpretation sind die klinische Relevanz des Endpunkts, seine Operationalisierung und die methodische Qualität der verfügbaren Ergebnisse entscheidend.
Patient-reported Outcomes
Patient-reported Outcomes (PROs) erfassen den Gesundheitszustand aus Sicht der Patientinnen und Patienten.
Ihre Aussagekraft hängt von validierten Messinstrumenten, geeigneten Erhebungszeitpunkten und einer ausreichenden Datenvollständigkeit ab.
Bei offenen Studien können patientenberichtete Endpunkte besonderen Verzerrungsrisiken unterliegen.
Auch hohe Ausfallraten können die Interpretation erschweren, insbesondere wenn fehlende Angaben mit dem Gesundheitszustand oder der Behandlung zusammenhängen.
Surrogatendpunkte und klinische Interpretation
Surrogatendpunkte erfassen biologische oder klinische Merkmale, die stellvertretend für patientenrelevante Ergebnisse verwendet werden.
Ihre Aussagekraft hängt davon ab, inwieweit Veränderungen des Surrogatendpunkts tatsächlich mit Veränderungen klinisch relevanter Outcomes verbunden sind.
Ein statistisch signifikanter Effekt auf einen Surrogatendpunkt erlaubt deshalb nicht automatisch eine entsprechende Schlussfolgerung für Mortalität, Morbidität oder Lebensqualität.
Präspezifizierte und post hoc durchgeführte Subgruppenanalysen
Subgruppenanalysen untersuchen, ob sich Behandlungseffekte zwischen unterschiedlichen Patientengruppen unterscheiden.
Ihre Interpretation hängt insbesondere davon ab, ob die Analyse präspezifiziert wurde, welche klinische Begründung vorliegt und ob geeignete statistische Interaktionstests durchgeführt wurden.
Ein signifikanter Behandlungseffekt in einer Subgruppe und ein nicht signifikanter Effekt in einer anderen Subgruppe belegen für sich genommen noch keinen Unterschied zwischen den Behandlungseffekten.
Nachträgliche Subgruppenanalysen können zusätzliche Hypothesen generieren, unterliegen jedoch einem erhöhten Risiko zufälliger Befunde.
Sensitivitätsanalysen und Robustheit der JCA-Ergebnisse
Sensitivitätsanalysen untersuchen, wie stark klinische Effektschätzungen von methodischen Annahmen und analytischen Entscheidungen abhängen. Sie sind besonders relevant, wenn die Evidenz auf indirekten Vergleichen, externen Kontrollgruppen oder komplexen statistischen Modellen beruht.
Eine belastbare Evidenzsynthese sollte erkennen lassen, welche Annahmen für die Ergebnisse entscheidend sind und wie sich plausible alternative Vorgehensweisen auswirken.
Sensitivitätsanalysen bei indirekten Vergleichen
Bei indirekten Vergleichen können Sensitivitätsanalysen beispielsweise alternative Studienauswahlen, Modellannahmen oder Adjustierungsvariablen untersuchen.
Bei MAIC-Analysen kann geprüft werden, wie sich unterschiedliche Kovariatensets auf die Gewichtung, die ESS und die geschätzten Behandlungseffekte auswirken.
Bei Netzwerk-Metaanalysen können alternative Modellannahmen oder Einschränkungen des Studiennetzwerks untersucht werden.
Robustheitsanalysen bei nicht randomisierten Daten
Nicht randomisierte Vergleiche können durch alternative Definitionen der Studienpopulation, unterschiedliche Adjustierungsverfahren oder Annahmen über unbeobachtetes Confounding überprüft werden.
Die Ergebnisse solcher Analysen können Hinweise darauf liefern, wie empfindlich die Effektschätzung gegenüber methodischen Entscheidungen ist.
Sie können jedoch nicht beweisen, dass sämtliche Verzerrungsquellen ausgeschlossen wurden.
Interpretation widersprüchlicher Analyseergebnisse
Wenn Sensitivitätsanalysen zu deutlich unterschiedlichen Ergebnissen führen, weist dies auf eine Abhängigkeit der Effektschätzung von bestimmten Annahmen hin.
Für die Evidenzbewertung ist dann relevant, welche Annahmen klinisch und methodisch plausibel sind und welche Unsicherheit bestehen bleibt.
Die Auswahl ausschließlich günstiger Analyseergebnisse wäre methodisch nicht ausreichend.
Entscheidend ist eine transparente Darstellung der Ergebnisse und ihrer Einschränkungen.
Methodische Erkenntnisse aus den ersten veröffentlichten JCA-Berichten
Die ersten veröffentlichten JCA-Berichte verdeutlichen, dass die methodische Validität vergleichender Evidenz eine zentrale Herausforderung der europäischen klinischen Bewertung darstellt. Besonders häufig betreffen die diskutierten Unsicherheiten indirekte Vergleiche, prognostische Faktoren, nicht randomisierte Daten und nachträglich geplante Analysen.
Die Verfahren zu Tovorafenib, Lurbinectedin, Tarlatamab und Onasemnogene abeparvovec illustrieren unterschiedliche Evidenzsituationen, von randomisierten direkten Vergleichen bis zu externen Kontrollgruppen und populationsadjustierten indirekten Analysen.
Die Erfahrungen zeigen insbesondere, dass die statistische Komplexität eines Verfahrens fehlende Vergleichbarkeit oder unzureichende Ausgangsdaten nicht automatisch kompensieren kann.
Eine ausführliche Analyse der vier Verfahren und der veröffentlichten methodischen Bewertungen findet sich im Insight Joint Clinical Assessment: Was die ersten vier JCA Reports über die Evidenzbewertung zeigen.
Methodische Vorbereitung der JCA-Evidenzbewertung für Hersteller
Die methodische Vorbereitung eines JCA beginnt vor der Einreichung des JCA-Dossiers und sollte die verfügbaren Studien, mögliche Comparator-Anforderungen und die Voraussetzungen geplanter Evidenzsynthesen systematisch berücksichtigen.
Für pharmazeutische Unternehmer ergeben sich sieben zentrale Prüfpunkte:
Direkte Evidenz: Welche PICO-Fragestellungen können durch randomisierte direkte Vergleiche adressiert werden?
Indirekte Vergleiche: Welche zusätzlichen Comparatoren erfordern eine indirekte Evidenzsynthese?
Variablenauswahl: Sind relevante prognostische Faktoren und Effektmodifikatoren identifiziert und dokumentiert?
Datenverfügbarkeit: Liegen die erforderlichen individuellen oder aggregierten Studiendaten vor?
Statistische Präzision: Welche Auswirkungen haben Gewichtung, Stichprobengröße und Datenheterogenität auf die Effektschätzung?
Verzerrungsrisiken: Welche Einschränkungen ergeben sich aus Studiendesign, Confounding und fehlenden Daten?
Robustheit: Welche Sensitivitätsanalysen sind erforderlich, um zentrale Annahmen zu prüfen?
Die frühzeitige Bearbeitung dieser Fragen kann helfen, methodische Einschränkungen zu identifizieren und die Evidenzplanung auf die erwarteten Anforderungen des Assessment Scope auszurichten.
Die konkreten Anforderungen an Aufbau, Dokumentation und Einreichung der Analysen werden im Leitfaden zum JCA-Dossier behandelt. Zeitplan und Fristen des Verfahrens beschreibt der Leitfaden zum JCA-Verfahren.
Wie sich methodische Unterschiede nach dem JCA in nationalen Verfahren fortsetzen, zeigt der Insight EU-JCA und nationale HTA-Verfahren: Wo die methodischen Unterschiede nach dem JCA beginnen. Für Deutschland erläutert der Leitfaden zum AMNOG-Dossier, wie Evidenz im nationalen Nutzendossier aufbereitet wird.
Quellen und regulatorische Grundlagen
Verordnung (EU) 2021/2282 über die Bewertung von Gesundheitstechnologien.
Europäische Kommission und HTA Coordination Group: Methodische Leitlinien zur gemeinsamen klinischen Bewertung, zu direkten und indirekten Vergleichen sowie zur Bewertung klinischer Evidenz.
Europäische Kommission: Joint Clinical Assessment Reports zu Tovorafenib, Lurbinectedin, Tarlatamab und Onasemnogene abeparvovec, 2026.