Оценката на AI за патология трябва да отговаря на конкретен въпрос за определен работен процес, потребители, входни данни и предназначен резултат. Резултат от една лаборатория не е автоматично доказателство, че същият софтуер ще работи по същия начин в друга. Разликите в обекта, скенера, оцветяването, състава на случаите и работния процес трябва да бъдат отчетени.
Започнете с предназначението
Опишете предназначението преди избора на метрики. Посочете дали софтуерът е за изследователска работа, контрол на качеството, триаж, измерване или подпомагане на клинични решения. Определете потребителите, типовете проби и изображения, изключенията, резултата и решението, което той може да подпомогне. Образователната оценка не доказва клинична безопасност, регулаторен статут или разрешение за използване на софтуера за диагностика.
Характеризирайте всеки обект
Запишете моделите скенери, увеличението, форматите на изображенията, протоколите за оцветяване, подготовката на тъканите, условията за съхранение, състава на случаите, разпространението на находките и липсващите или отхвърлени изображения. Документирайте как са избрани случаите и дали някой обект е участвал в разработката или настройката. Така по-лесно се различава ограничение на модела от разлика в данните или работния процес.
Измервайте работния процес човек-AI
Производителността на модела е само част от оценката на клиничния работен процес. Измервайте как потребителите интерпретират резултата, дали той променя времето за преглед или решенията, колко често се отхвърля и какво се случва при недостъпен резултат или случай извън валидирания обхват. Дори при едновременна подкрепа решението изисква професионална преценка и преглед на основния случай.
Планирайте мониторинга преди старта
Определете периодичност за преглед на промени в данните, качеството на входа, производителността по подгрупи, сигналите за грешки, отхвърлянията и промените в скенери или оцветяване. Назначете отговорници за разследване, ескалация, комуникация и връщане към предишна версия. Мониторингът трябва да продължи през целия жизнен цикъл на софтуера, а не да приключва след първоначалната оценка.
Практическият извод е ясен: многоцентровата оценка е документирано изследване на взаимодействието човек-AI и на работния процес, а не едно число за точност. Третирайте резултата като подкрепа за решение, освен ако конкретното предназначение и приложимото разрешение не определят друго, и оставете патолога или друг квалифициран професионалист отговорен за клиничното решение.
Източници
- Good Machine Learning Practice for Medical Device Development: Guiding Principles (U.S. Food and Drug Administration)
- Artificial Intelligence Risk Management Framework (National Institute of Standards and Technology)
- Ethics and governance of artificial intelligence for health (World Health Organization)
Автор
Digital Pathology Solutions Editorial Team
Medical AI and digital pathology




