DiqqatMNIST: Qo'lda yozilgan raqamlar va alifbolarni aniqlash uchun sichqonchani bosish orqali diqqatni kuzatish ma'lumotlar to'plami

Feb 22, 2024

Ob'ektlarni ko'rishlar ketma-ketligi orqali taniydigan bir nechta diqqatga asoslangan modellar qo'lda yozilgan raqamlarni tanib olish natijalari haqida xabar berdi. Biroq, qo'lda yozilgan raqam yoki alifboni tanib olish uchun diqqatni kuzatish ma'lumotlari mavjud emas. Bunday ma'lumotlarning mavjudligi diqqatga asoslangan modellarni inson faoliyati bilan solishtirganda baholash imkonini beradi. Biz ketma-ket namuna olish orqali rasmlardan qo'lda yozilgan raqamlar va alifbolarni (katta va kichik harflar) tan olishga harakat qilayotgan 382 ishtirokchidan sichqonchani bosish orqali diqqatni kuzatish ma'lumotlarini yig'amiz. Benchmark ma'lumotlar to'plamidagi rasmlar ogohlantiruvchi sifatida taqdim etiladi. AttentionMNIST deb nomlangan to'plangan ma'lumotlar to'plami namunaviy (sichqonchani bosish) manzillar ketma-ketligidan iborat, pr.har bir namuna olishda tartibga solingan sinf yorlig'i(lar)i va har bir namuna olishning davomiyligi. Ishtirokchilarimiz tanib olish uchun o'rtacha atigi 12,8% tasvirni kuzatadilar. Biz joylashuvni bashorat qilish uchun asosiy modelni taklif qilamiz va keyingi namuna olishda ishtirokchi tanlaydigan sinf(lar). Ishtirokchilarimiz bilan bir xil stimullar va eksperimental sharoitlarga duchor bo'lganda, diqqatga sazovor bo'lgan mustahkamlanish modeli inson samaradorligidan past bo'ladi.

Chinese herb cistanche

Xitoy sistancheo't- Altsgeymer kasalligi mahsulotlarini oldini olish

So'nggi yillarda ob'ektlarni ko'rishlar ketma-ketligi orqali taniydigan mashinani o'rganish (ML) modellari ularning kengaytirilishi va samaradorligi tufayli qiziqish uyg'otdi. Ushbu modellarning ko'pchiligi, masalan, 1-7, qo'lda yozilgan raqamlarni tanib olish uchun MNIST ma'lumotlar to'plamida eksperimental natijalar haqida xabar berdi. Afsuski, MNIST uchun diqqatni kuzatish bo'yicha ma'lumotlar mavjud emas. Bu diqqatga asoslangan modellarni inson faoliyati bilan solishtirganda baholashga to'sqinlik qiladi. Biz ketma-ket namuna olish orqali rasmlardan qo'lda yozilgan raqamlar va alifbolarni tan olishga harakat qilayotgan kattalar ishtirokchilaridan ma'lumotlar to'plamini to'plash orqali bu bo'shliqqa tushib qoldik. Ko'z harakati diqqatini kuzatishdan (emAT) farqli o'laroq, ishtirokchi rasmdagi o'zi ko'rmoqchi bo'lgan joyni bosadi (sichqonchani bosish orqali diqqatni kuzatish (mcAT) shakli). Shundan so'ng, u hozirgacha olib borgan kuzatishlari asosida ob'ekt tegishli bo'lishi mumkinligini taxmin qilgan sinf(lar)ni tanlaydi. Shunday qilib, har bir namuna olish epizodida bizning ma'lumotlarimiz tanlangan rasm joylashuvi, bashorat qilingan sinf yorlig'i (lar)i va ishtirokchi tomonidan oxirgi epizoddan beri olingan vaqtdan iborat. Har bir tasvirdan so'ng, ishtirokchi o'zining ishlashi (aniqlik va samaradorlik) asosida mukofot oladi.

Anti Alzheimer's disease

Cistanche tubulosa-Anti Altsgeymer kasalligining foydalari

Qo'lda yozilgan raqam/alifboni tanib olish uchun mcAT ning emAT ga nisbatan afzalliklari.

(1) go'sht fiksatsiya joyida, ayniqsa statik stimullar uchun (tasvirlar) sezilarli darajada ichki va shaxslararo o'zgaruvchanlikni o'z ichiga oladi8,9. Shunday qilib, statistik jihatdan muhim xulosalarga kelish uchun ko'zni fiksatsiya qilish bo'yicha katta hajmdagi ma'lumotlar kerak bo'ladi. mcAT ko'zni kuzatish ma'lumotlariga xos bo'lgan ba'zi texnik shovqin manbalariga sezgir emas10. (2) Ko'z harakati ham ixtiyoriy, ham ixtiyorsiz mexanizmlardan kelib chiqishi mumkin11. Vazifaga bog'liq qaror qabul qilishni osonlashtirish uchun biz ishtirokchilarga ML modeliga taqdim etilishi mumkin bo'lgan etarli vaqt, kontekst va kuchaytirish signallarini taqdim etamiz. (3) emAT ma'lumotlarining aniqligi va aniqligi ko'z-trekerga bog'liq, mcAT esa har qanday qurilmadan mustaqil. (4) Ko'z harakatlarini sinf tanlash bilan sinxronlashtirish qiyin. Buni bartaraf etish uchun bizning holatlarimizda namuna olish joyi va sinf(lar) bir xil epizodda tanlanadi. (5) Nihoyat, bizning usulimiz Amazon Mechanical Turk (MTurk) yordamida ma'lumotlarni to'plash imkonini beradi, 12,13 kabi, bu iqtisodiy va vaqtni tejaydigan va osonlik bilan takrorlanishi mumkin.

Hissalar.

Biz 382 ishtirokchidan MTurk yordamida AttentionMNIST deb nomlangan mcAT maʼlumotlar toʻplamini toʻplaymiz, ketma-ket namuna olish orqali rasmlardan qoʻlda yozilgan raqamlar va alifbolarni (katta va kichik) toʻgʻri va samarali tanib olish uchun mukofotlanadi. Benchmark ma'lumotlar to'plamidagi tasvirlar (MNIST, EMNIST) ogohlantiruvchi sifatida taqdim etiladi. Har bir raqam/alifbo sinfiga o'rtacha 169,1 ta javob yoziladi. Ushbu ma'lumotlar to'plamidan foydalanib, biz quyidagilarni ko'rsatamiz: • O'rtacha, ishtirokchilar rasm maydonining atigi 11,3%, 13,4% va 13,7% ga to'g'ri keladigan raqam, katta va kichik alifbolarni tanib olish uchun o'rtacha 4,2, 4,7 va 4,9 namuna talab qiladi. . Tasniflash aniqligi bir nechta namunalar bilan ortadi. • Baza sifatida taqdim etilgan model barcha namunalar va ma'lumotlar to'plamlari bo'yicha o'rtacha olingan mos ravishda 74,4% va 67,7% aniqlik bilan keyingi namuna olish epizodida ishtirokchi tanlaydigan sinf(lar) va joylashuvni bashorat qilishi mumkin. Sinfni bashorat qilish aniqligi oshadi va joylashuvni bashorat qilish aniqligi namunalar ko'payishi bilan kamayadi. • Ishtirokchilarimiz bilan bir xil stimul va shartlarga duchor bo'lganda, yuqori iqtiboslarga asoslangan takroriy e'tibor modeli (RAM) 3 raqamli, katta va kichik alifboni tanib olish uchun 3,7, 8,5 va 7,6 namunalarni talab qiladi, bu 8,9% ga to'g'ri keladi. , 21.0%, mos ravishda rasm maydonining 18,7%. Diqqatga asoslangan boshqa mustahkamlash modellari (masalan, 1,2,4,5,7,14) inson faoliyati bilan solishtirganda xuddi shunday baholanishi mumkin.

Cistanche supplement near me-Improve memory2

Mening yonimda Cistanche qo'shimchasi-Xotirani yaxshilash

Cistanche Xotirani yaxshilash va Altsgeymer kasalligining oldini olish mahsulotlarini ko'rish uchun shu yerni bosing

【Batafsil ma'lumot so'rang】 Email:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Tegishli ish

MCAT-da sichqonchani bosishning vaqtinchalik ketma-ketligi ko'z harakati skanerlash yo'liga o'xshaydi10. mcAT emAT ni samarali ravishda almashtirishi mumkin, chunki ular sezilarli darajada bog'liqdir10,12,13,15-17. MCAT tadqiqotlarida jonli va jonsiz jismlarning tasvirlari10, tabiiy sahnalar tasvirlari12,13, statik veb-sahifalar13, qidiruv sahifasi maketlari16 va vizual taqqoslash uchun alfanumerik satrlarning ikkita ro'yxati17 kabi turli xil stimullardan foydalanilgan. Biroq, mcAT qo'lda yozilgan raqam/alifbo tasniflash vazifalari yoki diqqatga asoslangan tasniflash modellarini baholash uchun ishlatilmagan. mcAT tadqiqotlari aloqa qilish vaqti, qiziqish sohalarida nisbiy fiksatsiya chastotasi (AOI), AOI10da kamida bir marta bosgan sub'ektlarning nisbiy nisbati, har bir sinov uchun fiksatsiyalar soni, sinovlar ichida tuzatish, yashash vaqtlari va skanerlash yo'llari17 kabi xususiyatlardan foydalangan. , fiksatsiya xaritalari12,13, AOI va axborot oqimi sxemasi16. Vaqt tamg'asi bo'lgan bosish joylari va bashorat qilingan sinf yorliqlari ketma-ketligi tasniflash vazifalarida diqqatga asoslangan modellar yoki odamlarning samaradorligi va aniqligini baholash uchun zarur bo'lgan xom ashyoni tashkil qiladi. Ushbu ma'lumotlardan turli xil xususiyatlarni olish mumkin. Bizning mcAT ma'lumotlar to'plamimiz ko'zni kuzatish ma'lumotlariga nisbatan bir nechta afzalliklarga ega bo'lib, AI, ML va boshqa sohalarda e'tiborga asoslangan model tadqiqotlaridagi muhim bo'shliqni to'ldiradi. Bizning ma'lumotlar to'plamimiz diqqatga asoslangan modellarni inson faoliyati bilan solishtirganda baholashga imkon beradi. Boshqa narsalar qatorida, bu amalda keng qo'llaniladigan samarali va real vaqtda optik belgilarni aniqlash tizimlarini ishlab chiqishga yordam beradi (masalan, 18-20). Vizual fiksatsiyalarni boshqaradigan printsiplarni bizning ma'lumotlar to'plamimiz yordamida gipoteza qilish va sinab ko'rish mumkin. Muvaffaqiyatli tamoyillar avtonom haydash kabi samaradorlik muhim ahamiyatga ega bo'lgan real dunyoda vizual aniqlash vazifalari uchun tizimlarni ishlab chiqishga o'tkazilishi mumkin.

Ma'lumotlar

Bizning ma'lumotlarimiz har bir ishtirokchi uchun T epizodlari ketma-ketligidan iborat. Har bir epizod maʼlumotlari (1) ishtirokchi tomonidan bosilgan rasmdagi joylashuv (har bir epizod uchun rasmga bir marta bosish), (2) ishtirokchi tanlagan sinf(lar) va (3) ishtirokchi tomonidan olingan vaqtdan iborat. ishtirokchi joriy namunani ro'yxatdan o'tkazish uchun (ya'ni rasmdagi oxirgi va joriy bosishlar orasidagi vaqt). Ushbu bo'limda ma'lumotlar to'plash jarayoni, jumladan, stimullarni tanlash, ishtirokchilar, vizual vazifalar, ish faoliyatini baholash va ma'lumotlarni filtrlash tushuntiriladi.

Rag'batlantiruvchi tanlov. Rag'batlantiruvchilar ikkita benchmark ma'lumotlar to'plamidagi rasmlardan tanlanadi: (1)

MNIST21 ma'lumotlar to'plami 70,000 yorliqli tasvirdan (28×28 piksel) iborat bo'lib, 10 ta qo'lda yozilgan {0, 1, ..., 9} raqamlaridan iborat. (2)

EMNIST22 ma'lumotlar to'plami 145 600 ta tasvirdan (28 × 28 piksel) iborat bo'lib, katta va kichik harflarda qo'lda yozilgan ingliz alifbosi bo'lib, muvozanatli sinfni tashkil qiladi. Barcha rasmlar {a, b, ..., z} 26 sinfdan biri bilan etiketlanadi. Biroq, katta yoki kichik yorliq hech qanday tasvir bilan bog'lanmaydi. Har bir toifadan biz MNIST dan 15 ta yaxshi shakllangan raqamlarni va EMNIST katta va EMNIST kichik maʼlumotlar toʻplamidan har biri yaxshi shakllangan 15 ta alifboni tanlaymiz. Yaxshi shakllangan raqam yoki alifbo o'z sinfining normasiga o'xshaydi. Shunday qilib, biz 15(10 + 26 + 26)=930 noyob tasvirlar toʻplamidan stimullarni taqdim etamiz, ularda 62 ta sinfning har biriga tegishli 15 ta tasvir mavjud. Yaxshi shakllangan 930 ta tasvir quyidagi tarzda tanlanadi:

1-qadam: Har bir tasvirni 0 va 1 oralig‘ida intensivlikni o‘lchash uchun min-maks yordamida normallashtiring.

2-qadam: Yaxshi shakllangan EMNIST rasmlarini katta yoki kichik harflar bilan belgilang. Har bir alifbo sinfi uchun katta va kichik tasvirlardan yaxshi shakllangan alifbo qo'lda tanlanadi va etiketlanadi. Ushbu sinfga tegishli barcha tasvirlarning ikkita etiketli tasvir bilan kosinus o'xshashligi hisoblanadi. Kosinus o'xshashlik chegarasidan yuqori bo'lgan rasmlarga (0.8 sifatida empirik tanlangan) katta yoki kichik harflar yorlig'i beriladi.

3-qadam: Har bir sinfga tegishli tasvirlarning o'rtacha qiymatini hisoblang. Sinfning o'rtacha qiyofasi uning me'yorini tashkil qiladi. Agar uning sinfidagi oʻrtacha tasvir bilan kosinus oʻxshashligi empirik aniqlangan chegaradan katta boʻlsa (MNIST uchun 0.7, EMNIST uchun 0.75) rasm stimulyator boʻlishi mumkin.

4-qadam: Kerakli tasvirlar orasidan har bir sinfdan 15 ta rasm ularning qanchalik yaxshi shakllanganligiga qarab qo‘lda tanlanadi. Dastlab 28 × 28 piksel o'lchamdagi har bir tasvir chegaralar yaqinidagi piksellarni olib tashlash orqali 27 × 25 gacha qisqartiriladi, chunki ular intensivlik o'zgarishiga ega emas. Ushbu 15 ta tasvirning o'rtacha qiymati 62 ta sinfning har biri uchun hisoblanadi. Biz bu o'rtacha tasvirlarni har bir ma'lumot to'plamidagi n sinf uchun I1, I2, ..., In deb belgilaymiz.

Ishtirokchilar.

Tadqiqotimizda jami 382 ta katta yoshdagi shaxslar ishtirok etdi. Tanlov mezonlaridan foydalanilmagan. Ishtirokchi bir nechta rasmga javob berishi mumkin. 62 ta sinfning har biri uchun o'rtacha 169,1 ta javob qayd etilgan.

man-5989553_960_720

Cistanche tubulosa-ning afzalliklariAltsgeymer kasalligiga qarshi

Vizual vazifa.

Vizual vazifamiz uchun MTurk interfeysi 1-rasmda ko'rsatilgan. 270×250 o'lchamdagi tuval har doim past intensivlikdagi fon tasvirini ko'rsatadi. Fon va rag'batlantiruvchi tasvirlar o'n marta 270 × 250 ga ko'tariladi. Tuvalning o'rtasi tasvirlar markaziga to'g'ri keladi. Fon Dastlab, fon ma'lumotlar to'plamidagi barcha tasvirlarning o'rtacha qiymati bo'lib, unda stimul olingan. Birinchi epizoddan so'ng, fon oxirgi epizodda ishtirokchi tomonidan tanlangan sinflar to'plamidagi barcha tasvirlarning o'rtacha qiymatidir. Haqiqiy dunyoda raqam yoki alifboning joylashuvi, o'lchami va yo'nalishi uchun kontekst bu erda etishmayotgan uning qo'shnisidagi yozuvdan olinadi. Bizning tajribalarimiz bo'sh fon bilan o'tkazilganda, ishtirokchilar ko'pincha ob'ektning biron bir qismini o'z ichiga olmagan tasvirning joylarini tanladilar. Ushbu xatti-harakat tanlangan sinf(lar) ning o'rtacha tasvirini past intensivlikdagi fonda taqdim etish va barcha MNIST va EMNIST tasvirlarining o'lchamini 28 × 28 pikseldan 27 × 25 gacha kamaytirish orqali amalga oshirildi. Ishtirokchi har safar tuvaldagi joyni bosish orqali tanlaganida, rag'batlantiruvchi tasvirdan o'sha joyda markazlashtirilgan 50 × 50 pikselli yamoq paydo bo'ladi. Bir marta aniqlangan yamoq oxirgi epizodgacha ko'rsatilishida davom etadi. Ishtirokchining vazifasi har bir t epizodida uchta bosqichdan iborat (t=1, ..., T):

1-qadam: U namuna olmoqchi bo'lgan yamoqni ochish uchun 270 × 250 tuvalning istalgan joyini bosing. Faqat birinchi bosish qabul qilinadi.

2-qadam: Hozirgacha kuzatilgan barcha namunalardagi raqam/alifboni tanib oling. Ishtirokchi bir nechta sinflarni tanlashi mumkin va tuval ostida ko'rsatilgan sinflar ro'yxatidan kamida bitta sinfni tanlashi kerak.

3-qadam: Davom etish uchun ekranning pastki qismidagi "Keyingi" tugmasini bosing. Sinfni to'g'ri va tez xulosa qilish uchun ishtirokchi joriy epizodgacha bo'lgan kuzatuvlarini hisobga olgan holda joylarni oqilona tanlashi kerak. Epizod uchun vaqt chegarasi yo'q. Biroq, biz tasvirning T epizodlari uchun umumiy vaqtni olti daqiqagacha cheklaymiz. Biz T=12 ni tanlaymiz, chunki diqqatga asoslangan qoʻlyozmani aniqlash yoki yaratish boʻyicha juda koʻp iqtibos keltiriladigan ishlar 12 dan kam koʻrinishdan foydalanilgan (masalan, RAM3 MNIST raqamlarini 7 koʻrishda taniydi, DRAW23 MNIST raqamlarini 11 koʻrishda hosil qilishi mumkin) va odamlar qo'lda yozilgan raqamlar va alifbolarni 12 dan kamroq ko'rinishda taniy oladilar.

Ishlash bahosi. Ishtirokchiga kuzatilgan namunalar soni bo'yicha uning aniqligi va samaradorligiga qarab ball qo'yiladi. U har qanday epizod t tanlagan sinflar majmui bo'lsin. O'n, uning t balli:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Shakl 1. Ishtirokchi ko'rgan MTurk interfeysimiz. EMNIST bosh alifbosi uchun ikkinchi namuna ko'rsatilgan.

image


qaerda |.| to‘plamning kardinalligini bildiradi. T epizodlarda berilgan umumiy ball h {0}} T t=1 Pt. Shuning uchun, agar u har doim faqat to'g'ri sinfni tanlasa, T epizodlarida maksimal ball olishi mumkin. Agar u har doim to'g'ri sinfni o'z ichiga olmaydigan sinflar to'plamini tanlasa, T epizodlarida to'plashi mumkin bo'lgan minimal ball nolga teng. Shunday qilib, 0 dan kam yoki teng h T dan kam yoki teng. Ishtirokchi qanchalik tezroq to'g'ri sinfni tanlasa, uning balli shunchalik yuqori bo'ladi. Shunday qilib, ushbu ball mexanizmi tanib olishning aniqligi va namuna olish samaradorligini hisobga oladi. Birinchi epizoddan faqat bitta sinfni tanlash orqali ballni maksimal darajada oshirishga urinish xavfli bo'ladi, chunki agar sinf to'g'ri bo'lmasa, nol ball beriladi, agar ishtirokchi bir nechta sinfni tanlasa, noldan katta ball beriladi ( hatto barcha sinflar) to'g'ri sinfni o'z ichiga oladi. Bu ishtirokchini har qanday epizodda uning ongida mumkin bo'lgan sinflar asosida javob berishga undaydi. Ishtirokchiga hech qanday maslahat bermaslik uchun har bir epizodda berilgan ball faqat T epizodlari tugagandan so'ng oshkor qilinadi. MTurkda ishtirokchining tasvir uchun olgan mukofoti uning umumiy balliga mutanosib, h.

Ma'lumotlarni filtrlash.

Agar ishtirokchining rag'batlantiruvchi tasvir uchun yakuniy (ya'ni T-th) epizodidagi balli nolga teng bo'lsa, uning ushbu tasvir uchun yozilgan ma'lumotlari o'chiriladi. Agar ishtirokchi topshiriqni to'liq qoldirmasa, ma'lumotlar o'chiriladi. Ushbu tanlov mezonlari bilan biz MNIST dan 1736 ta stimulga, EMNIST bosh harfidan 4431 ta ogohlantirishga va EMNIST kichik harfidan 4315 ta ogohlantirishga javob oldik; ya'ni har bir sinfga o'rtacha 169,1 javob.

Ma'lumotlardan foydalanish modellari va usullari

Ushbu bo'limda biz to'plangan ma'lumotlarning foydaliligini (4.1) ishtirokchining xatti-harakatini bashorat qilish uchun asosiy modelni taqdim etish va (4.2) mavjud e'tiborga asoslangan mustahkamlash modelini odamning raqamlari/alifbosi tan olinishi bilan qanday solishtirish mumkinligini ko'rsatamiz. ishlash. Xulq-atvorni bashorat qilish uchun asos. Har qanday epizodda o'zini tutish t joy tanlash va sinf tanlashdan iborat. Namuna turli kuzatuvchilar uchun yoki hatto bir xil kuzatuvchi uchun turli vaqtlarda turli xil hajmdagi ma'lumotlarni o'z ichiga olganligi sababli, har bir ishtirokchining xatti-harakatlarini bashorat qilish qiyin muammodir. n - ma'lumotlar to'plamidagi sinflar soni, ēt - t da ogohlantiruvchi tasvir uchun haqiqiy sinfni o'z ichiga olgan yagona to'plam, ct - sinflar to'plami va t - t da ishtirokchi tomonidan uning kuzatishi uchun tanlangan joy. t, 1:t esa 1, 2, ..., t ketma-ketligini bildiradi. Har qanday t gacha, ishtirokchining kuzatishlari o1:t, u tanlagan joylar esa l1:t. Ishtirokchining xatti-harakatini bashorat qilish muammosini quyidagicha shakllantiramiz: Sinfni bashorat qilish Uning o1:t va l1:t, ya'ni P( ni hisobga olgan holda i∈ct (i=1, 2, ..., n) ehtimolini hisoblang. i ∈ ct|o1:t, l1:t). Joylashuvni bashorat qilish Uning o1:t, l1:t va ct, ya'ni P(lt+1|o1:t, l1:t,ct) berilgan lt+1 ehtimolini hisoblang. Sinfni bashorat qilish. Ishtirokchi t epizodida tanlaydigan sinfni bashorat qilish uchun biz ishtirokchining tanlangan joylari l1:t va tegishli kuzatuvlar o1:t ni hisobga olgan holda tdagi tasvir stimuli I sinfga tegishli bo‘lish ehtimolini quyidagicha hisoblaymiz:

image

Bu yerda Ii i sinfga mansub ogohlantiruvchi tasvirlarning (27×25) oʻrtachasi, I′ l1:t da o1:t ni oʻz ichiga olgan 27×25 tasvir, · skalyar koʻpaytmani, .Evklid normasini bildiradi. Barcha piksel intensivligi manfiy emas. Har qanday t epizodida P(i|o1:t, l1:t) e'tiqod taqsimotidan eng yuqori ehtimoliy k sinflar bizning modelimiz tomonidan bashorat qilingan ˆct sinflar to'plamini tashkil qiladi, bu erda k=|ct|. Tasniflashning aniqligi Jaccard indeksi (JI) yordamida o'lchanadi. JI ikkita to‘plam, X va Y o‘rtasidagi o‘xshashlikni o‘lchaydi: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI 0 va 1 orasida chegaralangan; agar X=Y, J(X, Y)=1. Har qanday t epizodida ishtirokchining tasniflash aniqligi J(ēt,ct), bizning modelimiz esa J(ēt, ˆct) ga teng. O'zining maxraji tufayli JI ko'proq jazolaydi, chunki bashorat qilingan to'plamdagi (ct yoki ˆct) ētda bo'lmagan elementlar soni ortib boradi, bu bizning holatimiz uchun kerakli xususiyatdir. Ishtirokchi va bizning modelimiz tasnifi o'rtasidagi o'xshashlik J(ct, ˆct) bilan o'lchanadi. Bizning modelimiz har bir ishtirokchiga nisbatan sinf tanlash va rad etishning aniqligi nuqtai nazaridan ham baholanadi. st=ct − ct−1 tanlangan yangi sinflar to‘plami va rt=ct−1 − ct t da ishtirokchi tomonidan rad etilgan sinflar to‘plami bo‘lsin. Xuddi shunday, ˆst=ˆct − ct−1 tanlangan yangi sinflar to‘plami, ˆrt=ct−1 − ˆct esa t da bizning modelimiz tomonidan rad etilgan sinflar to‘plamidir. Keyin modelning sinf tanlashi va rad etilishini ishtirokchi bilan J(st, ˆst) bilan solishtirish mumkin, qachonki |st| > 0 va J(rt, ˆrt) qachon |rt| > 0, mos ravishda. Joylashuvni bashorat qilish. Gipoteza Ideal holda, barcha sinflar bo'yicha e'tiqod taqsimoti unimodal (ya'ni, faqat bitta cho'qqi) va ingichka Gauss (ya'ni, kichik standart og'ish) shaklida bo'lishi kerak, bu ishtirokchi stimul (atrof-muhit) sinfiga (holatiga) ishonch hosil qiladi. Biroq, bizning ma'lumotlarimizdan ko'rinib turibdiki (2-rasm), ishtirokchi ko'pincha bir nechta sinflar o'rtasida, ayniqsa dastlabki bir necha epizodlarda chalkashib ketadi. Bunday hollarda, uning e'tiqodi taqsimoti bir nechta cho'qqilarga ega yoki semiz Gaussdir. Biz ishtirokchining maqsadi unimodal va ingichka Gaussga yaqinlashishdir, buning uchun u bittadan tashqari barcha sinflarning ehtimolini kamaytiradigan joylarni tanlab oladi. Ushbu gipoteza sinflar (atrof-muhit holatlari) bo'yicha noaniqlikni minimallashtirishga olib keladi, bu harakatni boshqaradigan taniqli printsipdir24, shu jumladan ko'z harakati25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


2-rasm. “0”, “a” va “A” toifalariga kiruvchi barcha ishtirokchilar va stimullar bo‘yicha davomiyligi va sinf taqsimoti.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>th, bu yerda th=0.5 × max(D) chegarasi empirik aniqlangan skalyar kattalikdir.

Biz ikkita assimetrik ko'rsatkichni, Kullback-Leibler (KL) divergentsiyasi va farqni g funktsiyasi uchun nomzod sifatida ko'rib chiqamiz. KL divergensiyasi Ikki me'yorlashtirilgan o'rtacha tasvir Ii va Ij ni hisobga olgan holda KL divergensiyasi KL(Ii, Ij) Ii ga yaqinlashish uchun Ij ishlatilganda ma'lumot yo'qotilishini o'lchaydi. Bu har bir piksel k as26 uchun hisoblanadi: KL(Ii,k, Ij,k)=Ii,k log d + Ii,k Ij,k+d, bu yerda Ij,k - k-pikselning intensivligi ning Ij va d - regulizatsiya konstantasi. Qachon Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Farq Ikki normallashtirilgan oʻrtacha tasvir Ii va Ij berilganda, har bir k piksel uchun farq Farq (Ii,k, Ij,k)=Ii,k − Ij,k. Qachon Ii,k=Ij,k, Farq (Ii,k, Ij,k)=0. Ishtirokchi joriy epizodda tanlangan sinflar to'plamiga nisbatan noaniq. Demak, joylashuvni bashorat qilish uchun biz faqat ct dagi sinflarni o'z ichiga olgan D dagi aniqlik xaritalarini ko'rib chiqamiz. Joylashuv ushbu diqqatga sazovor xaritalar asosida aniq bo'lsa va ishtirokchi tomonidan hech qachon tanlanmagan bo'lsa, bashorat qilinadi. Tus, berilgan o1:t, l1:t va ct, lt+1 joylashuvi quyidagicha bashorat qilinadi:

image

Bu yerda Ŵ - bashorat qilingan joylashuv ˆl, u (i) uchun muhim bo'lgan sinf va qaysi sinfga (j) nisbatan bo'lgan 3-kortejlar to'plami. Agar �ˆl, i, j� ∈ Ŵ mavjud bo‘lsa, �ˆl − lt+1� < ǫ, I ∈ ct+1 va j /∈ ct{{3} bo‘lsa, joylashuv to‘g‘ri bashorat qilinadi. }, bu yerda ǫ - kuzatuv patchidagi markaziy piksel va istalgan piksel orasidagi maksimal Evklid masofasi. Joylashuvni bashorat qilish uchun psevdokod 1-algoritmda ko'rsatilgan. Psevdo-kodning batafsil tushuntirishi qo'shimcha materialning S1 bo'limiga kiritilgan. (Ehtimollik taqsimoti, P(lt+1|o1:t, l1:t,ct), Ŵda boʻlmagan joylarning yorqinlik ballini nolga teng deb hisoblab, soʻngra barchaning koʻzga koʻringanligini normallashtirish orqali hisoblanishi mumkin. Joylarni birlikka yig'ish uchun. Biroq, bu ehtimollik ishlatilmadi, chunki (3) tenglama ushbu maqolaning maqsadlari uchun etarli.)

image

Diqqatga asoslangan modellarni baholash.

Diqqatga asoslangan modellarning vakili sifatida biz MNIST ma'lumotlar to'plamida eksperimental natijalar haqida xabar beruvchi juda ko'p iqtibos qilingan takroriy e'tibor modelini (RAM) 3 ko'rib chiqamiz. Bu mustahkamlash modeli tasvirni ketma-ket namuna oladi va har bir namuna olish lahzasida keyingi qayerdan namuna olishni hal qiladi, bu esa uni to'plangan ma'lumotlardan foydalangan holda baholash uchun mos qiladi.

Ram

ko'rishlar ketma-ketligi yordamida tasvirlarni tasniflaydi. Keyingi joylashuv joylashuv tarmog'i tomonidan parametrlangan taqsimotdan stokastik tarzda tanlanadi. Model quyidagi maqsadni maksimallashtirish orqali uchdan-uchgacha o'qitiladi:

image


Bu erda M epizodlar soni, T - kuzatishlar soni, xi 1:t - joriy agentni I epizodlargacha ishlatish natijasida olingan o'zaro ta'sir ketma-ketliklari, ui t - joriy harakat, th - o'rgatish mumkin bo'lgan parametrlar to'plami, Ri t. jamlangan mukofot, bt - asosiy, p(ui t|xi 1:t; th ) esa siyosat. Operativ xotiraning xatti-harakatlarini RAM tomonidan bashorat qilingan va ishtirokchilar tomonidan tanlangan joylar ketma-ketligidan olingan fiksatsiya xaritalarini solishtirish orqali ishtirokchilar bilan solishtirish mumkin. Fxation xaritasi har bir joyni tanlash chastotasiga teng qiymat belgilash va keyin barcha joylar bo'yicha taqsimotni yaratish uchun ushbu qiymatlarni normallashtirish orqali hisoblanadi.

Fiksatsiya xaritalarini solishtirish uchun ko'rsatkichlar. Ikki fiksatsiya xaritasini, P va Q ni solishtiruvchi ko‘rsatkichlar uchun biz 26 ga diqqat bilan amal qilamiz. Biz uchta taqsimotga asoslangan ko‘rsatkichdan foydalanamiz: Namuna olish joylarining taqsimlanishini solishtirish uchun KL divergensiyasi (KL), Pearson korrelyatsiya koeffitsienti (CC) va O‘xshashlik (SIM) to'plangan ma'lumotlarda qayd etilgan ishtirokchilardan olingan modeldan.

KL (ilgari aniqlangan) nol qiymatlarga juda sezgir.

CC ikkita xarita orasidagi chiziqli munosabatni26 quyidagicha baholashi mumkin: CC(P, Q)=s (P, Q) s (P)s (Q), bu erda s - dispersiya yoki kovariatsiya. CC nosimmetrik bo'lganligi sababli, fiksatsiya xaritalari o'rtasidagi farqlar noto'g'ri musbat yoki noto'g'ri salbiy bilan bog'liqligini aniqlay olmaydi.

SIM 26 sifatida o‘lchanadi: SIM(P, Q)=k min(Pk, Qk), bu yerda k Pk=k Qk=1. CC kabi, SIM simmetrikdir va bir xil kamchilikka ega. Bundan tashqari, SIM etishmayotgan qiymatlarga juda sezgir va erning haqiqat zichligini hisobga olmaydigan bashoratlarni jazolaydi.

Inson va hayvonlar tadqiqotlari.

Memfis universitetidagi institutsional ko'rib chiqish kengashi ushbu tadqiqot Inson sub'ektlarini tadqiq qilish bo'yicha idoraviy ta'rifga mos kelmasligini va 45 CFR 46-qismiga taalluqli emasligini aniqladi. Shunday qilib, ushbu tadqiqot IRB tasdiqlashini yoki ko'rib chiqishni talab qilmaydi.

Eksperimental natijalar Ma'lumotlarni tahlil qilish.

Yig'ilgan ma'lumotlar tanlangan joylarni taqsimlash ketma-ketligi (3-rasm), tanlangan sinflar (2-rasm) va ketma-ket epizodlar orasidagi davomiylik (2-rasm) bo'yicha ko'rinishi mumkin. Ushbu taqsimotlar uchta ma'lumotlar to'plami uchun juda o'xshash. Har qanday raqam yoki alifbo uchun oxirgi epizoddan so'ng tanlangan joylarning taqsimlanishi ma'lumotlar to'plamidan o'z sinfidagi piksel intensivligini taqsimlashga o'xshaydi. Biroq, tanlangan joylar ketma-ketligi tabiatan stokastikdir. Sinf taqsimoti ishtirokchilar bir nechta sinflarni tanlaganlarida, dastlabki bir necha epizodlarda o'xshash tuzilmalarga ega toifalar o'rtasida chalkashliklarni ko'rsatadi. Ko'proq namuna olish bilan bu chalkashlik kamayadi. Chalkashlik darajasi (# tanlangan sinflar/jami # sinf) va namuna olish davomiyligi o'rtasida sezilarli ijobiy korrelyatsiya mavjud (4-rasmga qarang). Agar tanlangan sinflar soni yuqori (past) bo'lsa, ketma-ket epizodlar orasidagi davomiylik yuqori (past). Sinf uchun ishtirokchi tomonidan tanlangan joylar ketma-ketligining CC ahamiyatli emas (1-jadval). Bu statik tasvirlarni tanlashda sub'ektlar o'rtasidagi o'zgaruvchanlik tufayli kutilmoqda. Sinfni aniq bashorat qilish uchun ishtirokchi talab qiladigan o'rtacha namunalar soni juda past. MNIST, EMNIST bosh va kichik harfli tasvirlarni toʻgʻri tasniflash uchun oʻrtacha 36, ​​44.1 va 48.1 soniyaga mos keladigan 4.2, 4.7 va 4.9 namunalar kerak boʻladi. Ishtirokchilar son, katta va kichik alifbo tasvirini toʻgʻri tasniflash uchun tasvir maydonining oʻrtacha atigi 11.3%, 13.4% va 13.7% ni koʻrishgan (qoʻshimcha materialda S2-rasmga qarang). Ushbu natijalar inson vizual fikrlash tizimining samaradorligini ta'kidlaydi, garchi ko'zni kuzatish ma'lumotlariga qaraganda pastroq ruxsatda bo'lsa-da, lekin shovqin va o'zgaruvchanlik kamroq. Ushbu empirik natijalar real dunyo ilovalari uchun e'tiborga asoslangan modellarni loyihalash uchun foydali bo'lishi mumkin. Xulq-atvorni bashorat qilish. Ushbu bo'limda asosiy modelimizning ishlashi har bir ishtirokchining joylashuvi va sinf tanlashini qanchalik aniq bashorat qila olishi nuqtai nazaridan baholanadi. Bizning eksperimental natijalarimiz ikkita muhim ball funksiyasi, KL divergensiyasi va farqi juda o'xshash bo'lganligi sababli, natijalar, agar boshqacha ko'rsatilmagan bo'lsa, faqat farqdan foydalangan holda xabar qilinadi. Sinfni bashorat qilish. Sinfni bashorat qilish va uning aniqligini baholash usullari "Sinfni bashorat qilish" bo'limida tasvirlangan. 5-rasmda ko'rsatilgan sinfni bashorat qilish aniqligi barcha namunalar uchun barcha sinflar bo'yicha hisoblanadi. Barcha namunalar va ma'lumotlar to'plamlari bo'yicha sinfni bashorat qilishning o'rtacha aniqligi 74,4% (std. dev. 26,5). Shakl 5a va b shuni ko'rsatadiki, ishtirokchilar tomonidan va bizning asosiy modelimiz (2-eks) tomonidan tanlangan sinflar to'plami dastlabki epizodlarda juda noto'g'ri va namunalar ko'payishi bilan yaxshilanadi. 5-rasmda ko'rsatilgandek, dastlabki epizodlar davomida bu ikki to'plam, ct va ˆct, bir-biriga juda o'xshash emas; o'xshashlik namunalar ko'payishi bilan ortadi. Xuddi shu narsa yangi sinf tanlovlariga ham tegishli (5f-rasmga qarang). Biroq, sinfni rad etish dastlabki epizodlarda o'xshash; o'xshashlik ko'proq namunalar bilan yanada ortadi (ref. Fig. 5e). J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| va J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, 5e-rasmdan f xulosa qilish mumkinki, dastlabki epizodlarda ct−1 va ct ∪ ˆct o‘rtasidagi kesishish kichik bo‘lib, dastlab ishtirokchilar va bizning asosiy modelimiz ekanligini ko‘rsatadi. ketma-ket epizodlar orasida ularning sinf tanlashda ko'p o'zgarishlar qilish. Shuning uchun, dastlab sinfni tanlash jarayoni juda stokastikdir. Dastlabki epizodlar davomida ishtirokchilar va bizning modelimiz sinfini bashorat qilishlari o'rtasida ba'zi farqlar mavjud bo'lsa-da, ko'proq namunalar bilan xatti-harakatlar o'xshash bo'lib boradi. Dastlabki bir necha (odatda 4 dan 7 gacha) epizodlarda qo'zg'atuvchining o'ta sezilarli qismlari aniqlanadi. Bu keyingi namunalarda faqat to'g'ri sinfni tanlashga yordam beradi, bu esa bashoratning aniqligini oshiradi. Dastlabki bir necha epizodlar davomida o'rtacha shablonlari stimulning kuzatilgan qismlariga mos keladigan ko'plab sinflar mavjudligi sababli, sinfni tanlash jarayoni sezilarli darajada stoxastik bo'lib, ishtirokchilar va bizning modelimiz tomonidan past tasnif aniqligiga olib keladi.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Shakl 3. Har bir raqam/alifbo sinfi va har bir namuna olish epizodi uchun barcha ishtirokchilar bo'yicha namuna olish joylarining taqsimlanishi. Har bir satr sinfga mos keladi, har bir ustun chapdan o'ngga ko'payadigan namuna olish epizodiga mos keladi.

Joylashuvni bashorat qilish. Bizning asosiy modelimiz (3-eq.) joylashuvni bashorat qilish aniqligi, barcha namunalar va maʼlumotlar toʻplamlari boʻyicha oʻrtacha hisoblangan, 67.7% (std. dev. 14.1) ni tashkil qiladi (5d-rasmga qarang). Ushbu bashoratning aniqligi tendentsiyasi sinfni bashorat qilishning aniqligiga ziddir. Biroq, tushuntirish bir xil bo'lib qolmoqda. Dastlabki namunalar paytida joylashuvni bashorat qilishning aniqligi yuqori bo'ladi, chunki bu epizodlar davomida juda ko'zga tashlanadigan joylar tanlanadi va keyingi epizodlarda kamroq ko'rinadigan joylar tanlanadi. Ko'p joylar mavjud bo'lganligi sababli, ularni tanlash jarayoni juda stokastik va shuning uchun bashorat qilish qiyin, bu esa namunalar ko'payishi bilan bashorat qilish aniqligining pasayishiga olib keladi. Har bir ma'lumotlar to'plami uchun pasayish tendentsiyasi o'ziga xosdir (5d-rasmga qarang), chunki sinflar soni va diskriminatsiya uchun foydali bo'lgan juda muhim joylar soni ma'lumotlar to'plamlari orasida farq qiladi. Sinflar soni va juda sezilarli kamsituvchi joylar qanchalik kam bo'lsa, namunalar ko'payishi bilan joylashuvni bashorat qilish aniqligi tezroq pasayadi.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Shakl 4. (Chap) Barcha sinflar bo'yicha o'rtacha olingan ketma-ket namunalar orasidagi vaqt farqining (sekundlar) xato paneli. Tat, ya'ni namuna olish epizodida ko'rsatilgan qiymat t - t - 1 va t da ishtirokchining rasmni bosishlari orasidagi vaqt. (O'ngda) Xatolar panelidagi chalkashliklar syujeti har bir epizodda barcha sinflar bo'yicha o'rtacha hisoblangan. Xatolar paneli std ni bildiradi. dev.

Figure 5. Evaluation of our baseline model (ref.

Shakl 5. Bizning asosiy modelimizni baholash ("Xulq-atvorni bashorat qilish uchun bazaviy" bo'limiga qarang). (a) Ishtirokchilarning tasniflash aniqligi (acc.) va (b) asosiy haqiqat sifatidagi haqiqiy yorliqlari bilan bizning asosiy modelimiz. (c) Tasniflashning o'xshashligi (J(ct, ˆct)), (d) joylashuvni bashorat qilishning aniqligi, (e) sinfni rad etish aniqligi va (f) ishtirokchilarning ma'lumotlari asosiy haqiqat sifatida bizning asosiy modelimizning sinf tanlash aniqligi. Tafsilotlar uchun "Xulq-atvorni bashorat qilish" bo'limiga qarang.

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Jadval 1. Xuddi shu sinf uchun fksatsiya ketma-ketligi uchun o'rtacha Pearson korrelyatsiya koeffitsienti (korr.). Har qanday fiksatsiya uchun masofa Evklid bo'lib, yo'nalish qo'zg'atuvchilarning kelib chiqishi sifatidagi markazga nisbatan qutb burchagi sifatida o'lchanadi. Std. dev. qavs ichiga kiritiladi.

RAMni baholash.

Har bir sinf va namuna olish uchun RAMdan fiksatsiya xaritalari (biz github.com/hehefan/Recurrent-Attention-Model dan RAM ilovasidan foydalanganmiz) va MTurkda taqdim etilgan bir xil stimullar uchun to'plangan ma'lumotlar solishtiriladi. Ishtirokchilar bilan adolatli taqqoslash uchun operativ xotirada biz ketma-ketlik uzunligini T=12 ga, tasvir markazidagi birinchi namuna olish joyiga, kirish kuzatuvini uning markazi sifatida tanlangan joy bilan 5×5 yamoqqa va mukofot funktsiyasini tenglama bilan o'zgartirdi. (1). Te jamlangan mukofot, tenglamadagi Rt. (4,) tenglamadan olingan t t=1 Pt jami ball bilan almashtiriladi. (1). Ishtirokchi har qanday epizodda bir nechta sinflarni tanlashi mumkinligi sababli, RAM modeli uchun eng yuqori ehtimollik asosida bitta sinfni bashorat qilish o'rniga, biz barcha sinflar bo'yicha o'rtacha ehtimollikni chegara sifatida ko'rib chiqamiz va ehtimolliklari ct dan kattaroq sinflar to'plamini bashorat qilamiz. chegara. Ushbu ct tenglama yordamida ballni hisoblash uchun ishlatiladi. (1). Bunday sharoitlarda MNIST raqamlari, katta va kichik EMNIST alifbolarini tanib olish uchun RAM 3,7, 8,5 va 7,6 namunalarni talab qiladi, ular mos ravishda tasvir maydonining 8,9%, 21,0%, 18,7% ga to‘g‘ri keladi. Shunday qilib, bizning ishtirokchilarimizga nisbatan ("Ma'lumotlarni tahlil qilish" bo'limiga qarang), RAM kamroq samarali. 2-jadvalga qarang. RAMdan fiksatsiya xaritalari va to'plangan ma'lumotlarni solishtirish natijalari 3-jadvalda ko'rsatilgan. KL nol qiymatlarga nisbatan sezgirligi tufayli yuqoriroqdir. Bu shuni anglatadiki, bir nechta joydan ishtirokchilar tomonidan namuna olinadi, lekin RAM tomonidan emas. Ushbu eksperimentlar diqqat modeli bilan tanlangan joylarni baholash uchun asos sifatida ishlatilishi mumkin.

cistanche-Improve memory2

cistanche foydalari - Xotirani yaxshilash

Munozaralar

Ushbu maqolada qo'llanilgan mcAT paradigmasi ob'ektni tanib olish mexanizmlarini o'rganish uchun birinchi navbatda ko'z harakati va qarashlariga tayanadiganlardan ma'lum farqlarga ega. Ikkinchisida, birinchi navbatda, sahnaning ko'zga ko'ringan qismlari diqqatni tortadi, so'ngra ko'zni ko'zga tashlanadigan joylarga yo'naltiruvchi sakkak ko'z harakatlari. Nigoh pastdan yuqoriga va yuqoridan pastga signallar orqali boshqariladi, ular diqqatga sazovor ma'lumotlar bilan birgalikda ob'ektni aniqlash uchun ko'z harakatlarini boshqaradigan ustuvor xaritalarni tashkil qiladi. Ushbu tadqiqot ishtirokchilari statik tasvirlarni erkin ko'rish sharoitida va qo'lda ko'p vaqt bilan (T=12 namunalar uchun olti daqiqa) ko'rib chiqishganligi sababli, ular kashf qilish uchun bir qator sakkak ko'z harakatlari yoki vizual mulohazalarni28 bajargan bo'lishi mumkin. AOI ni bosishdan oldin rasm. Ushbu ko'z harakatlari emAT-da (ko'z kuzatuvchisi yordamida) olinishi mumkin edi, lekin mcAT-da emas. Biroq, bu ko'z harakatlariga aqlning sarsoni ta'sir qiladi. mcAT ga ongni sarson qilish29 ham ta'sir qilsa-da, ishtirokchilar vizual fikrlashdan keyin javob berganda ta'sir kamayishi mumkin. Rag'batga javoban ko'z harakatlariga qo'l ostidagi vazifa30 ta'sir qilganligi sababli, ishtirokchilarning ko'z harakati naqshlariga har bir namuna olishda tayinlangan uch bosqichli vazifa ta'sir qilgan bo'lishi mumkin ("Visual vazifa" bo'limiga qarang). Agar ko'z kuzatuvchisi ishlatilgan bo'lsa, namunani o'rganish uchun ishtirokchilarning ko'z harakatlari o'zlari tanlagan sinflarni bosish uchun ko'z harakatlari bilan aralashib ketgan bo'lar edi, bu namunani vizual tekshirishni talqin qilishni qiyinlashtirardi. Sinf(lar)ni bosish zaruriy qadamdir, chunki u introspektiv bo'lsa-da, ishtirokchining ongida bashorat qilingan sinf(lar)ni ochib beradi. AOI tanlashdan oldin va undan keyingi nigohlar, ehtimol, fiksatsion koʻz harakatlari31-alfavitni aniqlashga eng katta hissa qoʻshgan boʻlishi mumkin. Haqiqatan ham, ishtirokchilar sinflarni farqlash uchun tasvirning diagnostika joylarini tanlagan deb o'ylaymiz va bu hududlarda pastdan yuqoriga (masalan, vizual kontrast) va yuqoridan pastga (raqam/alifbo shabloni) diagnostika ma'lumotlari aralashmasi bo'lishi mumkin. Bu bizning topilmamizga mos keladi: ishtirokchilar tezda (o'rtacha 5 ta namunada) diagnostik yamoqlarni tanlash orqali rag'batlantiruvchi sinflarni go'yoki farqlashdi.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Jadval 2. Bizning ishtirokchilarimiz va RAM modeli o'rtasidagi samaradorlikni raqam / alifboni tan olish uchun zarur bo'lgan o'rtacha namunalar soni bo'yicha taqqoslash. Kuzatilgan rasm maydonining foizi qavslar ichiga kiritilgan.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Jadval 3. Barcha sinflar va namunalar bo'yicha o'rtacha hisoblangan MTurk tajribalarida taqdim etilgan stimullar uchun RAMdan fiksatsiya xaritalarini baholash. Std. dev. qavs ichiga kiritiladi.

Xulosa

Biz ketma-ket namuna olish orqali qo'lda yozilgan raqamlar va alifbolarni tanib olish uchun mcAT ma'lumotlar to'plamini taqdim etdik. Ma'lumotlar benchmark ma'lumotlar to'plamidan (MNIST, EMNIST) tanlangan tasvirlar taqdim etilgan 382 ishtirokchidan to'plangan. Har bir raqam/alifbo sinfiga o'rtacha 169,1 ta javob yoziladi. Ma'lumotlar insonning vizual tanib olish samaradorligini aniqlash uchun sinchkovlik bilan tahlil qilinadi. Ishtirokchilar tanib olish uchun tasvirning atigi 12,8 foizini kuzatdilar. Biz keyingi namuna olishda ishtirokchi tanlaydigan joy va sinf(lar)ni bashorat qilish uchun asosiy modelni taklif qildik. Biz eksperimental sharoitlarimiz va ma'lumotlarimiz diqqatga asoslangan mustahkamlash modelini inson faoliyati bilan solishtirganda baholash uchun qanday ishlatilishi mumkinligini ko'rsatdik. Ushbu mcAT ma'lumotlar to'plami ko'zni kuzatish ma'lumotlariga nisbatan bir nechta afzalliklarga ega bo'lib, AI, ML va boshqa sohalarda e'tiborga asoslangan model tadqiqotlaridagi muhim bo'shliqni to'ldiradi.

Ma'lumotnomalar

1. Ranzato, MA qaerga qarashni o'rganish haqida. arXiv: 1405.5488, (2014).

2. Ba, J., Salahutdinov, RR, Grosse, RB, & Frey, BJ Uyg'onish-uyquning takroriy diqqat modellarini o'rganish. NIPSda, 2593–2601 (2015).

3. Mnih, V. va boshqalar. Vizual diqqatning takroriy modellari. NIPSda, 2204–2212 (2014).

4. Ba, J., Mnih, V. va Kavukcuoglu, K. Vizual diqqat bilan bir nechta ob'ektni tanib olish. arXiv: 1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Ko'rishlar soni bilan tasniflash aniqligining o'zgarishi. IJCNN da, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE. Foveal ko'rinishlarni uchinchi tartibli Boltzmann mashinasi bilan birlashtirishni o'rganish. NIPSda, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Ko'rish uchun qattiq e'tibor modellarining aniqligini oshirish. NIPSda, 702–714 (2019).

8. Van Beers, RJ Te sakkadik ko'z harakatlaridagi o'zgaruvchanlik manbalari. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesian ajablanib inson e'tiborini tortadi. Vis. Res. 49(10), 1295–1306 (2009).

10. Egner, S. va boshqalar. Diqqat va ma'lumot olish: sichqonchani bosishni ko'z harakati diqqatini kuzatish bilan taqqoslash. J. Eye Mov. Res. 11(6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE. Diqqatning yashirin siljishi ko'zning beixtiyor harakatlaridan oldin sodir bo'ladi. Idrok qilish. Psixofiz. 66(3), 398–405 (2004).

12. Jiang, M. va boshqalar. Silikon: kontekstdagi ahamiyatlilik. CVPRda, 1072–1080 (2015).

13. Kim, NW va boshqalar. BubbleView: Tasvir ahamiyati xaritalarini kraudsorsing va vizual diqqatni kuzatish uchun interfeys. ACM Trans. Hisoblash. Hum. O'zaro ta'sir qilish. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Nozik toifalarga bo'lgan e'tibor. arXiv: 1412.7054 (2014).

15. Egner, S., Itti, L. & Scheier, C. Har xil turdagi xatti-harakatlar ma'lumotlari bilan diqqat modellarini solishtirish. Tekshirish. Oftalmol. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. va boshqalar. Chiziqli bo'lmagan sahifa tartiblari mavjudligida ko'z-sichqoncha harakatini o'lchash va modellashtirish. Proc.da. Int. Konf. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN. Vizual qidiruvni ko'zni kuzatuvchisiz o'rganish: sun'iy foveatsiyani baholash. Kogn. Res. Princ. Implic. 6(1), 1–22 (2021).

18. Tafi, AP va boshqalar. OCR xizmat sifatida: Google Docs OCR, Tesseract, ABBYY FineReader va Transymning eksperimental bahosi. Int. Simp. Vis. Comput., 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Xan, RA & Uddin, M. Qo'lda yozilgan optik belgilarni aniqlash (OCR): keng qamrovli tizimli adabiyotlarni ko'rib chiqish (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK. Optik belgilarni aniqlash tizimlari. Sof Computing bilan turli tillar uchun belgilarni optik aniqlash tizimlarida, 9–41 (Springer, 2017).

21. LeCun, Y. va boshqalar. Hujjatlarni tanib olishda qo'llaniladigan gradientga asoslangan o'rganish. Proc. IEEE 86(11), 2278–2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: MNISTning qo'lda yozilgan harflarga kengayishi. arXiv: 1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Tasvir yaratish uchun takroriy neyron tarmoq. ICMLda, 1462–1471 (2015).

24. Friston, K. Te erkin energiya printsipi: Miya uchun qo'pol qo'llanma?. Trends Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Faol xulosaga asoslangan tanlangan diqqatning Bayesian modelini joriy etish. Sci. Rep. 9(1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Turli baholash ko'rsatkichlari saliness modellari haqida bizga nimani aytadi? IEEE Trans. Anal namunasi. Mach. Intell. 41(3), 740–757 (2018).

27. Itti, L. & Koch, C. Vizual diqqatni hisoblash modellashtirish. Nat. Rev. Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Ongli ko'rishni yaratuvchi vizual funktsiyalar. Old. Psixol., 11, (2020).

29. da Silva, MRD & Postma, M. Adashgan aqllar, aylanib yuruvchi sichqonlar: Kompyuter sichqonchasini kuzatish aqlning sargardonligini aniqlash usuli sifatida. Hisoblash. Hum. Xulq-atvor. 112, 106453 (2020 yil).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Ko'z harakati va idrok: Tanlangan ko'rib chiqish. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Nozik sozlangan ko'z harakati ko'rish keskinligini oshiradi. Nat. Kommun. 11(1), 1–11 (2020).

Sizga ham yoqishi mumkin