Merge a53b4004cff69bca0f206bbd0b4a3003038568c7 into 2b4fbfce25902d557b86b003cf48f738129efce4

[YouTube] Support player 4fcd6e4a
thx seproDev, bashonly: yt-dlp/yt-dlp#12748
2025-07-12 22:44:14 +09:00 · 2025-03-26 08:03:44 +00:00 · 2025-03-26 02:27:25 +00:00 · 2025-03-25 22:35:06 +00:00 · 2025-03-25 22:35:06 +00:00 · 2025-03-25 22:35:06 +00:00
5 changed files with 403 additions and 205 deletions
--- a/test/test_youtube_signature.py
+++ b/test/test_youtube_signature.py
@ -84,6 +84,21 @@ _SIG_TESTS = [
        '2aq0aqSyOoJXtK73m-uME_jv7-pT15gOFC02RFkGMqWpzEICs69VdbwQ0LDp1v7j8xx92efCJlYFYb1sUkkBSPOlPmXgIARw8JQ0qOAOAA',
        '0QJ8wRAIgXmPlOPSBkkUs1bYFYlJCfe29xxAj7v1pDL0QwbdV96sCIEzpWqMGkFR20CFOg51Tp-7vj_EMu-m37KtXJ2OySqa0q',
    ),
    (
        'https://www.youtube.com/s/player/643afba4/tv-player-ias.vflset/tv-player-ias.js',
        '2aq0aqSyOoJXtK73m-uME_jv7-pT15gOFC02RFkGMqWpzEICs69VdbwQ0LDp1v7j8xx92efCJlYFYb1sUkkBSPOlPmXgIARw8JQ0qOAOAA',
        'AAOAOq0QJ8wRAIgXmPlOPSBkkUs1bYFYlJCfe29xx8j7vgpDL0QwbdV06sCIEzpWqMGkFR20CFOS21Tp-7vj_EMu-m37KtXJoOy1',
    ),
    (
        'https://www.youtube.com/s/player/363db69b/player_ias.vflset/en_US/base.js',
        '2aq0aqSyOoJXtK73m-uME_jv7-pT15gOFC02RFkGMqWpzEICs69VdbwQ0LDp1v7j8xx92efCJlYFYb1sUkkBSPOlPmXgIARw8JQ0qOAOAA',
        '0aqSyOoJXtK73m-uME_jv7-pT15gOFC02RFkGMqWpz2ICs6EVdbwQ0LDp1v7j8xx92efCJlYFYb1sUkkBSPOlPmXgIARw8JQ0qOAOAA',
    ),
    (
        'https://www.youtube.com/s/player/4fcd6e4a/player_ias.vflset/en_US/base.js',
        '2aq0aqSyOoJXtK73m-uME_jv7-pT15gOFC02RFkGMqWpzEICs69VdbwQ0LDp1v7j8xx92efCJlYFYb1sUkkBSPOlPmXgIARw8JQ0qOAOAA',
        'wAOAOq0QJ8ARAIgXmPlOPSBkkUs1bYFYlJCfe29xx8q7v1pDL0QwbdV96sCIEzpWqMGkFR20CFOg51Tp-7vj_EMu-m37KtXJoOySqa0',
    ),
 ]
 _NSIG_TESTS = [
@ -153,7 +168,7 @@ _NSIG_TESTS = [
    ),
    (
        'https://www.youtube.com/s/player/c57c113c/player_ias.vflset/en_US/base.js',
-        '-Txvy6bT5R6LqgnQNx', 'dcklJCnRUHbgSg',
+        'M92UUMHa8PdvPd3wyM', '3hPqLJsiNZx7yA',
    ),
    (
        'https://www.youtube.com/s/player/5a3b6271/player_ias.vflset/en_US/base.js',
@ -173,7 +188,7 @@ _NSIG_TESTS = [
    ),
    (
        'https://www.youtube.com/s/player/cfa9e7cb/player_ias.vflset/en_US/base.js',
-        'qO0NiMtYQ7TeJnfFG2', 'k9cuJDHNS5O7kQ',
+        'aCi3iElgd2kq0bxVbQ', 'QX1y8jGb2IbZ0w',
    ),
    (
        'https://www.youtube.com/s/player/8c7583ff/player_ias.vflset/en_US/base.js',
@ -231,10 +246,6 @@ _NSIG_TESTS = [
        'https://www.youtube.com/s/player/f6e09c70/player_ias_tce.vflset/en_US/base.js',
        'W9HJZKktxuYoDTqW', 'jHbbkcaxm54',
    ),
    (
        'https://www.youtube.com/s/player/643afba4/player_ias.vflset/en_US/base.js',
        'W9HJZKktxuYoDTqW', 'larxUlagTRAcSw',
    ),
    (
        'https://www.youtube.com/s/player/e7567ecf/player_ias_tce.vflset/en_US/base.js',
        'Sy4aDGc0VpYRR9ew_', '5UPOT1VhoZxNLQ',
@ -259,6 +270,22 @@ _NSIG_TESTS = [
        'https://www.youtube.com/s/player/643afba4/tv-player-ias.vflset/tv-player-ias.js',
        'ir9-V6cdbCiyKxhr', '2PL7ZDYAALMfmA',
    ),
    (
        'https://www.youtube.com/s/player/643afba4/player_ias.vflset/en_US/base.js',
        'W9HJZKktxuYoDTqW', 'larxUlagTRAcSw',
    ),
    (
        'https://www.youtube.com/s/player/363db69b/player_ias.vflset/en_US/base.js',
        'eWYu5d5YeY_4LyEDc', 'XJQqf-N7Xra3gg',
    ),
    (
        'https://www.youtube.com/s/player/4fcd6e4a/player_ias.vflset/en_US/base.js',
        'o_L251jm8yhZkWtBW', 'lXoxI3XvToqn6A',
    ),
    (
        'https://www.youtube.com/s/player/4fcd6e4a/tv-player-ias.vflset/tv-player-ias.js',
        'o_L251jm8yhZkWtBW', 'lXoxI3XvToqn6A',
    ),
 ]
@ -271,6 +298,8 @@ class TestPlayerInfo(unittest.TestCase):
            ('https://www.youtube.com/s/player/64dddad9/player-plasma-ias-phone-en_US.vflset/base.js', '64dddad9'),
            ('https://www.youtube.com/s/player/64dddad9/player-plasma-ias-phone-de_DE.vflset/base.js', '64dddad9'),
            ('https://www.youtube.com/s/player/64dddad9/player-plasma-ias-tablet-en_US.vflset/base.js', '64dddad9'),
            ('https://www.youtube.com/s/player/e7567ecf/player_ias_tce.vflset/en_US/base.js', 'e7567ecf'),
            ('https://www.youtube.com/s/player/643afba4/tv-player-ias.vflset/tv-player-ias.js', '643afba4'),
            # obsolete
            ('https://www.youtube.com/yts/jsbin/player_ias-vfle4-e03/en_US/base.js', 'vfle4-e03'),
            ('https://www.youtube.com/yts/jsbin/player_ias-vfl49f_g4/en_US/base.js', 'vfl49f_g4'),
@ -280,8 +309,9 @@ class TestPlayerInfo(unittest.TestCase):
            ('https://s.ytimg.com/yts/jsbin/html5player-en_US-vflXGBaUN.js', 'vflXGBaUN'),
            ('https://s.ytimg.com/yts/jsbin/html5player-en_US-vflKjOTVq/html5player.js', 'vflKjOTVq'),
        )
        ie = YoutubeIE(FakeYDL({'cachedir': False}))
        for player_url, expected_player_id in PLAYER_URLS:
-            player_id = YoutubeIE._extract_player_info(player_url)
+            player_id = ie._extract_player_info(player_url)
            self.assertEqual(player_id, expected_player_id)
@ -301,8 +331,8 @@ class TestSignature(unittest.TestCase):
 def t_factory(name, sig_func, url_pattern):
    def make_tfunc(url, sig_input, expected_sig):
        m = url_pattern.match(url)
-        assert m, '%r should follow URL format' % url
+        assert m, '{0!r} should follow URL format'.format(url)
-        test_id = m.group('id')
+        test_id = re.sub(r'[/.-]', '_', m.group('id') or m.group('compat_id'))
        def test_func(self):
            basename = 'player-{0}-{1}.js'.format(name, test_id)
@ -335,12 +365,16 @@ def n_sig(jscode, sig_input):
 make_sig_test = t_factory(
-    'signature', signature, re.compile(r'.*(?:-|/player/)(?P<id>[a-zA-Z0-9_-]+)(?:/.+\.js|(?:/watch_as3|/html5player)?\.[a-z]+)$'))
+    'signature', signature,
    re.compile(r'''(?x)
        .+/(?P<h5>html5)?player(?(h5)(?:-en_US)?-|/)(?P<id>[a-zA-Z0-9/._-]+)
        (?(h5)/(?:watch_as3|html5player))?\.js$
    '''))
 for test_spec in _SIG_TESTS:
    make_sig_test(*test_spec)
 make_nsig_test = t_factory(
-    'nsig', n_sig, re.compile(r'.+/player/(?P<id>[a-zA-Z0-9_-]+)/.+.js$'))
+    'nsig', n_sig, re.compile(r'.+/player/(?P<id>[a-zA-Z0-9_/.-]+)\.js$'))
 for test_spec in _NSIG_TESTS:
    make_nsig_test(*test_spec)
--- a/youtube_dl/extractor/extractors.py
+++ b/youtube_dl/extractor/extractors.py
@ -1238,10 +1238,7 @@ from .svt import (
 from .swrmediathek import SWRMediathekIE
 from .syfy import SyfyIE
 from .sztvhu import SztvHuIE
-from .tagesschau import (
+from .tagesschau import TagesschauIE
    TagesschauPlayerIE,
    TagesschauIE,
 )
 from .tass import TassIE
 from .tbs import TBSIE
 from .tdslifeway import TDSLifewayIE
--- a/youtube_dl/extractor/tagesschau.py
+++ b/youtube_dl/extractor/tagesschau.py
@ -5,127 +5,54 @@ import re
 from .common import InfoExtractor
 from ..utils import (
    bool_or_none,
    compat_str,
    determine_ext,
-    js_to_json,
+    ExtractorError,
-    parse_iso8601,
+    parse_duration,
    parse_filesize,
    remove_quotes,
    strip_or_none,
    try_get,
    unescapeHTML,
    unified_timestamp,
    url_or_none,
 )
 # Note that there are tagesschau.de/api and tagesschau.de/api2 endpoints, which
 # may be useful, but not all pages and not all formats can be easily accessed
 # by API.
 class TagesschauPlayerIE(InfoExtractor):
    IE_NAME = 'tagesschau:player'
    _VALID_URL = r'https?://(?:www\.)?tagesschau\.de/multimedia/(?P<kind>audio|video)/(?P=kind)-(?P<id>\d+)~player(?:_[^/?#&]+)?\.html'
-    _TESTS = [{
+_FORMATS = {
-        'url': 'http://www.tagesschau.de/multimedia/video/video-179517~player.html',
+    'xs': {'quality': 0},
-        'md5': '8d09548d5c15debad38bee3a4d15ca21',
+    's': {'width': 320, 'height': 180, 'quality': 1},
-        'info_dict': {
+    'sm': {'width': 480, 'height': 270, 'quality': 1},
-            'id': '179517',
+    'm': {'width': 512, 'height': 288, 'quality': 2},
-            'ext': 'mp4',
+    'ml': {'width': 640, 'height': 360, 'quality': 2},
-            'title': 'Marie Kristin Boese, ARD Berlin, über den zukünftigen Kurs der AfD',
+    'l': {'width': 960, 'height': 540, 'quality': 3},
-            'thumbnail': r're:^https?:.*\.jpg$',
+    'xl': {'width': 1280, 'height': 720, 'quality': 4},
-            'formats': 'mincount:6',
+    'xxl': {'quality': 5},
-        },
+    'mp3': {'abr': 64, 'vcodec': 'none', 'quality': 0},
-    }, {
+    'hi.mp3': {'abr': 192, 'vcodec': 'none', 'quality': 1},
-        'url': 'https://www.tagesschau.de/multimedia/audio/audio-29417~player.html',
+}
        'md5': '76e6eec6ebd40740671cf0a2c88617e5',
        'info_dict': {
            'id': '29417',
            'ext': 'mp3',
            'title': 'Trabi - Bye, bye Rennpappe',
            'thumbnail': r're:^https?:.*\.jpg$',
            'formats': 'mincount:2',
        },
    }, {
        'url': 'http://www.tagesschau.de/multimedia/audio/audio-29417~player_autoplay-true.html',
        'only_matching': True,
    }]
-    _FORMATS = {
+_FIELD_PREFERENCE = ('height', 'width', 'vbr', 'abr')
        'xs': {'quality': 0},
        's': {'width': 320, 'height': 180, 'quality': 1},
        'm': {'width': 512, 'height': 288, 'quality': 2},
        'l': {'width': 960, 'height': 540, 'quality': 3},
        'xl': {'width': 1280, 'height': 720, 'quality': 4},
        'xxl': {'quality': 5},
    }
    def _extract_via_api(self, kind, video_id):
        info = self._download_json(
            'https://www.tagesschau.de/api/multimedia/{0}/{0}-{1}.json'.format(kind, video_id),
            video_id)
        title = info['headline']
        formats = []
        for media in info['mediadata']:
            for format_id, format_url in media.items():
                if determine_ext(format_url) == 'm3u8':
                    formats.extend(self._extract_m3u8_formats(
                        format_url, video_id, 'mp4',
                        entry_protocol='m3u8_native', m3u8_id='hls'))
                else:
                    formats.append({
                        'url': format_url,
                        'format_id': format_id,
                        'vcodec': 'none' if kind == 'audio' else None,
                    })
        self._sort_formats(formats)
        timestamp = parse_iso8601(info.get('date'))
        return {
            'id': video_id,
            'title': title,
            'timestamp': timestamp,
            'formats': formats,
        }
-    def _real_extract(self, url):
+def _normalize_format_id(format_id, ext):
-        mobj = re.match(self._VALID_URL, url)
+    if format_id:
-        video_id = mobj.group('id')
+        m = re.match(r"web([^.]+)\.[^.]+$", format_id)
-
+        if m:
-        # kind = mobj.group('kind').lower()
+            format_id = m.group(1)
-        # if kind == 'video':
+        if format_id == 'hi' and ext:
-        #     return self._extract_via_api(kind, video_id)
+            # high-quality audio files
-
+            format_id = '%s.%s' % (format_id, ext)
-        # JSON api does not provide some audio formats (e.g. ogg) thus
+    return format_id
        # extracting audio via webpage
        webpage = self._download_webpage(url, video_id)
        title = self._og_search_title(webpage).strip()
        formats = []
        for media_json in re.findall(r'({src\s*:\s*["\']http[^}]+type\s*:[^}]+})', webpage):
            media = self._parse_json(js_to_json(media_json), video_id, fatal=False)
            if not media:
                continue
            src = media.get('src')
            if not src:
                return
            quality = media.get('quality')
            kind = media.get('type', '').split('/')[0]
            ext = determine_ext(src)
            f = {
                'url': src,
                'format_id': '%s_%s' % (quality, ext) if quality else ext,
                'ext': ext,
                'vcodec': 'none' if kind == 'audio' else None,
            }
            f.update(self._FORMATS.get(quality, {}))
            formats.append(f)
        self._sort_formats(formats)
        thumbnail = self._og_search_thumbnail(webpage)
        return {
            'id': video_id,
            'title': title,
            'thumbnail': thumbnail,
            'formats': formats,
        }
 class TagesschauIE(InfoExtractor):
-    _VALID_URL = r'https?://(?:www\.)?tagesschau\.de/(?P<path>[^/]+/(?:[^/]+/)*?(?P<id>[^/#?]+?(?:-?[0-9]+)?))(?:~_?[^/#?]+?)?\.html'
+    _VALID_URL = r'https?://(?:www\.)?tagesschau\.de(?:/?|/(?P<path>[^?#]+?(?:/(?P<id>[^/#?]+?(?:-?[0-9]+))(?:~_?[^/#?]+?)?(?:\.html)?)?))(?:[#?].*)?$'
    _TESTS = [{
        'url': 'http://www.tagesschau.de/multimedia/video/video-102143.html',
@ -134,48 +61,111 @@ class TagesschauIE(InfoExtractor):
            'id': 'video-102143',
            'ext': 'mp4',
            'title': 'Regierungsumbildung in Athen: Neue Minister in Griechenland vereidigt',
-            'description': '18.07.2015 20:10 Uhr',
+            'description': '18.07.2015 20:10',
            'thumbnail': r're:^https?:.*\.jpg$',
            'upload_date': '20150718',
            'duration': 138,
            'timestamp': 1437250200,
            'uploader': 'ARD',
        },
    }, {
        # with player
        'url': 'http://www.tagesschau.de/multimedia/video/video-102143~player.html',
        'md5': 'f7c27a0eff3bfe8c7727e65f8fe1b1e6',
        'info_dict': {
            'id': 'video-102143',
            'ext': 'mp4',
            'title': 'Regierungsumbildung in Athen: Neue Minister in Griechenland vereidigt',
            'description': '18.07.2015 20:10',
            'thumbnail': r're:^https?:.*\.jpg$',
            'upload_date': '20150718',
            'timestamp': 1437250200,
            'uploader': 'ARD',
        },
    }, {
        'url': 'http://www.tagesschau.de/multimedia/sendung/ts-5727.html',
        'md5': '3c54c1f6243d279b706bde660ceec633',
        'info_dict': {
-            'id': 'ts-5727',
+            'id': 'video-45741',
            'ext': 'mp4',
-            'title': 'Sendung: tagesschau \t04.12.2014 20:00 Uhr',
+            'title': 'tagesschau 20 Uhr - 04.12.14 20:00',
-            'description': 'md5:695c01bfd98b7e313c501386327aea59',
+            'description': '04.12.2014 20:00',
            'thumbnail': r're:^https?:.*\.jpg$',
            'uploader': 'tagesschau',
            'timestamp': 1417723200,
            'upload_date': '20141204',
            'subtitles': dict,
        },
    }, {
        # exclusive audio
-        'url': 'http://www.tagesschau.de/multimedia/audio/audio-29417.html',
+        'url': 'https://www.tagesschau.de/multimedia/audio/audio-103205.html',
-        'md5': '76e6eec6ebd40740671cf0a2c88617e5',
+        'md5': 'c8e7b72aeca664031db0ba198519b09a',
        'info_dict': {
-            'id': 'audio-29417',
+            'id': 'audio-103205',
            'ext': 'mp3',
-            'title': 'Trabi - Bye, bye Rennpappe',
+            'title': 'Die USA: ein Impfwunder?',
-            'description': 'md5:8687dda862cbbe2cfb2df09b56341317',
+            'description': '06.03.2021 06:07',
            'timestamp': 1615010820,
            'upload_date': '20210306',
            'thumbnail': r're:^https?:.*\.jpg$',
            'uploader': 'Jule Käppel, ARD Washington',
            'creator': 'ARD',
            'channel': 'tagesschau.de',
            'is_live': False,
        },
    }, {
        # audio in article
-        'url': 'http://www.tagesschau.de/inland/bnd-303.html',
+        'url': 'https://www.tagesschau.de/ausland/amerika/biden-versoehnung-101.html',
-        'md5': 'e0916c623e85fc1d2b26b78f299d3958',
+        'md5': '4c46b0283719d97aa976037e1ecb7b73',
        'info_dict': {
-            'id': 'bnd-303',
+            'id': 'audio-103429',
            'title': 'Bidens Versöhnungswerk kommt nicht voran',
            'ext': 'mp3',
-            'title': 'Viele Baustellen für neuen BND-Chef',
+            'timestamp': 1615444860,
-            'description': 'md5:1e69a54be3e1255b2b07cdbce5bcd8b4',
+            'uploader': 'Sebastian Hesse, ARD Washington',
-            'thumbnail': r're:^https?:.*\.jpg$',
+            'description': '11.03.2021 06:41',
            'upload_date': '20210311',
            'creator': 'ARD',
            'channel': 'tagesschau.de',
        },
    }, {
-        'url': 'http://www.tagesschau.de/inland/afd-parteitag-135.html',
+        # playlist in article
        'url': 'https://www.tagesschau.de/ausland/impfungen-coronavirus-usa-101.html',
        'info_dict': {
-            'id': 'afd-parteitag-135',
+            'id': 'impfungen-coronavirus-usa-101',
-            'title': 'Möchtegern-Underdog mit Machtanspruch',
+            'title': 'Kampf gegen das Coronavirus: Impfwunder USA?',
        },
        'playlist_count': 2,
    }, {
        # article without videos
        'url': 'https://www.tagesschau.de/wirtschaft/ukraine-russland-kredit-101.html',
        'info_dict': {
            'id': 'ukraine-russland-kredit-101',
            'title': 'Ukraine stoppt Rückzahlung russischer Kredite',
        },
        'playlist_count': 0,
    }, {
        # legacy website
        'url': 'https://www.tagesschau.de/multimedia/video/video-102303~_bab-sendung-211.html',
        'md5': 'ab6d190c8147560d6429a467566affe6',
        'info_dict': {
            'id': 'video-102303',
            'ext': 'mp4',
            'title': 'Bericht aus Berlin: Sommerinterview mit Angela Merkel',
            'description': '19.07.2015 19:05 Uhr',
        }
    }, {
        # handling of generic title
        'url': 'https://www.tagesschau.de/multimedia/video/video-835681.html',
        'info_dict': {
            'id': 'video-835681',
            'ext': 'mp4',
            'title': 'Tagesschau in 100 Sekunden - 13.03.21 17:35',
            'upload_date': '20210313',
            'uploader': 'Tagesschau24',
            'description': '13.03.2021 17:35',
            'timestamp': 1615656900,
        }
    }, {
        'url': 'http://www.tagesschau.de/multimedia/sendung/tsg-3771.html',
        'only_matching': True,
@ -204,13 +194,176 @@ class TagesschauIE(InfoExtractor):
        # playlist article with collapsing sections
        'url': 'http://www.tagesschau.de/wirtschaft/faq-freihandelszone-eu-usa-101.html',
        'only_matching': True,
    }, {
        'url': 'https://www.tagesschau.de/',
        'only_matching': True,
    }]
-    @classmethod
+    def _video_id_from_url(self, url):
-    def suitable(cls, url):
+        if url:
-        return False if TagesschauPlayerIE.suitable(url) else super(TagesschauIE, cls).suitable(url)
+            mobj = re.match(self._VALID_URL, url)
            if mobj:
                return mobj.group('id')
-    def _extract_formats(self, download_text, media_kind):
+    def _handle_generic_titles(self, title, pixelConf):
        if strip_or_none(title, '').lower() not in ('ganze sendung', '100 sekunden',
                                                    'tagesschau in 100 sekunden'):
            return title
        # otherwise find more meaningful title than the generic Ganze Sendung/100 Sekunden
        for item in pixelConf:
            if item.get('tracker') == 'AGFdebug':
                s = try_get(item, lambda x: x['clipData']['program'], compat_str)
                if s:
                    # extract date and time
                    parts = (try_get(item, lambda x: x['clipData']['title'], compat_str)
                             or '').split('_')[-2:]
                    if len(parts) == 2:
                        title = "%s - %s" % (s, ' '.join(parts))
                    else:
                        title = s
                break
        return title
    def _extract_from_player(self, player_div, video_id_fallback, title_fallback):
        player_data = unescapeHTML(self._search_regex(
            r'data-config=(?P<quote>["\'])(?P<data>[^"\']*)(?P=quote)',
            player_div, 'data-config', group='data'))
        meta = self._parse_json(player_data, video_id_fallback, fatal=False)
        mc = try_get(meta, lambda x: x['mc'], dict)
        if not mc:
            # fallback if parsing json fails, as tagesschau API sometimes sends
            # invalid json
            stream_hls = remove_quotes(self._search_regex(
                r'"http[^"]+?\.m3u8"', player_data, '.m3u8-url', group=0))
            formats = self._extract_m3u8_formats(stream_hls, video_id_fallback,
                                                 ext='mp4', m3u8_id='hls',
                                                 entry_protocol='m3u8_native')
            self._sort_formats(formats, field_preference=_FIELD_PREFERENCE)
            return {
                'id': video_id_fallback,
                'title': title_fallback,
                'formats': formats,
            }
        # this url is more permanent than the original link
        webpage_url = url_or_none(try_get(mc, lambda x: x['_sharing']['link']))
        video_id = self._video_id_from_url(webpage_url)
        duration = None
        pixelConf = try_get(meta, lambda x: x['pc']['_pixelConfig'], list) or []
        for item in pixelConf:
            video_id = (video_id or try_get(item,
                        [lambda x: x['playerID'],
                         lambda x: x['clipData']['playerId']], compat_str))
            duration = (duration or parse_duration(try_get(item,
                        [lambda x: x['clipData']['length'],
                         lambda x: x['clipData']['duration']])))
        if not video_id:
            video_id = video_id_fallback
        formats = []
        for elem in mc.get('_mediaArray', []):
            for d in elem.get('_mediaStreamArray', []):
                link_url = url_or_none(d.get('_stream'))
                if not link_url:
                    continue
                ext = determine_ext(link_url)
                if ext == "m3u8":
                    formats.extend(self._extract_m3u8_formats(
                        link_url, video_id_fallback, ext='mp4',
                        entry_protocol='m3u8_native',
                        m3u8_id='hls', fatal=False))
                elif ext == "f4m":
                    formats.extend(self._extract_f4m_formats(
                        link_url, video_id_fallback, f4m_id='hds', fatal=False))
                else:
                    format_id = _normalize_format_id(self._search_regex(
                        r'.*/[^/.]+\.([^/]+)\.[^/.]+$', link_url, 'format ID',
                        default=ext, fatal=False),
                        ext)
                    fmt = {
                        'format_id': format_id,
                        'url': link_url,
                        'format_name': ext,
                    }
                    fmt.update(_FORMATS.get(format_id, {}))
                    formats.append(fmt)
        self._sort_formats(formats, field_preference=_FIELD_PREFERENCE)
        if not formats:
            raise ExtractorError("could not extract formats from json")
        # note that mc['_title'] can be very different from actual title,
        # such as an image description in case of audio files
        title = (try_get(mc, [lambda x: x['_info']['clipTitle'],
                              lambda x: x['_download']['title']], compat_str)
                 or title_fallback)
        title = self._handle_generic_titles(title, pixelConf)
        sub_url = url_or_none(mc.get('_subtitleUrl'))
        subs = {'de': [{'ext': 'ttml', 'url': sub_url}]} if sub_url else None
        images = try_get(mc, lambda x: x['_previewImage'], dict) or {}
        thumbnails = [{
            'url': url_or_none('https://www.tagesschau.de/%s'
                               % (images[format_id],)),
            'preference': _FORMATS.get(format_id, {}).get('quality'),
        } for format_id in images] or None
        return {
            'id': video_id,
            'title': title,
            'formats': formats,
            'webpage_url': webpage_url,
            'subtitles': subs,
            'thumbnails': thumbnails,
            'duration': duration,
            'timestamp': unified_timestamp(try_get(mc, [lambda x: x['_download']['date'],
                                                        lambda x: x['_info']['clipDate']])),
            'is_live': bool_or_none(mc.get('_isLive')),
            'channel': try_get(mc, lambda x: x['_download']['channel'], compat_str),
            'uploader': try_get(mc, lambda x: x['_info']['channelTitle'], compat_str),
            'creator': try_get(mc, lambda x: x['_info']['clipContentSrc'], compat_str),
            'description': try_get(mc, lambda x: x['_info']['clipDate'], compat_str),
        }
    def _real_extract(self, url):
        mobj = re.match(self._VALID_URL, url)
        video_id = mobj.group('id') or mobj.group('path')
        display_id = video_id.lstrip('-') if video_id else 'tagesschau.de'
        webpage = self._download_webpage(url, display_id)
        title = (self._og_search_title(webpage, default=None)
                 or self._html_search_regex(
                     [r'<span[^>]*class="headline"[^>]*>(.+?)</span>',
                      r'<title[^>]*>(.+?)</title>'],
                     webpage, 'title'))
        webpage_type = self._og_search_property('type', webpage, default=None)
        player_pattern = r'<div[^>]+data-ts_component=(?P<quote>["\'])ts-mediaplayer(?P=quote)[^>]*>'
        players = [m.group(0) for m in re.finditer(player_pattern, webpage)]
        if not players:
            # assume old website format
            return self._legacy_extract(webpage, display_id, title, webpage_type)
        elif (len(players) > 1
              and not self._downloader.params.get('noplaylist')
              and (webpage_type == 'website' or not mobj.group('id'))):
            # article or playlist
            entries = []
            seen = set()
            for player in players:
                entry = self._extract_from_player(player, video_id, title)
                if entry['id'] not in seen:
                    entries.append(entry)
                    seen.add(entry['id'])
            return self.playlist_result(entries, display_id, title)
        else:
            # single video/audio
            return self._extract_from_player(players[0], video_id, title)
    def _legacy_extract_formats(self, download_text, media_kind):
        links = re.finditer(
            r'<div class="button" title="(?P<title>[^"]*)"><a href="(?P<url>[^"]+)">(?P<name>.+?)</a></div>',
            download_text)
@ -219,9 +372,10 @@ class TagesschauIE(InfoExtractor):
            link_url = l.group('url')
            if not link_url:
                continue
-            format_id = self._search_regex(
+            ext = determine_ext(link_url)
            format_id = _normalize_format_id(self._search_regex(
                r'.*/[^/.]+\.([^/]+)\.[^/.]+$', link_url, 'format ID',
-                default=determine_ext(link_url))
+                default=ext), ext)
            format = {
                'format_id': format_id,
                'url': l.group('url'),
@ -262,39 +416,30 @@ class TagesschauIE(InfoExtractor):
        self._sort_formats(formats)
        return formats
-    def _real_extract(self, url):
+    # Some old pages still use the old format, so we keep the previous
-        mobj = re.match(self._VALID_URL, url)
+    # extractor for now.
-        video_id = mobj.group('id') or mobj.group('path')
+    def _legacy_extract(self, webpage, display_id, title, webpage_type):
-        display_id = video_id.lstrip('-')
+        DOWNLOAD_REGEX = r'<p>Wir bieten dieses (?P<kind>Video|Audio) in folgenden Formaten zum Download an:</p>\s*<div class="controls">(?P<links>.*?)</div>\s*<p>'
        webpage = self._download_webpage(url, display_id)
        title = self._html_search_regex(
            r'<span[^>]*class="headline"[^>]*>(.+?)</span>',
            webpage, 'title', default=None) or self._og_search_title(webpage)
        DOWNLOAD_REGEX = r'(?s)<p>Wir bieten dieses (?P<kind>Video|Audio) in folgenden Formaten zum Download an:</p>\s*<div class="controls">(?P<links>.*?)</div>\s*<p>'
        webpage_type = self._og_search_property('type', webpage, default=None)
        if webpage_type == 'website':  # Article
            entries = []
            for num, (entry_title, media_kind, download_text) in enumerate(re.findall(
-                    r'(?s)<p[^>]+class="infotext"[^>]*>\s*(?:<a[^>]+>)?\s*<strong>(.+?)</strong>.*?</p>.*?%s' % DOWNLOAD_REGEX,
+                    r'<p[^>]+class="infotext"[^>]*>\s*(?:<a[^>]+>)?\s*<strong>(.+?)</strong>.*?</p>.*?%s' % DOWNLOAD_REGEX,
-                    webpage), 1):
+                    webpage, flags=re.S), 1):
                entries.append({
                    'id': '%s-%d' % (display_id, num),
                    'title': '%s' % entry_title,
-                    'formats': self._extract_formats(download_text, media_kind),
+                    'formats': self._legacy_extract_formats(download_text, media_kind),
                })
-            if len(entries) > 1:
+            if len(entries) != 1:
                return self.playlist_result(entries, display_id, title)
            formats = entries[0]['formats']
        else:  # Assume single video
            download_text = self._search_regex(
-                DOWNLOAD_REGEX, webpage, 'download links', group='links')
+                DOWNLOAD_REGEX, webpage, 'download links', flags=re.S, group='links')
            media_kind = self._search_regex(
-                DOWNLOAD_REGEX, webpage, 'media kind', default='Video', group='kind')
+                DOWNLOAD_REGEX, webpage, 'media kind', default='Video', flags=re.S, group='kind')
-            formats = self._extract_formats(download_text, media_kind)
+            formats = self._legacy_extract_formats(download_text, media_kind)
        thumbnail = self._og_search_thumbnail(webpage)
        description = self._html_search_regex(
            r'(?s)<p class="teasertext">(.*?)</p>',
--- a/youtube_dl/extractor/youtube.py
+++ b/youtube_dl/extractor/youtube.py
@ -692,9 +692,9 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
        'invidious': '|'.join(_INVIDIOUS_SITES),
    }
    _PLAYER_INFO_RE = (
-        r'/s/player/(?P<id>[a-zA-Z0-9_-]{8,})//(?:tv-)?player',
+        r'/s/player/(?P<id>[a-zA-Z0-9_-]{8,})/(?:tv-)?player',
-        r'/(?P<id>[a-zA-Z0-9_-]{8,})/player(?:_ias\.vflset(?:/[a-zA-Z]{2,3}_[a-zA-Z]{2,3})?|-plasma-ias-(?:phone|tablet)-[a-z]{2}_[A-Z]{2}\.vflset)/base\.js$',
+        r'/(?P<id>[a-zA-Z0-9_-]{8,})/player(?:_ias(?:_tce)?\.vflset(?:/[a-zA-Z]{2,3}_[a-zA-Z]{2,3})?|-plasma-ias-(?:phone|tablet)-[a-z]{2}_[A-Z]{2}\.vflset)/base\.js$',
-        r'\b(?P<id>vfl[a-zA-Z0-9_-]+)\b.*?\.js$',
+        r'\b(?P<id>vfl[a-zA-Z0-9_-]{6,})\b.*?\.js$',
    )
    _SUBTITLE_FORMATS = ('json3', 'srv1', 'srv2', 'srv3', 'ttml', 'vtt')
@ -1626,15 +1626,13 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
        """ Return a string representation of a signature """
        return '.'.join(compat_str(len(part)) for part in example_sig.split('.'))
-    @classmethod
+    def _extract_player_info(self, player_url):
-    def _extract_player_info(cls, player_url):
+        try:
-        for player_re in cls._PLAYER_INFO_RE:
+            return self._search_regex(
-            id_m = re.search(player_re, player_url)
+                self._PLAYER_INFO_RE, player_url, 'player info', group='id')
-            if id_m:
+        except ExtractorError as e:
-                break
+            raise ExtractorError(
-        else:
+                'Cannot identify player %r' % (player_url,), cause=e)
            raise ExtractorError('Cannot identify player %r' % player_url)
        return id_m.group('id')
    def _load_player(self, video_id, player_url, fatal=True, player_id=None):
        if not player_id:
@ -1711,6 +1709,23 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                '    return %s\n') % (signature_id_tuple, expr_code)
        self.to_screen('Extracted signature function:\n' + code)
    def _extract_sig_fn(self, jsi, funcname):
        var_ay = self._search_regex(
            r'''(?x)
                (?:\*/|\{|\n|^)\s*(?:'[^']+'\s*;\s*)
                    (var\s*[\w$]+\s*=\s*(?:
                        ('|")(?:\\\2|(?!\2).)+\2\s*\.\s*split\(\s*('|")\W+\3\s*\)|
                        \[\s*(?:('|")(?:\\\4|(?!\4).)*\4\s*(?:(?=\])|,\s*))+\]
                    ))(?=\s*[,;])
            ''', jsi.code, 'useful values', default='')
        sig_fn = jsi.extract_function_code(funcname)
        if var_ay:
            sig_fn = (sig_fn[0], ';\n'.join((var_ay, sig_fn[1])))
        return sig_fn
    def _parse_sig_js(self, jscode):
        # Examples where `sig` is funcname:
        # sig=function(a){a=a.split(""); ... ;return a.join("")};
@ -1736,8 +1751,12 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
            jscode, 'Initial JS player signature function name', group='sig')
        jsi = JSInterpreter(jscode)
-        initial_function = jsi.extract_function(funcname)
+
-        return lambda s: initial_function([s])
+        initial_function = self._extract_sig_fn(jsi, funcname)
        func = jsi.extract_function_from_code(*initial_function)
        return lambda s: func([s])
    def _cached(self, func, *cache_id):
        def inner(*args, **kwargs):
@ -1856,15 +1875,9 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
    def _extract_n_function_code_jsi(self, video_id, jsi, player_id=None):
        var_ay = self._search_regex(
            r'(?:[;\s]|^)\s*(var\s*[\w$]+\s*=\s*"(?:\\"|[^"])+"\s*\.\s*split\("\W+"\))(?=\s*[,;])',
            jsi.code, 'useful values', default='')
        func_name = self._extract_n_function_name(jsi.code)
-        func_code = jsi.extract_function_code(func_name)
+        func_code = self._extract_sig_fn(jsi, func_name)
        if var_ay:
            func_code = (func_code[0], ';\n'.join((var_ay, func_code[1])))
        if player_id:
            self.cache.store('youtube-nsig', player_id, func_code)
@ -2136,7 +2149,8 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
                    video_details = merge_dicts(*traverse_obj(
                        (player_response, api_player_response),
                        (Ellipsis, 'videoDetails', T(dict))))
-                    player_response.update(api_player_response or {})
+                    player_response.update(filter_dict(
                        api_player_response or {}, cndn=lambda k, _: k != 'captions'))
                    player_response['videoDetails'] = video_details
        def is_agegated(playability):
@ -2566,8 +2580,8 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
        }
        pctr = traverse_obj(
-            player_response,
+            (player_response, api_player_response),
-            ('captions', 'playerCaptionsTracklistRenderer', T(dict)))
+            (Ellipsis, 'captions', 'playerCaptionsTracklistRenderer', T(dict)))
        if pctr:
            def process_language(container, base_url, lang_code, query):
                lang_subs = []
@ -2584,20 +2598,21 @@ class YoutubeIE(YoutubeBaseInfoExtractor):
            def process_subtitles():
                subtitles = {}
                for caption_track in traverse_obj(pctr, (
-                        'captionTracks', lambda _, v: v.get('baseUrl'))):
+                        Ellipsis, 'captionTracks', lambda _, v: (
                            v.get('baseUrl') and v.get('languageCode')))):
                    base_url = self._yt_urljoin(caption_track['baseUrl'])
                    if not base_url:
                        continue
                    lang_code = caption_track['languageCode']
                    if caption_track.get('kind') != 'asr':
                        lang_code = caption_track.get('languageCode')
                        if not lang_code:
                            continue
                        process_language(
                            subtitles, base_url, lang_code, {})
                        continue
                    automatic_captions = {}
                    process_language(
                        automatic_captions, base_url, lang_code, {})
                    for translation_language in traverse_obj(pctr, (
-                            'translationLanguages', lambda _, v: v.get('languageCode'))):
+                            Ellipsis, 'translationLanguages', lambda _, v: v.get('languageCode'))):
                        translation_language_code = translation_language['languageCode']
                        process_language(
                            automatic_captions, base_url, translation_language_code,
--- a/youtube_dl/jsinterp.py
+++ b/youtube_dl/jsinterp.py
@ -678,7 +678,7 @@ class JSInterpreter(object):
            return len(obj)
        try:
            return obj[int(idx)] if isinstance(obj, list) else obj[compat_str(idx)]
-        except (TypeError, KeyError, IndexError) as e:
+        except (TypeError, KeyError, IndexError, ValueError) as e:
            # allow_undefined is None gives correct behaviour
            if allow_undefined or (
                    allow_undefined is None and not isinstance(e, TypeError)):
@ -1038,6 +1038,10 @@ class JSInterpreter(object):
                    left_val = self._index(left_val, idx)
            if isinstance(idx, float):
                idx = int(idx)
            if isinstance(left_val, list) and len(left_val) <= int_or_none(idx, default=-1):
                # JS Array is a sparsely assignable list
                # TODO: handle extreme sparsity without memory bloat, eg using auxiliary dict
                left_val.extend((idx - len(left_val) + 1) * [JS_Undefined])
            left_val[idx] = self._operator(
                m.group('op'), self._index(left_val, idx) if m.group('op') else None,
                m.group('expr'), expr, local_vars, allow_recursion)
@ -1204,9 +1208,10 @@ class JSInterpreter(object):
                elif member == 'join':
                    assertion(isinstance(obj, list), 'must be applied on a list')
                    assertion(len(argvals) <= 1, 'takes at most one argument')
-                    return (',' if len(argvals) == 0 else argvals[0]).join(
+                    return (',' if len(argvals) == 0 or argvals[0] in (None, JS_Undefined)
-                        ('' if x in (None, JS_Undefined) else _js_toString(x))
+                            else argvals[0]).join(
-                        for x in obj)
+                                ('' if x in (None, JS_Undefined) else _js_toString(x))
                                for x in obj)
                elif member == 'reverse':
                    assertion(not argvals, 'does not take any arguments')
                    obj.reverse()
@ -1364,19 +1369,21 @@ class JSInterpreter(object):
        code, _ = self._separate_at_paren(func_m.group('code'))  # refine the match
        return self.build_arglist(func_m.group('args')), code
-    def extract_function(self, funcname):
+    def extract_function(self, funcname, *global_stack):
        return function_with_repr(
-            self.extract_function_from_code(*self.extract_function_code(funcname)),
+            self.extract_function_from_code(*itertools.chain(
                self.extract_function_code(funcname), global_stack)),
            'F<%s>' % (funcname,))
    def extract_function_from_code(self, argnames, code, *global_stack):
        local_vars = {}
        start = None
        while True:
-            mobj = re.search(r'function\((?P<args>[^)]*)\)\s*{', code)
+            mobj = re.search(r'function\((?P<args>[^)]*)\)\s*{', code[start:])
            if mobj is None:
                break
-            start, body_start = mobj.span()
+            start, body_start = ((start or 0) + x for x in mobj.span())
            body, remaining = self._separate_at_paren(code[body_start - 1:])
            name = self._named_object(local_vars, self.extract_function_from_code(
                [x.strip() for x in mobj.group('args').split(',')],
Author	SHA1	Message	Date
memo	da1f5b1c7e	Merge a53b4004cff69bca0f206bbd0b4a3003038568c7 into 2b4fbfce25902d557b86b003cf48f738129efce4	2025-03-26 08:03:44 +00:00
dirkf	2b4fbfce25	[YouTube] Support player `4fcd6e4a` thx seproDev, bashonly: yt-dlp/yt-dlp#12748	2025-03-26 02:27:25 +00:00
dirkf	1bc45b8b6c	[JSInterp] Use `,` for join() with null/undefined argument Eg: [1,2,3].join(null) -> '1,2,3'	2025-03-25 22:35:06 +00:00
dirkf	b982d77d0b	[YouTube] Align signature tests with yt-dlp thx bashonly, yt-dlp/yt-dlp#12725	2025-03-25 22:35:06 +00:00
dirkf	c55dbf4838	[YouTube] Update signature extraction for players `643afba4`, `363db69b`	2025-03-25 22:35:06 +00:00
dirkf	087d865230	[YouTube] Support new player URL patterns	2025-03-25 22:35:06 +00:00
dirkf	a4fc1151f1	[JSInterp] Improve indexing * catch invalid list index with `ValueError` (eg [1, 2]['ab'] -> undefined) * allow assignment outside existing list (eg var l = [1,2]; l[9] = 0;)	2025-03-25 22:35:05 +00:00
dirkf	a464c159e6	[YouTube] Make `_extract_player_info()` use `_search_regex()`	2025-03-25 22:35:05 +00:00
dirkf	7dca08eff0	[YouTube] Also get original of translated automatic captions	2025-03-25 22:35:05 +00:00
dirkf	2239ee7965	[YouTube] Get subtitles/automatic captions from both web and API responses	2025-03-25 22:35:05 +00:00
memo	a53b4004cf	[tagesschau] remove duplicates from playlists	2021-03-13 22:17:51 +01:00
memo	ac5b267afe	[tagesschau] make some generic titles more specific This turns for example `Ganze Sendung` into `tagesschau 20 Uhr - 04.12.14 20:00` as with the old extractor, which is especially important for playlists of such videos.	2021-03-13 21:57:55 +01:00
memo	2a0d9305f4	[tagesschau] fix deprecation warning about inline regex flags The warning during test_download: DeprecationWarning: Flags not at the start of the expression '(?s)<p[^>]+class="in' (truncated)	2021-03-13 12:05:05 +01:00
memo	74bb98431e	[tagesschau] fix extraction This fixes the extraction for taggeschau.de, the primary German news broadcaster. Details: - the new website sends the video meta data as JSON encoded as an attribute of the player - some old pages (e.g. [1]) still use the old format of `TagesschauIE`, so the old extraction code is kept as fallback - the old player format is not used anymore, so `TagesschauPlayerIE` is removed - several optional fields are added, in particular subtitles - crashes on empty playlists are fixed - some test cases are updated, as some videos are not available anymore - the video id in one test case is changed from `ts-5727` to `video-45741` because it appears to be the more permanent identifier; for example [1] is still available, while [2] cannot be accessed anymore - the format identifiers are normalized to `s`,..,`xl` as previously used by `TagesschauPlayerIE` (instead of `webs.h264`,..,`webxl.h264`) [1] https://www.tagesschau.de/multimedia/video/video-98529~_bab-sendung-209.html [2] https://www.tagesschau.de/multimedia/sendung/bab/bab-3299~_bab-sendung-209.html	2021-03-13 12:05:05 +01:00