WO2025238505 - LARGE MULTIMODAL MODEL-BASED VIDEO ENCODING OPTIMIZATION
National phase entry is expected:
Publication Number
WO/2025/238505
Publication Date
20.11.2025
International Application No.
PCT/IB2025/054916
International Filing Date
09.05.2025
Title **
[English]
LARGE MULTIMODAL MODEL-BASED VIDEO ENCODING OPTIMIZATION
[French]
OPTIMISATION DE CODAGE VIDÉO REPOSANT SUR UN GRAND MODÈLE MULTIMODAL
Applicants **
IMAX CORPORATION
Inventors
DUANMU, Zhengfang
JIANG, Mingzhe
LIU, Wentao
Priority Data
63/646,304
13.05.2024
US
Application details
| Total Number of Claims/PCT | * |
| Number of Independent Claims | * |
| Number of Priorities | * |
| Number of Multi-Dependent Claims | * |
| Number of Drawings | * |
| Pages for Publication | * |
| Number of Pages with Drawings | * |
| Pages of Specification | * |
| * | |
| Number of Office Actions | * |
| * | |
International Searching Authority |
CIPO
* |
| Recordal of a Change of the Applicant's Name/Address |
Change of Applicant's Name and Address
* |
| Type of Assignment |
The Standard Agent's Assignment
* |
| Applicant's Legal Status |
Legal Entity
* |
| * | |
| * | |
| * | |
| * | |
| * | |
| Entry into National Phase under |
Chapter I
* |
| Patent Delivery |
Send the Letters Patent by Courier
* |
| 译文 |
|
* The data is based on automatic recognition. Please verify and amend if necessary.
** IP-Coster compiles data from publicly available sources. If this data includes your personal information, you can contact us to request its removal.
Quotation for National Phase entry
| Country | Stages | Total | |
|---|---|---|---|
| China | Filing, Examination, Granting | 2245 | |
| EPO | Filing, Examination, Granting | 14132 | |
| Japan | Filing, Examination, Granting | 2309 | |
| South Korea | Filing, Examination, Granting | 2469 | |
| USA | Filing, Examination, Granting | 4740 |

Total:
25,895
Contact Us
Abstract[English]
Rate-distortion (RD) curves of a segment of images within a sequence of images are predicted to optimize a best perceptual video quality at a lowest possible bitrate for video encoding. A video asset including an ordered sequence of image frames is input. A machine- learning module is used to processes a sequence of semantically-related image frames of the video asset into a sequence of semantic vectors, each semantic vector defining semantic and perceptual features of the respective image frame. The sequence of semantic vectors is adjusted into an adjusted semantic vector representative of semantic and perceptual features of the sequence of image frames. An RD curve of the sequence of image frames is predicted by matching the adjusted semantic vector using a semantic matching module to a defining semantic vectors having corresponding known RD curves, the matching RD curve being the predicted RD curve of the sequence of image frames.[French]
Des courbes de distorsion de débit (RD) d'un segment d'images compris dans une séquence d'images sont prédites pour optimiser une meilleure qualité vidéo perceptuelle à un débit binaire le plus bas possible pour un codage vidéo. Une ressource vidéo comprenant une séquence ordonnée de trames d'image est entrée. Un module d'apprentissage automatique est utilisé pour traiter une séquence de trames d'image sémantiquement associées de la ressource vidéo en une séquence de vecteurs sémantiques, chaque vecteur sémantique définissant des caractéristiques sémantiques et perceptuelles de la trame d'image respective. La séquence de vecteurs sémantiques est ajustée en un vecteur sémantique ajusté représentatif des caractéristiques sémantiques et perceptuelles de la séquence de trames d'image. Une courbe RD de la séquence de trames d'image est prédite par mise en correspondance, à l'aide d'un module d'appariement sémantique, du vecteur sémantique ajusté avec un vecteur sémantique de définition ayant des courbes RD connues correspondantes, la courbe RD correspondante étant la courbe RD prédite de la séquence de trames d'image.