AI全面接管世界杯直播?腾讯云揭秘“多模态Harness”的破局之道
刚刚落幕的美加墨世界杯,不仅是一场全球体育盛宴,更是AI技术的一次“大练兵”。在这场赛事中,腾讯云撑起了全球17个国家和地区的官方直播,覆盖了亚太及国内三分之二的官方授权平台。
腾讯云副总裁、国际产品技术负责人李郁韬透露,这是AI首次大规模深入直播生产环节。从画质增强、智能导播到自动剪辑、智能横转竖以及质检溯源,绝大多数流程已由AI全自动接管。这不仅是一场赛事的技术支撑,更是AIGC迈向大规模工业化生产的一个生动切面。
不卷模型卷工程,什么是“多模态Harness”?
在生成式AI狂飙的当下,许多厂商的直觉是“把所有新模型都接一遍”。但李郁韬指出,这种“集邮式”对接往往会撞上各种落地难题。在直播、点播、多媒体互动等复杂场景中,受限于网络传输、视频画质和用户体验,单一模型根本无法包打天下。
客户真正的痛点在于:谁来搞定底层的脏活累活,让他们能专注业务创新?
为此,腾讯云将自身的战略卡位定义为多模态领域的 “Harness(驾驭工程)”。他们不执着于模型如何生成内容,而是死磕从生成到稳定交付的全链路——包括预处理、质检、拼接、转码、分发和格式适配。早在6月5日的腾讯云AI产业应用大会上,腾讯云音视频就发布了AI品牌 Tencent Cloud WAND,整合了6大自研媒体专用模型和60余项AI能力,专门针对电商、短剧、教育和赛事直播等垂直场景进行全链路赋能。
视频生成迎来商业闭环,Harness为何不会被绕过?
视频生成被视为继AI Coding之后,第二个跑通商业闭环的AI变现场景。今年以来,这条赛道竞争白热化,格局剧烈洗牌:
- 国内“双寡头”崛起:字节旗下 Seedance 与快手可灵 AI 领跑赛道。公开数据显示,可灵 AI 的 ARR(年度经常性收入)已逼近5亿美元,一年内翻了4倍;而 Seedance 2.0 虽被官方辟谣“20亿美元 ARR”的传闻,但也明确已跨越“生产力质变点”门槛。
- 海外巨头退场:今年3月,OpenAI 宣布停止 Sora 的独立 App、API 接口及 ChatGPT 内置视频功能,正式退出消费级 AI 视频生成市场。
在从生成到交互的链路不断压缩的趋势下,Harness 这个生态位会被绕过吗?李郁韬给出了否定的答案。他认为,大模型作为后端生产力,其提升会激发出更广阔的前端需求。由于大模型永远无法满足用户的“极致需求”,这种“供给关系差”决定了 Harness 的长期价值。腾讯云最大的机会,正是利用 Harness 将最新模型快速转化为企业级生产力,把值得重做一遍的音视频体验推向极致。
出海排头兵:从“看效果”到“死磕ROI”
随着AI算力从训练向推理倾斜,大量 AIGC 应用正加速走向大规模生产。在国内,短剧和漫剧制作已深度拥抱多模态技术;而在海外,音视频解决方案已成为腾讯云出海的“排头兵”,在收入、市场份额和行业心智上稳居行业第一,近三年海外业务更是保持了两位数增长。
腾讯云音视频总经理李志成敏锐地观察到,无论是短剧还是电商工具出海,客户的心态正在发生转变:前期看重效果和影响力,中后期则死磕 ROI(投资回报率),关注到底能不能盈利。他预测,未来1到2年内,短剧和电商 AI 工具将像如今的大语言模型一样,从垂直行业走向全面普及,成为企业日常工作的标配。
Agent时代的新想象与云厂商的三大高地
面向 Agent 时代,腾讯云正将音视频能力与智能体、AI 硬件、具身机器人及云手机深度融合。例如,团队已与逐际动力等具身智能企业、无人清扫车企业开展合作,孵化出 TRRO 远程实时操控方案,完美解决了弱网环境下机器人人工介入时的低延时通信和音视频数据回传难题。
展望未来,李郁韬将云厂商在多模态领域的竞争归结为三大高地:
- 多模态训练与算力:不同于纯语言模型,多模态领域大量投资集中在理解和生成上。未来端到端的语音交互和视频生成,对算力及云基建提出了极高要求。
- 存储与数据积累:多媒体数据的清洗、处理和对齐远比纯文本复杂。大量视频在预训练前需要进行迥异于文字的数据处理,对存储稳定性和数据获取能力要求极高。
- 应用生产端:提供贴近最终客户的推理服务和综合处理能力。在创新趋势中,如何用优秀的运营方式满足客户需求,将是决定客户去留的关键胜负手。
