新闻频道>新政风向

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

来源: 新华社
14:05:35

九五至尊

谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

铁齿铜牙纪晓岚

A |     IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。         IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。         但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。    天猫【淘严选旗舰】     白象方便面 12 桶标价 45 元,下单领取 5.38 元淘礼金,淘金币可抵 0.45 元,点击详情页【淘宝秒杀】卡片,根据提示回到淘宝 APP 首页,再点击【淘宝秒杀】模块,官方限时补贴 13.41 元,到手价为 25.76 元,折合每桶仅需 2.14 元。         谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。

B |     购买链接:天猫(券后35.9元)     扫码直达:     

    汤鲜味美 回味悠长

。         GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。         GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。

C | 模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。         训练数据以合成为主。精选食材,匠心配比,浓郁醇厚更入味。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。

D |     有经典红烧、经典香辣、经典酸菜、香菇炖鸡、原汁猪骨,5 种口味,可下单组合装。

E |          泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。

F |     购买提醒:天猫淘严选旗舰商品,正品保障,支持七天无理由退换,赠退货宝,请查看最新评价后再入手~     

    

    

    

    【广告】本文用于优惠促销信息分享,结果仅供参考。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。          

     【本文结束】如需转载请务必注明出处:      责任编辑:清晨     文章内容举报     

G |          性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。         参考。

Current article:http://t1z9m4o.qiuergejiaolaiaozhuangshi.buzz/un3u/20260826/5251723.html

Published on:01:23:11


关键词:古剑奇谭,黑金,卡萨布兰卡责任编辑:杜乙道宗