音视频技术开发周刊 | 315

news2025/1/11 8:05:10

每周一期,纵览音视频技术领域的干货。

新闻投稿:contribute@livevideostack.com。

8ca8535c5711c67d268e132cc12efa57.png

OpenAI科学家最新演讲:GPT-4即将超越拐点,1000倍性能必定涌现!

GPT-4参数规模扩大1000倍,如何实现?OpenAI科学家最新演讲,从第一性原理出发,探讨了2023年大模型发展现状。

PS+AI生图一步完成,效果惊人!Adobe Firefly 2重磅更新:模型全面升级,矢量图完美支持

Adobe的AIGC生图平台Firefly最近升级为Firefly 2,提升了图像质量、引入了矢量图生成功能,并增加了多项新功能,极大改善了用户体验,为创作和设计工作提供更出色的工具。

生成式AI全球投融资220亿美元,美国占比89%!OpenAI贡献超60%,中国AI芯片投融资世界第一,超美国两倍

美国在这次生成式人工智能的热浪中独占鳌头,获得了全球投融资的89%,但在AI芯片的投融资中,中国领先世界。


微软OpenAI联手围剿英伟达,首款自研AI芯片下月发布!

一家独大的英伟达,把微软和OpenAI都逼得亲自下场造芯片了。也许AI芯片大战才刚刚拉开帷幕。

929a805e299123acfb740100bf506e21.png

GPT-4推理更像人了!中国科学院提出「思维传播」,类比思考完胜CoT,即插即用

大模型推理难题攻克了?中国科学院联手耶鲁大学的研究人员提出了全新框架「思维传播」,让大模型能够像人类一样类比思考。


文生3D模型大突破!MVDream重磅来袭,一句话生成超逼真三维模型

文生3D模型进步!分数蒸馏采样下的MVDream,真的有这么神奇吗?真的有。


CMU华人打破大模型黑盒,Llama 2撒谎被一眼看穿!脑电波惨遭曝光,LLM矩阵全破解

大语言模型黑盒,居然被CMU等机构的学者打破了?他们发现,LLM内部有可解释的表征,如果撒谎,还能被测谎仪检测出来!


打破大模型黑盒,彻底分解神经元!OpenAI对头Anthropic击破AI不可解释性障碍

距离破解大模型「黑箱」难题又近了一步!近日,来自Anthropic的研究团队通过采用稀疏自动编码器的弱字典学习算法,从512个神经元中提取出来了4000多个可解释特征。

ecdda0afcc68f2086204e525ba5b42b7.png

清华阿里等发布PoSynDA: 多假设姿态合成域自适应的鲁棒3D人体姿态估计

由于目标域训练集中2D - 3D姿态对的稀缺性,目前的3D人体姿态估计器在适应新数据集方面面临挑战。为了克服这个问题,我们提出了多假设位姿合成域适应( PoSynDA )框架,该框架不需要大量的目标域注释。PoSynDA利用以扩散为中心的结构,模拟了目标域中的三维姿态分布,填补了数据多样性的空白。

德国马普所最新开源!神经规范场: 渲染引导空间规范变换

近期,神经场(Neural Fields)领域的巨大进展,已经显著推动了神经场景表示和神经渲染的发展。为了提高3D场景的计算效率和渲染质量,一个常见的范式是将3D坐标系统映射到另一种测量系统,例如2D流形和哈希表,以建模神经场。本文将这种坐标或者测量系统的转换定义为“规范变换”(gauge transformation)。这种规范变换通常采用预定义的函数,例如EG3D中的垂直投影和Instant-NGP中的空间哈希函数。然而,这种预先定义的函数往往并非最优选择,所以一个很自然的问题浮现出来:是否能以端到端的方式直接学习规范变换,让它与神经场一同进行优化?本研究将此问题拓展为一个广义的范式,包括连续型和离散型规范变换,并设计了统一的学习框架以共同优化规范变换和神经场。

威斯康星大学发布|利用瞬态直方图释放接近传感器的性能

本文提供了利用一类近距离飞行时间 (ToF) 距离传感器捕获的瞬态直方图来恢复平面场景几何形状的方法。瞬态直方图是一维时间波形,对入射到 ToF 传感器上的光子的到达时间进行编码。通常,传感器使用专有算法处理瞬态直方图以产生距离估计,这通常用于多种机器人应用。

巴斯大学发布:运动目标轨迹预测的视觉SLAM

视觉同时定位与建图( Simultaneous Localization and Mapping,SLAM )由于能够单独使用视觉数据估计相机轨迹并创建环境地图,近年来受到了极大的关注,为自动驾驶应用做出了巨大贡献,特别是在有移动人群和车辆的现实场景中。在这项工作中,本文提出了一个融合移动对象轨迹跟踪和预测的视觉SLAM系统。

05d222a265fc3d1591158c928d4c94e4.png

独家:国产“Vision Pro”来袭,头显的Turn-key时刻即将到来?

随着Vision Pro的发布,市场上最为兴奋的或许有两拨人:一波是VR/AR从业者以及发烧友,另外还有一波则是摩拳擦掌随时准备对产品进行开模打样的“华强北们”。

微信内测版适配Vision Pro;Meta推出企业级头显服务

据 IT 之家消息,10 月 8 日微信发布了 iOS 8.0.43 内测版更新,虽仅显示“bug fixed”看似微不足道的更新,但其内部却包含了不少界面的调整和细节优化。

升级混合现实体验!Meta Quest 3 MR功能的方方面面

随着Meta Connect大会的召开,下一代头显Quest 3也已经确定将于10月10日正式发布,定价499美元起。除了性能上的升级以外,混合现实是官方反复重点强调的功能,它可以令虚拟内容与物理世界无缝融合,同时让用户以丰富的色彩自然直观地观看和交互。

494f5e5744c6a56a235cb2aeb6d49139.png

VoiceFlow:高效的文本到语音与纠偏匹配

Rectified Flow Matching 语音合成,上海交大开源。

https://arxiv.org/abs/2309.05027

NeurIPS 2023丨说话人识别:语音解耦与自监督

该研究由新加坡国家科技局(A⋆STAR)、新加坡国立大学、香港理工大学和香港中文大学(深圳)的研究人员共同完成。该项工作已被NeurIPS 2023(main track)接收。

单通道语音唤醒与语音增强结合时的性能变化

单通道语音唤醒常应用于TWS耳机、智能手表等边缘设备上,作为语音助手的“守门员”。各信噪比下的唤醒率、每日误唤醒、唤醒延迟、模型参/算量是衡量语音唤醒算法性能的若干关键指标。低信噪比下唤醒率低,一直是语音唤醒的应用痛点和技术难点。

专业音视频领域中,Pro AV的崛起之路

在技术进步的加持下,AV行业发展得如何了?本文采访了两位深耕于广播电视行业的技术人,为我们介绍了专业音视频的进展:一位冉冉升起的新星:Pro AV以及FPGA在其中发挥的作用。

fb9be03824735e71bd8f15b9307a1e80.png

自适应流媒体智能传输优化研究

在视频流量爆发式增长的当下,面对多用户多场景的网络挑战,如何降低卡顿、提升用户体验是流媒体传输研究的关键。LiveVideoStackCon 2023上海站邀请到了清华大学博士黄天驰,为大家分享自适应流媒体智能传输优化研究进展。

云化XR和沉浸式全息交互技术的探索与思考

计算机图形与仿真技术的发展为人类带来了众多的沉浸式技术。虚拟现实(VR)、增强现实(AR)、混合现实(MR)等技术通过不同程度数字信息与现实环境的融合,为用户带来了全新体验,而统括三者的扩展现实(XR)更强调虚拟世界与现实世界的弥合,缩小人们、信息和体验之间的距离壁垒。LiveVideoStackCon 2023 上海站邀请了来自北京邮电大学的黄亚坤,为大家分享学术界关于云化XR和沉浸式全息交互技术的探索与思考 。

深度神经网络压缩与加速技术

深度神经网络是深度学习的一种框架,它是一种具备至少一个隐层的神经网络。与浅层神经网络类似,深度神经网络也能够为复杂非线性系统提供建模,但多出的层次为模型提供了更高的抽象层次,因而提高了模型的能力。深度神经网络是一种判别模型,可以使用反向传播算法进行训练。随着深度神经网络使用的越来越多,相应的压缩和加速技术也孕育而生。LiveVideoStackCon 2023上海站邀请到了胡浩基教授为我们分享他们实验室的一些实践。

挑战十万在播--直播全量在播分发系统

先说明下什么叫“全量在播”,指的是直播范围内,当前所有在线主播的信息,尤其是主播的房间id和uid,对于很多上游业务来说,是必要的数据,是业务逻辑的数据基础。直播之前虽然有一套这样的系统,但是从目前运行状态看并不能面向更高体量业务支撑,而且线上也因为这种过时的在播架构工作异常发生过几次线上事故。所以正如一本书所讲,如果不杀死任何系统,你会被僵尸包围。对于这种遗留系统需要做面向未来目标的设计。

875672a36584ea68533e62bf02e2ac51.png

75岁Hinton再次警告:AI可能会接管人类!

最近,Hinton在采访中谈论了人工智能存在的各种安全隐患,担忧人类将会被其接管。

【行业分析】中美半导体产业脱钩趋势下的影响研判和应对建议

半导体产业链供应链博弈正在成为中美竞争博弈的主战场,美国加速对华脱钩、重振自身半导体产业的战略轮廓逐渐清晰,同时美国对华实施以半导体为核心的科技战将呈现长期性、谋划性和加剧性的发展趋势。为此,中国必须做好打“持久战”的战略准备。本文将主要分析当前美方强推对华半导体“断链脱钩”的主要态势,研判其对全球半导体产业、技术创新、景气周期、区域布局等多个维度产生的变化和影响,并从加强保供韧链、加快创新提级、加速市场共享、加紧造船出海等四方面对我国半导体产业提出应对建议。

4ecce3eba3bbe8c55a270a5ac93b795c.png

联丰迅声完成千万元Pre-A+轮融资

西安联丰迅声信息科技有限责任公司(以下简称“联丰迅声”)宣布完成千万级Pre-A+轮融资,本轮领投方为西安市人才基金。本轮融资资金将主要用于新产品技术研发、国内外销售团队扩充,以及生产测试线的建立等业务方向。

从ToC到ToB,MR头显Lynx-R1提价450美元至1300美元

随着目标市场的再次转变,法国硬件初创公司Lynx宣布MR头显R1将从原来的850美元提高到1300美元。

2023年9月半导体行业媒体传播报告:创芯片行业年内全球最大规模IPO,Arm纳斯达克上市!

国内方面,中国企业在光通信和存储芯片等领域份额上升,显示行业正稳步发展,但也面临产能过剩和价格战压力,企业致力产业升级。

627c645c79e5f8946571370a7cc7f03d.png


限时优惠最后1天!

时隔四年再次相聚,机会难得,不容错过。
11月24日至25日,LiveVideoStackCon 2023深圳站,期待与您共享此次音视频技术盛会,门票限时9折优惠最后1天倒计时,抓紧报名啦!

时间:2023年11月24日-25日
●地点:深圳圣淘沙酒店(翡翠店)
●咨询:13520771810(微信同号)了解详情。
●官方链接:https://sz2023.livevideostack.com/topics

7f19aedbe07841b67dbd18533232613e.jpeg

ADM活动推荐
10月19日,14:00-16:30,AMD特邀生态合作伙伴的音视频技术专家,共同举行专业音视频技术与方案的在线专场研讨会,探讨音视频技术的应用方向,展望新兴音视频技术所带来的全新视听享受。

参与本次研讨会,您将全方位地了解 AMD 为专业音视频及广播应用提供的广泛的方案和平台。无论是 FPGA、自适应 SoC,还是配备集成型 H.264/H.265 视频编解码器单元的 MPSoC …… AMD 均可提供理想的低时延 、高质量的音视频处理平台。与此同时,我们还邀请到了来自北格逻辑、赛因铸声场、伟乐科技、千视电子等合作伙伴,与大家分享在专业音视频领域的最新应用方案和IP。

预约观看链接:https://app.ma.scrmtech.com/meetings-api/sapIndex/SapSourceData?pf_uid=10980_1464&sid=82429&source=2&pf_type=3&channel_id=38863&channel_name=LVS&tag_id=06ed6279083a57fd

10712ffda6202ebe73f3d6d70e219874.png

点击阅读原文 

跳转LiveVideoStackCon 2023 深圳站 官网,了解更多信息

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.coloradmin.cn/o/1100143.html

如若内容造成侵权/违法违规/事实不符,请联系多彩编程网进行投诉反馈,一经查实,立即删除!

相关文章

数据结构复盘——第三章:栈和队列

文章目录 第一部分:栈1、栈的定义2、栈的操作 第一部分习题第二部分:共享栈1、共享栈的定义2、共享栈的操作 第二部分习题第三部分:链栈1、链栈的定义2、链栈的操作 第三部分习题第一到三部分小结1、顺序栈和链栈的比较2、栈的应用3、栈的应用…

正向代理流程

正向代理场景 已经拿下了一台服务器,该服务器有两个网卡,一个公网,一个私网未被攻击的服务器只有一个内网网卡,它不能和其他网段通信,只能在本网段通信,被叫做不出网主机攻击机需要直接连接未被攻击的服务器…

Shopee印尼站停止销售跨境商品:电商新规是否将改变印尼电商格局?

在全球电商市场竞争激烈的背景下,东南亚地区的印尼一直以其庞大的人口和不断增长的中产阶级而闻名。这个国家拥有着无限的潜力,吸引着各大电商平台争相进军。 然而,近期,一项关于电子商务的新法规引发了广泛的讨论和关注。据报道…

竞赛选题 深度学习YOLO安检管制物品识别与检测 - python opencv

文章目录 0 前言1 课题背景2 实现效果3 卷积神经网络4 Yolov55 模型训练6 实现效果7 最后 0 前言 🔥 优质竞赛项目系列,今天要分享的是 🚩 **基于深度学习YOLO安检管制误判识别与检测 ** 该项目较为新颖,适合作为竞赛课题方向&…

C++ 快速排序算法

1、快速排序 步骤&#xff1a; 确定分界点 通常选 Q[L]、Q[(LR)/2]、Q[R]调整范围 使左边的 <X 右边 > X 也就是 左右两边的指针&#xff0c;依次比较定义的分界点&#xff08;X&#xff09;根据比较大小调整顺序 依次递归处理左右两端 模板代码&#xff1a; // 数组…

ExoPlayer架构详解与源码分析(5)——MediaSource

系列文章目录 ExoPlayer架构详解与源码分析&#xff08;1&#xff09;——前言 ExoPlayer架构详解与源码分析&#xff08;2&#xff09;——Player ExoPlayer架构详解与源码分析&#xff08;3&#xff09;——Timeline ExoPlayer架构详解与源码分析&#xff08;4&#xff09;—…

计算机毕业设计--基于SSM+Vue的物流管理系统的设计与实现

末尾获取源码 开发语言&#xff1a;Java Java开发工具&#xff1a;JDK1.8 后端框架&#xff1a;SSM 前端&#xff1a;Vue 数据库&#xff1a;MySQL5.7和Navicat管理工具结合 服务器&#xff1a;Tomcat8.5 开发软件&#xff1a;IDEA / Eclipse 是否Maven项目&#xff1a;是 目录…

Postman接口测试: postman设置接口关联,实现参数化

postman设置接口关联 在实际的接口测试中&#xff0c;后一个接口经常需要用到前一个接口返回的结果&#xff0c; 从而让后一个接口能正常执行&#xff0c;这个过程的实现称为关联。 在postman中实现关联操作的步骤如下&#xff1a; 1、利用postman获取上一个接口指定的返回值…

ICMP协议(一)

一 ICMP 说明&#xff1a; 了解大致内容即可,如果不是搞数通的只需要有个概念即可 小林 coding ① 概念 重点&#xff1a; ping、traceroute、mtr 主要是利用 ICMP 或者 UDP 的特性特点&#xff1a; ICMP 是TCP/IP协议簇的一个子协议,属于网络层 [三层]协议作用&#xff…

嵌入式开发常见的问题解决方法总结

本文引自 https://mp.weixin.qq.com/s/IBDnlzl_nFykemPxp7rt5w 一、问题复现 稳定复现问题才能正确的对问题进行定位、解决以及验证。一般来说&#xff0c;越容易复现的问题越容易解决。 (1) 模拟复现条件 有的问题存在于特定的条件下&#xff0c;只需要模拟出现问题的条件即…

外卖大数据案例

一、环境要求 HadoopHiveSparkHBase 开发环境。 二、数据描述 meituan_waimai_meishi.csv 是某外卖平台的部分外卖 SPU&#xff08;Standard Product Unit &#xff0c; 标准产品单元&#xff09;数据&#xff0c;包含了外卖平台某地区一时间的外卖信息。具体字段说明如下&am…

文件内容相关

1.查看文件 cat /etc/passwd 2.编辑文件 echo "i like dog" > qun.txt 标准输出重定向 echo "i like best cat" >> qun.txt 标准输出追加重定向 cat >> qun.txt cat >>qun.txt<< ene vim编辑 进入编辑模式 i 光标所在…

在unity中给游戏物体一个标记

标记 方便识别&#xff01; 标签&#xff08;Tag&#xff09; 引擎内部会对物体的标签建立了索引。通过标签查找物体&#xff0c;要比通过名字查找物体快得多。标签最多只能有 32个。前几个是常用标签&#xff0c;具有特定含义&#xff0c;例如玩家( Player)、主摄摄像机 (Mai…

【RTOS学习】优先级 | Tick | 任务状态 | 空闲任务 | 任务调度

&#x1f431;作者&#xff1a;一只大喵咪1201 &#x1f431;专栏&#xff1a;《RTOS学习》 &#x1f525;格言&#xff1a;你只管努力&#xff0c;剩下的交给时间&#xff01; 优先级 | Tick | 任务状态 | 空闲任务 | 任务调度 &#x1f3c0;优先级⚽任务管理 &#x1f3c0;T…

PostMan使用csv/json进行数据参数化

创建csv文件 或者创建json文件 [{"name": "zhangsan","age": 18},{"name": "lisi","age": 20} ] 运行集合脚本的时候选择data文件 在请求接口中输入全局变量 {{user}}的方式进行传递 在Tests中要使用断言&…

C# Winform编程(4)多文档窗口(MDI)

多文档窗口&#xff08;MDI&#xff09; 添加菜单&#xff0c;IsMdiContainer设为True: From窗口添加菜单 Form1.cs using System; using System.Collections.Generic; using System.ComponentModel; using System.Data; using System.Drawing; using System.Linq; using S…

华为鸿蒙系统安装第三方软件 - 注意事项

华为鸿蒙系统安装第三方软件 - 注意事项 前言关闭增强防护关闭应用检测发现恶意软件解除软件管控 前言 华为鸿蒙系统默认开启纯净模式&#xff0c;仅支持安装经过华为应用市场检测的应用&#xff0c;并禁止运行病毒和风险应用。但此功能是可以关闭的&#xff0c;下文介绍如何安…

Qtday01(qt简介、简单窗口组件)

今日任务 仿qq登录界面&#xff0c;QT实现 代码&#xff1a; 头文件&#xff1a; #ifndef MAINWINDOW_H #define MAINWINDOW_H#include <QMainWindow> #include <QLineEdit> #include <QLabel> #include <QPushButton> #include <QtDebug> #…

session认证

目录 前言 http协议的无状态性 session的工作原理 在express中使用session认证 在session中存数据 在session中取数据 清空session 结尾 前言 session是一种记录客户状态的机制&#xff0c;客户端浏览器法访问服务器的时候&#xff0c;服务器把客户端信息以某种形式记录…

基于闪电连接过程优化的BP神经网络(分类应用) - 附代码

基于闪电连接过程优化的BP神经网络&#xff08;分类应用&#xff09; - 附代码 文章目录 基于闪电连接过程优化的BP神经网络&#xff08;分类应用&#xff09; - 附代码1.鸢尾花iris数据介绍2.数据集整理3.闪电连接过程优化BP神经网络3.1 BP神经网络参数设置3.2 闪电连接过程算…