
阶跃星辰发布 StepAudio 2.5 ASR:推理速度飙升 400%,支持 30 分钟长音频秒级转写
ITCOW牛新网 4月25日消息,阶跃星辰昨日正式推出了其新一代自动语音识别模型——StepAudio 2.5 ASR。这一模型的最大亮点在于,它率先将原本应用于大语言模型领域的推理加速技术引入到了语音识别赛道,成功打破了传统语音模型在效率与精度上的瓶颈。对于需要高频处理音频数据...
最近有哪些产品和公司在密集发生“模型发布”
想看最近哪些产品、模型和公司在集中出现“模型发布”相关动作,这一页会更省时间。
相比泛资讯流,这里更适合直接跟踪这类事件本身的最新变化。
模型发布资讯
5,198
正文图片
15,719

ITCOW牛新网 4月25日消息,阶跃星辰昨日正式推出了其新一代自动语音识别模型——StepAudio 2.5 ASR。这一模型的最大亮点在于,它率先将原本应用于大语言模型领域的推理加速技术引入到了语音识别赛道,成功打破了传统语音模型在效率与精度上的瓶颈。对于需要高频处理音频数据...

5月6日,字节跳动火山引擎发布豆包大模型家族首款全模态理解模型Doubao-Seed-2.0-lite。 新版本已在火山方舟平台上线,支持视频、图像、音频、文本四种模态的原生统一理解,同时升级了智能体、代码生成和图形用户界面能力。 同批上线的还有同样支持全模态的Doubao-Se...
出品 | 虎嗅科技组 作者 | 韦雯 编辑 | 苗正卿 头图 | 视觉中国 2026年5月8日,海信办了一场发布会。却没有电视。 六款新品一字排开:AI智能眼镜、充电宝、激光投影、闺蜜机、显示器……横跨居家、办公、户外、随行四大场景。2025年海信以23.2%的市占率领跑中国电视...

IT之家 5 月 11 日消息,刚刚,阿里云上线团队版 Token Plan,内置 Qwen3.6、Kimi-K2.6、GLM-5.1、Wan2.7 等十多款多模态模型,支持多坐席分配和管理,并设置标准、高级和尊享三档,用户可灵活按需选择,有效解决订阅服务的规模化使用难题。 目前...

凤凰网科技讯 5月12日,宇树科技发布GD01载人变形机甲,390万元起。官方表示,这是全球首款量产版载人机甲,还可以变形,民用交通工具,体重约500kg(载人后)。 自动播放 近日,宇树科技全国首家直营旗舰店正式开业。该店位于北京王府井银泰in88一楼,陈列了宇树多款明星产品,...
本文来自微信公众号: 人人都是产品经理 ,作者:周周粥粥 每次看到某个AI Agent产品发布demo,评论区清一色“太强了”“颠覆认知”,过两周再看,同一批人在骂“垃圾”“根本不能用”“又是智商税”。 这个循环从2024年延续到2026年,好像从来没有真正被打破过。 很多人把原...

极客一问:你怎么看这次 DeepSeek V4 的更新? 头图来源:GPT生成 万众期待中,DeepSeek V4,终于发布了! 就在刚刚,被期待已久的DeepSeek V4 预览版正式登场。两个版本—— V4-Pro 和 V4-Flash,全系标配 1M...

作者| Li Yuan 编辑|靖宇 机器人终于开始学做西红柿炒鸡蛋了。 过去几年,人形机器人行业最擅长的事情,是跳舞、翻跟头、搬箱子,以及在视频里越走越像人。但普通人对机器人的期待,往往还是会回到一个很朴素的问题:它到底什么时候能帮我做家务? 这件事一直很难。 家务不是一套标准动...

作者|苏子华 编辑|郑玄 最近两年,AI 行业最热的词一直绕不开「算力」。 从大模型训练,到今年 Agent 的火热,再到各家云厂商不断扩建智算中心,行业讨论最多的,几乎都是 GPU、芯片和算力规模。好像只要卡够多,AI 就能继续往前跑。 但现实并不是。 不少做大模型训练和推理的...

2024 年 2 月,OpenAI 发布了 Sora。这个能生成视频的 AI 模型用极短的时间改写了移动互联网时代的内容创作方式,甚至连迪士尼都曾计划为此注资十亿美元,并计划在 Sora 2 中引入自己的核心影视 IP。 但就在 26 年 3 月,OpenAI 宣布关闭 Sora...

编者按:本文来自微信公众号 “卫夕指北”(ID:weixizhibei) ,作者:卫夕, 创业邦经授权转载。 我最近买了一个这样的键盘—— 为什么要买这个键盘呢? 原因在于现在各种 AI 的快捷键实在是太多了,原来键盘的组合键不够用了。 有了这个东西,我就可以放飞地设置了。 比如...

编者按:本文来自微信公众号 雷科技(ID:leitech),编辑:定西,创业邦经授权发布。 昨晚,AI新贵Anthropic (后文简称为 A 社)并没有发布Claude新模型,而是推出了一个看起来特别「无聊」的东西:The Anthropic Institute(Anthrop...

在生成式AI竞争加速向“实时交互”演进之际,谷歌正式推出Gemini 3.1 Flash Live模型。这一主打音频与语音实时能力的新模型,不仅强化低延迟对话体验,还进一步扩展至开发者生态,标志着Gemini体系正从“多模态理解”迈向“实时智能代理”的关键一步。 谷歌将Gemin...

作者 | 黄昱 腾讯加快推进大模型在实际场景中的落地,这一次轮到了翻译场景。 4月29日,腾讯混元推出并开源极致量化压缩版本翻译模型 Hy-MT1.5-1.8B-1.25bit,把支持 33 种语言的翻译大模型压缩至 440MB,无需联网,下载即可直接在手机本地运行。 除了模型权...

作者 | 黄昱 4月23日,腾讯正式揭开了Hy3 preview (混元3.0预览版)的神秘面纱,并开源。 Hy3 preview 是一个快慢思考融合的 MoE 语言模型,总参数 295B,激活参数 21B,最大支持 256K 上下文长度。 不难发现,Hy3 preview并没有...

微软与谷歌周四同步发布新一代AI模型,进一步加码多模态能力布局。微软推出自研MAI系列基础模型,覆盖语音转写、语音生成和图像生成,并加速融入自家产品体系;谷歌则发布Gemma 4开源模型,主打本地运行和多模态能力,并将许可切换至更开放的Apache 2.0协议。 微软推出的“世界...

近日,AMD 正式发布了名为 vLLM-ATOM 的全新插件。这款工具的核心使命是在维持现有工作流不变的前提下,显著榨取硬件潜能,为 DeepSeek-R1、Kimi-K2以及 gpt-oss-120B 等主流大语言模型的推理过程实现大幅提速。 对于开发者而言, vLLM 是一套...
在近日举办的 2026 移动云大会上,一项有望重塑智能连接格局的技术成果正式亮相。通过创新构建的 AI-eSIM多生态智能服务体系 ,移动通信领域实现了“运营商码号即大模型账号”的跨越式突破。这一体系将AI-eSIM定位为Token经济的新入口,通过流量、词元与智能体的融合运营,...

DeepSeek公司近期宣布,将在 6 月推出其 V4 模型的更新版本 V4.1,并计划加快模型发布频率,以追赶行业竞争对手。此前,DeepSeek 因技术深度受到好评,但其模型迭代速度明显滞后于其他 AI 公司,140 天内未发布任何新模型,而同期多家全球主要 AI 公司共发布...

5月11日,互联网先驱、Digg创始人Kevin Rose宣布该平台在经历多次转型后正式复活,并重新定位为人工智能驱动的新闻聚合器。此前,Digg曾尝试转型为Reddit竞争对手,但因难以应对机器人流量及产品差异化不足,于今年3月一度关闭并裁员。此次回归标志着Rose亲率团队由T...