97AI.PRO

AI日报:MiniMax发布全模态模型H3;字节跳动Seedance 2.5发布;DeepSeek-V4-Flash正式上线

· 97AI Team 编辑整理

MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一

MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一

MiniMax正式推出全模态生成模型H3,实现了文本、图像、视频和音频的统一理解与生成。该模型采用创新的H3-Omni Transformer架构,将多种任务整合于同一预训练框架中,大幅提升了端到端的训练吞吐量。H3支持原生双声道音视频输出,最长可生成15秒2K高清内容,且在2K分辨率下的推理成本不到主流竞品的三分之一。此外,MiniMax宣布将在几天内开源模型权重,旨在推动国产多模态开源生态建设并加速与国产芯片的适配。

97AI 视角97AI 聊天分类聚合 Claude/GPT/Gemini 等多家旗舰,一个 API 按次调用、无需分别开户

字节跳动 Seedance 2.5 发布:30 秒一镜到底,AI 视频开始会讲故事了

字节跳动 Seedance 2.5 发布:30 秒一镜到底,AI 视频开始会讲故事了

字节跳动发布了升级版的视频生成模型Seedance 2.5,核心亮点在于将单次生成时长提升至30秒,并具备了更强的长叙事能力。该模型支持多镜头叙事和逻辑关联的镜头组织,能够处理多轮延长请求,从而在视频中有效保持人物主体、场景、画面风格及音效的一致性。同时,模型支持输入多达30张图片、10段视频和音频素材,能精准还原多人形象与声音,让AI创作在故事化表达上迈出了重要一步。

DeepSeek-V4-Flash正式版上线,130亿激活参数撬动Agent战场

DeepSeek-V4-Flash正式版上线,130亿激活参数撬动Agent战场

DeepSeek-V4-Flash正式版API已开启公测,凭借仅130亿的激活参数展现出卓越的性能表现,在多项基准测试中逼近旗舰模型V4-Pro。该模型主打极高的性价比,特别针对Agent智能体场景进行了优化,以更低的推理成本满足复杂任务需求。为了方便开发者快速迁移应用,DeepSeek还同步推出了首个自研Agent框架DeepSeek Harness,并全面支持OpenAI的Responses API格式,大幅降低了接入与切换的技术门槛。

DeepMind发布Gemini Robotics ER 2,首次解锁多机协同

DeepMind发布Gemini Robotics ER 2,首次解锁多机协同

DeepMind发布了新一代具身推理模型Gemini Robotics ER2,在多机器人协同作业、实时决策及任务监控方面取得了重大突破。该模型赋予了机器人更强的逻辑推理与任务规划能力,使得多个独立单元能够在复杂环境中实现高效协作。这一进展标志着具身智能从单体任务执行向规模化商用迈进,通过引入多机器人协作机制,不仅提升了整体任务执行效率,也为未来自动化工厂与大规模服务场景提供了技术支撑。

谷歌将 Nano Banana2集成至 Google Earth,支持在线AI生成地理场景图像

谷歌将 Nano Banana2集成至 Google Earth,支持在线AI生成地理场景图像

谷歌正式将最新的Nano Banana2 AI图像生成模型集成进Google Earth网页版。用户在定位至特定地点后,只需通过简单的文本描述,即可基于现有的卫星影像、航空摄影及3D地理数据,在线生成高精度的自定义场景图像。该功能的应用范畴涵盖了教育普及、城市规划、建筑设计及个人创意创作等领域,为地理空间内容的可视化表达提供了全新的交互手段。

华为开源5050亿参数openPangu-2.0-Pro模型,权重与推理代码同步开放

华为开源5050亿参数openPangu-2.0-Pro模型,权重与推理代码同步开放

华为正式开源openPangu-2.0-Pro大模型,这是一个基于昇腾NPU训练的超大规模混合专家(MoE)模型,总参数规模达5050亿,支持512K上下文长度。华为同步开放了模型权重、基础推理代码及技术报告,不仅展现了其对昇腾原生生态的推进力度,也为国内开发者提供了宝贵的训练与推理最佳实践参考。该模型的训练数据规模达到34T Tokens,通过后训练阶段的多项优化,具备了处理复杂长序列任务的能力。

阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景最后一公里

阿里千问发布的Qwen-Audio-3.0-ASR-Flash在专业领域语音识别上实现了重大突破。该模型拥有长音频上下文记忆能力,能够确保在长时间会议或录音中保持术语和人名的一致性。新模型内置了针对医疗、IT编程等多个垂直行业的词库,其中医疗场景的专业词汇召回率高达95.36%。此外,它支持30余种语言的精准转写,平均语义错误率仅为17.09%,在多语言支持与专业场景应用上均优于同类国际模型。

特斯拉中国车机正式接入豆包大模型

特斯拉中国在最新的2026.14.13版本车机系统更新中,正式集成了字节跳动旗下的豆包大模型。这一举措显著提升了特斯拉车载语音助手的智能交互深度,使其能够处理更自然、复杂的自然语言指令,优化了用户的车内使用体验。不过,用户需要开通“高级车载娱乐服务”订阅才能使用此项由大模型驱动的增强AI功能,这也是特斯拉通过软件生态进一步强化智能化差异竞争的最新举措。

在 97AI 试用日报里的模型

150+ AI 模型一站接入,支持 USDC、支付宝、信用卡。生成失败不计费。

查看全部模型价格 →