AI大模型 - 前沿技术追踪
文章平均质量分 97
本专栏致力于追踪探索AI大模型领域的最新前沿技术,涵盖学术研究、行业应用、技术创新、伦理挑战等多方面内容。
寻道AI小兵
10年+互联网架构师,聚焦AI大模型开发实战,分享前沿技术,解锁AI新技能,共探智能未来!
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【AI大模型前沿】阿里通义FunCineForge开源:首个影视级多模态配音大模型,支持零样本电影配音与多场景音色迁移
FunCineForge是由阿里巴巴通义实验室(Tongyi Lab)语音团队与中国科学技术大学联合研发的开源项目,定位为端到端的影视级多模态配音系统。该项目包含两大核心组件:一是完整的数据集生产流水线,可自动化构建大规模多模态配音数据集;二是基于多模态大语言模型(MLLM)架构的配音模型,专门面向复杂影视场景设计。与传统配音流程不同,FunCineForge整合了视频理解、语音合成、时间对齐等多项能力,支持独白、旁白、双人对话、多人讨论等多样化场景。原创 2026-04-03 08:00:00 · 767 阅读 · 0 评论 -
【AI大模型前沿】Covo-Audio:腾讯开源70亿参数端到端语音大模型,GPT-4o级全双工对话能力
Covo-Audio是腾讯开源的70亿参数端到端音频语言模型(LALM),基于Qwen2.5-7B和Whisper-large-v3构建,通过统一架构直接处理连续音频输入并生成音频输出。模型采用分层三模态语音-文本交错架构、智能与说话人解耦技术,以及原生全双工交互能力,在口语对话、语音理解、音频理解等任务中达到同规模模型领先或竞争优势。作为完全开源的GPT-4o语音能力替代方案,Covo-Audio为中文语音AI提供了自主可控的基座模型。原创 2026-04-02 08:00:00 · 950 阅读 · 0 评论 -
【AI大模型前沿】FireRed-OCR:小红书开源的2B参数文档结构解析专家,以小模型大能力登顶OmniDocBench SOTA
**FireRed-OCR**是小红书团队开源的端到端文档结构解析视觉语言模型,基于Qwen3-VL-2B-Instruct架构构建,采用创新的"三阶段渐进优化"训练策略与"几何+语义"数据工厂,专为攻克文档解析中的"结构幻觉"问题而设计。该模型能够将PDF、扫描图像、学术论文、财务报告等复杂版式文档精准转换为标准Markdown格式,支持复杂表格提取、数学公式语义化解析、多级标题层级重建等核心能力。作为工业级OCR结构化专家,FireRed-OCR不仅实现了端到端方案的新SOTA(State-of-the原创 2026-04-01 08:00:00 · 1124 阅读 · 0 评论 -
【AI大模型前沿】微软Phi-4-reasoning-vision-15B:150亿参数多模态推理模型的效率革命与训练实践
**Phi-4-reasoning-vision-15B**是微软研究院推出的开源多模态推理模型,基于Phi-4-Reasoning语言模型骨干,融合SigLIP-2视觉编码器,采用中期融合(Mid-Fusion)架构,在保持150亿参数紧凑体量的同时,实现了数学科学推理、GUI界面理解、图文问答等多维能力的均衡突破。该模型通过严格的数据筛选、动态分辨率处理与混合推理训练策略,在计算效率与推理精度之间达成帕累托最优,为资源受限场景下的多模态应用提供了高性价比解决方案。原创 2026-03-31 08:00:00 · 599 阅读 · 0 评论 -
【AI大模型前沿】Ming-omni-tts:蚂蚁集团开源的统一音频生成大模型,支持语音/音乐/音效联合合成与细粒度情感控制
Ming-omni-tts是蚂蚁集团inclusionAI团队推出的开源统一音频生成模型,采用自回归架构实现语音、音乐和音效的联合生成。该模型支持通过自然语言指令对语速、音调、音量、情感和方言进行细粒度控制,粤语方言控制准确率高达93%,情感控制准确率达46.7%,超越CosyVoice3等主流模型。技术上采用统一连续音频Tokenizer和Diffusion Transformer架构,以12.5Hz帧率处理多模态音频,通过"Patch-by-Patch"压缩策略将LLM推理帧率降至3.1Hz,在降低延迟原创 2026-03-27 08:00:00 · 1599 阅读 · 0 评论 -
【AI大模型前沿】Step3-VL-10B:阶跃星辰开源10B参数多模态大模型,以小博大实现SOTA性能,支持PaCoRe并行推理
Step3-VL-10B 是由阶跃星辰(StepFun)于 2025 年 1 月开源的紧凑型多模态基础模型,采用 1.8B 参数的视觉编码器(PE-lang)与 Qwen3-8B 语言解码器的组合架构,总参数量仅 10B。该模型通过 1.2T tokens 的高质量多模态语料统一预训练,结合超过 1400 次迭代的规模化强化学习(RLVR+RLHF),在 STEM 推理、OCR、GUI Grounding、空间理解等 40 余项基准测试中全面领先 7-10B 规模模型,并在 AIME 2025、MathVi原创 2026-03-26 08:00:00 · 806 阅读 · 0 评论 -
【AI大模型前沿】AgentCPM-Explore:清华面壁开源4B端侧智能体,以小博大实现百轮深度搜索与长程推理
AgentCPM-Explore是面向深度研究场景的专业化LLM Agent,基于Qwen3-4B-Thinking基座模型进行专门强化学习训练,通过AgentRL框架实现工具调用与长程规划能力的高效注入。其核心突破在于:以仅40亿的参数规模,支持超过100轮的连续环境交互与多源信息交叉验证,在GAIA基准上从基础模型的25.24%跃升至63.90%,不仅刷新同尺寸模型性能天花板,更越级挑战并比肩部分30B级以上模型与闭源商业系统,为端侧私有化部署、高隐私场景下的自主研究智能体树立了新范式。原创 2026-03-25 08:00:00 · 759 阅读 · 0 评论 -
【AI大模型前沿】微软VibeVoice-ASR技术解析:支持60分钟长音频端到端识别的开源语音识别新标杆
**VibeVoice-ASR是微软开源的90亿参数统一语音识别模型**,基于Qwen2 Decoder架构,采用64K token超长上下文窗口与7.5 Hz超低帧率语音分词技术,实现了ASR(自动语音识别)、说话人分离(Diarization)和时间戳标注(Timestamping)三大任务的端到端联合建模。该模型支持中英双语,可单次处理长达60分钟的连续音频,输出"Who-When-What"结构化转录结果,并通过自定义热词功能适配医疗、法律等专业领域,采用MIT协议开源,支持免费商用与二次开发。原创 2026-03-24 08:00:00 · 971 阅读 · 0 评论 -
【AI大模型前沿】FlashLabs Chroma 1.0 技术深度解析:全球首个开源实时端到端语音对话模型
FlashLabs Chroma 1.0 是一款基于40亿参数的多模态因果语言模型,采用原生语音到语音(Speech-to-Speech)架构,彻底摒弃了传统语音交互系统的多模块串联模式。该模型通过离散语音表征直接处理音频输入,在单一架构内完成语音理解、语义推理与语音生成,实现了端到端延迟低于150毫秒(SGLang优化后可达135毫秒),实时因子(RTF)达0.43,说话人相似度(SIM)得分0.817,较人类基线提升10.96%。作为Apache 2.0协议开源的项目,Chroma 1.0为开发者提供了原创 2026-03-23 08:00:00 · 585 阅读 · 0 评论 -
【AI大模型前沿】Google MedGemma 1.5技术解析:开源多模态医疗AI从2D影像到3D CT/MRI的跨越式进化
MedGemma 1.5是Google基于Gemma 3架构开发的开源医疗多模态大语言模型,采用40亿参数(4B)的轻量化设计,支持文本、2D图像、3D容积影像(CT/MRI)、全切片病理图像(WSI)及纵向时序影像的多模态理解与推理。该模型在继承前代 dermatology、眼底摄影等2D影像分析能力的基础上,突破性地实现了高维医学影像的端到端处理,在CT疾病分类准确率提升至61%、MRI分类准确率跃升至65%(较1.0版本提升14%)原创 2026-03-22 08:00:00 · 867 阅读 · 0 评论 -
【AI大模型前沿】Baichuan-M3-235B:国产开源医疗大模型登顶全球榜单,2350亿参数重构AI临床决策新标准
Baichuan-M3-235B是百川智能推出的新一代医疗增强大语言模型,采用2350亿参数Dense架构(非MoE),以"临床决策过程建模"为核心训练目标。区别于传统医疗AI的静态问答模式,M3创新性提出"主动问诊-深度推理-可靠决策"的端到端能力闭环,通过Fact-Aware强化学习框架与分段流水线训练策略,在无外部工具辅助下实现行业最低的幻觉率,成为目前全球唯一在SCAN-bench临床全流程评测中夺冠的开源医疗模型。原创 2026-03-21 08:00:00 · 953 阅读 · 0 评论 -
【AI大模型前沿】智谱AI开源GLM-Image:自回归+扩散双引擎驱动的多模态图像生成新范式
GLM-Image是由智谱AI研发并开源的图像生成基础模型,采用"自回归生成器+扩散解码器"的混合架构设计。该模型以GLM-4-9B-0414为初始化基础构建90亿参数的自回归模块,配合70亿参数的扩散解码器,总计160亿参数规模。GLM-Image不仅在一般图像生成质量上对标主流潜在扩散模型,更在复杂文本渲染、知识密集型内容生成、多主体一致性保持等场景下展现出显著优势,同时支持文生图、图像编辑、风格迁移、身份保持生成等丰富的图像到图像任务。原创 2026-03-20 08:00:00 · 816 阅读 · 0 评论 -
【AI大模型前沿】Qwen3-VL-Embedding:阿里通义开源的多模态信息检索模型,助力高效跨模态理解与检索
Qwen3-VL-Embedding是阿里通义基于Qwen3-VL架构开发的多模态信息检索模型,专为处理文本、图像、可视化文档和视频等多种模态输入而设计。该模型能够将不同模态的数据映射到统一的语义空间,生成语义丰富的高维向量,广泛应用于图文检索、视频内容检索、视觉问答等任务。原创 2026-03-19 08:00:00 · 637 阅读 · 0 评论 -
【AI大模型前沿】千寻智能Spirit-v1.5:开启具身智能新纪元,助力机器人迈向真实世界
Spirit-v1.5是由千寻智能团队开发的一款具身智能模型,采用Vision-Language-Action(VLA)统一建模框架,将视觉感知、语言理解与动作生成整合在同一决策流程中。该模型在多任务连续执行、复杂指令拆解以及跨构型迁移等维度表现出色,尤其在真实机器人任务中展现出强大的泛化能力和稳定性。原创 2026-03-18 08:00:00 · 879 阅读 · 0 评论 -
【AI大模型前沿】NVIDIA Nemotron Speech ASR:低延迟实时语音识别的开源利器
Nemotron Speech ASR是一个开源的低延迟实时语音识别模型,专为英语流式转录设计。它采用缓存感知的FastConformer编码器和RNNT解码器,能够处理16kHz单声道音频,输入块至少为80毫秒。该模型支持多种推理时间块配置,可在不重新训练的情况下灵活调整延迟与准确性之间的平衡,适用于语音助手、实时翻译、会议记录等多种场景。原创 2026-03-17 08:00:00 · 661 阅读 · 0 评论 -
【AI大模型前沿】VoiceSculptor:基于LLaSA与CosyVoice2的指令化语音合成利器
VoiceSculptor是由西北工业大学联合多家机构开源的音色设计模型,基于LLaSA-3B和CosyVoice2开发,专注于通过自然语言指令生成多样化音色的语音合成。它支持对语速、音量、基频等属性的细粒度控制,引入了类似CoT的推理机制,通过属性Token和自然语言指令联合训练,显著提升了模型对指令的理解和执行能力。原创 2026-03-16 08:00:00 · 611 阅读 · 0 评论 -
【AI大模型前沿】Qwen3-VL-Reranker:阿里通义开源的跨模态重排序模型
Qwen3-VL-Reranker是基于Qwen3-VL构建的跨模态理解模型,用于多模态信息检索中的重排序阶段。它接收任意模态组合的查询与文档对,通过单塔架构和交叉注意力机制,深度分析语义关联,输出精确的相关性分数,显著提升检索结果的精度。原创 2026-03-15 08:00:00 · 684 阅读 · 0 评论 -
【AI大模型前沿】MiroThinker v1.5:开源搜索智能体的革命性突破,重新定义AI交互
MiroThinker v1.5 是一个开源的搜索智能体模型,旨在通过工具增强推理和真实世界的信息检索,提升复杂研究任务的处理能力。该模型通过交互式扩展技术,将推理与外部环境深度耦合,支持长时序推理和多步分析,同时具备多语言支持和轻量级高性能的特点。原创 2026-03-14 08:00:00 · 787 阅读 · 0 评论 -
【AI大模型前沿】腾讯 Youtu-LLM:轻量级语言模型的高性能突破
Youtu-LLM 是腾讯 Youtu 团队开源的轻量级语言模型,参数规模为 19.6 亿。它专为智能体任务设计,具备强大的“原生智能体能力”,在多项任务中超越同规模甚至更大模型。模型采用紧凑架构和 128K 长上下文窗口,支持长程任务处理,并针对 STEM 领域优化词表,提升推理效率。原创 2026-03-13 08:00:00 · 674 阅读 · 0 评论 -
【AI大模型前沿】星辰语义大模型TeleChat3:国产千亿MoE大模型的创新与应用
TeleChat3是中国电信人工智能研究院自主研发的千亿参数细粒度MoE语义大模型,完全基于国产算力训练,支持多轮对话、文本创作、代码生成等任务。该系列模型包括TeleChat3-105B-A4.7B-Thinking和TeleChat3-36B-Thinking,均引入了“思考模式”,在知识问答、数学推理、代码生成等六大核心维度性能比肩国际主流头部模型。原创 2026-03-12 08:00:00 · 869 阅读 · 1 评论 -
【AI大模型前沿】XVERSE-Ent:元象开源的泛娱乐中英双语底座大模型
XVERSE-Ent是元象科技开源的专为泛娱乐领域设计的中英双语底座大模型,包含中文模型XVERSE-Ent-A4.2B和英文模型XVERSE-Ent-A5.7B。该模型在角色一致性、长剧情理解和多元语境适配上表现出色,能够长期保持虚拟角色的人设和风格,精准把握复杂故事线,并根据不同题材提供风格化表达。原创 2026-03-11 08:00:00 · 842 阅读 · 5 评论 -
【AI大模型前沿】Fun-Audio-Chat:阿里巴巴开源的高效语音交互大模型
Fun-Audio-Chat 是一款专注于自然、低延迟语音交互的大型音频语言模型。它通过引入双分辨率语音表征(5Hz 的高效共享主干 + 25Hz 的精细头部)大幅降低计算成本,同时保持高质量语音输出,并采用 Core-Cocktail 训练策略保留强大的文本语言模型能力。该模型在口语问答、音频理解、语音功能调用、语音指令跟随和语音共情等多个基准测试中均取得了顶尖成绩。原创 2026-03-10 09:50:49 · 763 阅读 · 1 评论 -
【AI大模型前沿】MedASR:谷歌开源的高精度医疗语音识别模型
MedASR 是一款基于 Conformer 架构的医疗语音识别模型,拥有 105M 参数,经过约 5000 小时的医学语音数据预训练,涵盖放射学、内科、全科等多种医学专业领域的语音内容。它能够精准识别复杂医学术语和专业上下文,为开发者提供可定制化的基础模型,适用于医学口述转录、临床对话记录、多模态医疗应用开发等多种场景。原创 2026-02-20 08:00:00 · 2156 阅读 · 1 评论 -
MAI-UI:阿里通义开源的全尺寸GUI智能体基座模型,开启下一代人机交互新纪元
MAI-UI是一个覆盖从2B到235B-A22B全尺寸的GUI智能体基座模型家族,具备用户交互、工具调用和端云协同三大核心能力。它通过自主进化数据管线和大规模在线强化学习技术,实现了模型在复杂场景中的持续进化,适用于多种真实世界的应用场景。原创 2026-02-19 08:00:00 · 992 阅读 · 0 评论 -
【AI大模型前沿】Qwen-Doc:阿里通义千问的长文本理解与推理技术解析
Qwen-Doc 是一个基于 Qwen3-30B-A3B 架构的长文本推理模型,通过系统化的后训练方案,显著提升长文本推理能力。该项目的核心目标是解决传统模型在长文本任务中的不足,如训练不稳定、上下文窗口有限等问题,并在多个长文本推理基准测试中表现出色,性能接近甚至超越顶尖模型。原创 2026-02-18 08:00:00 · 1159 阅读 · 0 评论 -
【AI大模型前沿】Step-DeepResearch:高效低成本的端到端深度研究 Agent 模型
Step-DeepResearch 是由 StepFun 团队精心打造的一款面向开放式深度研究任务的高效、低成本的端到端深度研究 Agent 模型。它通过将复杂的研究任务巧妙地分解为可训练的原子能力,包括规划、信息检索、反思和交叉验证以及专业报告生成等,并在模型层面实现深度内化,从而确保在单次推理过程中能够实现闭环反思和动态校正。这种独特的设计使得 Step-DeepResearch 在处理复杂的长序列任务时表现出色,能够生成高质量的研究报告,同时在成本控制方面也展现出了巨大的优势。原创 2026-02-17 08:00:00 · 1586 阅读 · 0 评论 -
【AI大模型前沿】Yume1.5:交互式世界生成模型的革新与实践
Yume1.5 是一个交互式世界生成模型,能够从单张图像或文本提示生成逼真、连续且可探索的虚拟世界。它通过联合时空通道建模(TSCM)和实时加速策略,解决了现有模型在通用性、延迟和文本控制能力方面的不足。Yume1.5 支持文本到世界、图像到世界及基于文本的事件编辑三种模式,用户可通过键盘控制人物和摄像机移动,实现沉浸式体验。原创 2026-02-16 08:00:00 · 1155 阅读 · 0 评论 -
【AI大模型前沿】Tencent-HY-MT1.5:腾讯混元开源的多语言翻译模型
Tencent-HY-MT1.5是腾讯混元开源的翻译模型,包含两个版本:Tencent-HY-MT1.5-1.8B和Tencent-HY-MT1.5-7B。该模型支持33种国际语言互译及5种民汉/方言翻译,覆盖多种小语种。1.8B版本经过量化处理,仅需1GB内存即可在手机等消费级设备上实现端侧离线实时翻译,处理速度快;7B版本面向高性能场景,翻译准确率高,有效减少译文中夹带注释和语种混杂的情况。原创 2026-02-15 08:00:00 · 1899 阅读 · 0 评论 -
【AI大模型前沿】谷歌FunctionGemma:轻量化函数调用AI模型的创新与实践
FunctionGemma是谷歌开源的一款专注于函数调用优化的轻量化AI模型,参数量为2.7亿。它基于Gemma 3架构设计,专为在手机、浏览器等端侧设备上高效运行而优化。该模型能够将自然语言指令准确转化为结构化的API函数调用,支持多步骤任务执行和离线运行,广泛应用于手机语音助手、智能家居控制、游戏交互等场景。原创 2026-02-14 08:00:00 · 1491 阅读 · 0 评论 -
【AI大模型前沿】Qwen-Image-Layered:基于分层技术的图像编辑新突破
Qwen-Image-Layered 是由 Qwen 团队开发的一种先进的 AI 图像编辑模型,能够将普通的 RGB 图像自动分解为多个语义分离的 RGBA 图层,解锁了图像的固有可编辑性。每个图层都可以独立操作,而不会影响其他内容,从而实现了真正一致的图像编辑。该模型不仅支持可变数量的图层分解,还具备递归分解能力,能够满足不同场景下的多样化编辑需求。原创 2026-02-13 08:00:00 · 1273 阅读 · 0 评论 -
【AI大模型前沿】T5Gemma 2:谷歌开源的下一代紧凑型多模态长上下文编解码模型
T5Gemma 2 是基于 Gemma 3 架构的下一代编码器 - 解码器模型,首次引入了多模态与长上下文支持。相比前代,它采用共享词嵌入及合并解码器自注意力与交叉注意力机制,有效减少参数量,提供 270M - 270M(约 3.7 亿)、1B - 1B(约 17 亿)和 4B - 4B(约 70 亿)三种规模的紧凑预训练模型,适用于快速实验与终端设备部署。原创 2026-02-11 08:00:00 · 1123 阅读 · 0 评论 -
【AI大模型前沿】TRELLIS.2:微软开源的40亿参数图像转3D生成模型
TRELLIS.2是一个由微软开发的开源图像转3D生成模型,拥有40亿参数。它能够将单张图片高效地转换为高保真的3D资产,支持从512³到1536³的多分辨率输出。该模型的核心创新在于其“场无关”的O-Voxel表示法,能够稳健地处理复杂拓扑结构,如开放表面、非流形几何和内部封闭结构。此外,TRELLIS.2还支持完整的PBR材质建模,生成的3D模型具有丰富的纹理细节和逼真的材质效果。原创 2026-02-10 08:00:00 · 2249 阅读 · 0 评论 -
【AI大模型前沿】Meta SAM Audio:革新音频分离技术,开启多模态音频处理新时代
SAM Audio是Meta公司开发的首个统一多模态音频分离模型。它能够通过文本、视觉或时间跨度提示,从复杂的音频混合中分离出任何特定声音。无论是从乐队演奏中提取吉他声,还是从户外视频中过滤掉交通噪音,SAM Audio都能轻松应对。其核心是感知编码器视听(PE-AV)技术,基于大规模多模态对比学习训练而成,为音频处理带来了前所未有的灵活性和高效性。原创 2026-02-09 08:00:00 · 1245 阅读 · 0 评论 -
【AI大模型前沿】Molmo 2:艾伦人工智能研究所开源的多模态视频理解模型
Molmo 2是由艾伦人工智能研究所开发的一款开源多模态视频分析模型,专注于视频的理解、解析与追踪功能。该模型基于Qwen 3和Olmo架构构建,具备卓越的视频分析性能,能够精确识别视频中的关键事件,在多目标追踪方面表现出色,并可自动生成详细字幕记录。作为一款先进的AI模型,Molmo 2在视频追踪和问答任务等核心指标上已超越包括Gemini 3在内的多个开源及商业模型。其高效的推理能力使其成为研究者与教育工作者的理想选择。原创 2026-02-01 08:00:00 · 1270 阅读 · 0 评论 -
【AI大模型前沿】小米MiMo-V2-Flash:高效推理与智能体任务优化的开源大模型
MiMo-V2-Flash是由小米公司开源的高性能语言模型,专为智能体AI设计,具备3090亿总参数和150亿激活参数。该模型采用混合注意力架构和轻量级多Token预测技术,显著提升了推理效率,同时在长文本处理、代码生成、多语言支持等方面表现出色。它通过大规模智能体强化学习和多教师在线策略蒸馏优化,专为复杂推理和多轮对话任务设计,支持长达256K的上下文长度,推理成本仅为标杆闭源模型的2.5%,生成速度提升2倍,广泛适用于智能体任务、长文本处理、代码生成和多语言应用等多种场景。原创 2026-01-31 08:00:00 · 1481 阅读 · 0 评论 -
【AI大模型前沿】LLaDA2.0:蚂蚁集团开源的100B扩散语言模型,高效推理与卓越性能
LLaDA2.0是由蚂蚁集团开源的离散扩散大语言模型,包含16B(mini)和100B(flash)两个版本,是目前规模最大的扩散语言模型。它通过创新的Warmup-Stable-Decay(WSD)持续预训练策略,实现了从自回归模型到扩散模型的平滑过渡,继承了自回归模型的知识,避免了从头训练的高昂成本。LLaDA2.0在代码生成、数学推理、智能体任务等结构化生成任务中展现出显著优势,同时在其他领域与开源自回归模型持平。其模型权重及相关训练代码已在Hugging Face完全开源,方便开发者使用和进一步研究原创 2026-01-30 08:00:00 · 815 阅读 · 0 评论 -
【AI大模型前沿】NVIDIA Nemotron 3:多智能体 AI 的高效推理引擎,开启智能协作新时代
NVIDIA Nemotron 3 是一个开源的多智能体 AI 模型系列,包括 Nano、Super 和 Ultra 三种尺寸。该系列模型采用独特的混合专家混合(MoE)架构,融合了 Mamba2 和 Transformer 的优势,专为构建高效、准确的多智能体 AI 应用设计。Nemotron 3 Nano 拥有 300 亿参数,通过优化推理成本,实现高达 4 倍于前代的吞吐量,适合软件调试、内容总结等任务。Super 和 Ultra 分别具备 1000 亿和 5000 亿参数,用于复杂推理和多智能体协作原创 2026-01-29 08:00:00 · 962 阅读 · 0 评论 -
【AI大模型前沿】LongCat-Image:美团开源的高效图像生成与编辑模型
LongCat-Image是由美团开源的高性能图像生成与编辑模型,仅用6B参数在文生图和图像编辑上达到开源顶尖水平。该模型采用创新架构和训练策略,支持高质量中文文字渲染,覆盖8105个汉字,适用于海报、广告等设计场景。它通过多任务学习和对抗训练,提升图像真实感与纹理细节,为开发者提供从预训练到微调的完整工具链,助力低门槛探索视觉生成的更多可能。原创 2026-01-28 08:00:00 · 2322 阅读 · 0 评论 -
【AI大模型前沿】NewBie-image-Exp0.1:NewBieAI实验室打造的高效动漫图像生成模型
NewBie-image-Exp0.1 是由 NewBieAI 实验室开源的一款专注于高质量动漫图像生成的实验性模型。基于先进的 Next-DiT 架构,该模型拥有 3.5B 参数量,通过使用 full dan + 1m e621 数据集进行预训练,能够生成细节丰富且视觉效果显著的动漫风格图像。它采用双文本编码器(Google/Gemma3-4b-it 和 Jina Ai/Jina Clip v2)以及 Flux 1 Dev-VAE,不仅提升了对复杂文本描述的理解能力,还优化了图像的生成质量。NewBie-原创 2026-01-27 08:00:00 · 1639 阅读 · 0 评论 -
【AI大模型前沿】Mistral 3:欧洲开源力量的AI力作,多模态与高性能的完美融合
Mistral 3是Mistral AI推出的新一代开源AI模型系列,包括小型的Ministral 3(3B、8B、14B参数)和大型的Mistral Large 3(675B总参数,41B激活参数)。该系列模型支持多模态(文本和图像)与多语言功能,具有高性能和高性价比,在多种硬件上可高效运行,适用于边缘计算、企业级部署等多种场景。原创 2026-01-26 08:00:00 · 1655 阅读 · 0 评论
分享