AI 模型介绍
文章平均质量分 91
模型追踪
E的工程笔记
这个作者很懒,什么都没留下…
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Phi-4-multimodal-instruct - 轻量级多模态基础模型
一、关于 Phi-4-multimodal-instruct模型概述相关链接信息效果演示二、使用说明1、Requirements2、Tokenizer3、输入格式3.1 文本聊天格式3.2 工具启用的函数调用格式3.3 视觉语言格式3.4 语音语言格式3.5 视觉-语音格式4、本地加载模型5、vLLM 推理三、训练1、微调2、模型3、训练数据集4、软件5、硬件要求四、预期用途1、主要应用场景2、使用场景考量五、版本说明六、模型质量1、语音能力1.1 语原创 2025-05-10 07:15:00 · 2347 阅读 · 0 评论 -
black-forest-labs / FLUX.1-dev - 120亿参数文本生成图像模型
是一个120亿参数的整流流Transformers 模型,能够根据文本描述生成图像。该模型采用引导蒸馏技术训练,具有高效推理特性。生成内容可用于个人、科研和商业用途(需遵守许可证条款)伊织 xAI 2025-05-06(二)支持科研创新和艺术工作流开发。采用引导蒸馏技术优化训练。性能与闭源替代方案相当。原创 2025-05-07 07:15:00 · 2349 阅读 · 0 评论 -
F Lite - 基于版权安全内容的10B参数扩散模型
F Lite是由Freepik和Fal联合开发的10B参数扩散模型,专为生成版权安全且适合工作环境(SFW)的内容而设计。它通过SuperPrompt功能将简洁的提示扩展为更详尽的描述。该模型基于Freepik内部约8000万张版权安全图像训练而成,是首个公开可用的完全合规大规模生成模型。该模型需要至少24GB显存的显卡才能运行,尽管尚未探索量化技术的使用,但预计量化能进一步降低内存占用。F Lite 可在 ComfyUI 中使用,以获得更直观的工作流体验。有助于提升生成图像的质量。来启用自适应投影引导。原创 2025-05-09 07:15:00 · 1322 阅读 · 0 评论 -
F-Lite - 10B参数安全内容扩散模型
10B参数扩散模型,基于Freepik内部8000万张版权安全且适合工作的(SFW)图像训练,是首个公开的完全合规内容训练的大规模模型(技术报告证实)。一、关于 F-Lite基础信息模型简介二、技术说明关键特性三、使用方式部署方案四、局限性已知问题优化建议原创 2025-05-07 07:15:00 · 522 阅读 · 0 评论 -
HiDream-E1-Full - 指令驱动的图像编辑模型
HiDream-E1是基于HiDream-I1架构开发的指令驱动图像编辑模型,于2025年4月28日开源。该模型通过自然语言指令实现高质量的图像编辑功能。核心价值:“在EmuEdit和ReasonEdit基准测试中,HiDream-E1在全局编辑(5.32)、文本编辑(6.45)和风格转换(6.49)等关键指标上超越同类模型”(出自Evaluation Metrics章节)原创 2025-05-07 07:15:00 · 1286 阅读 · 0 评论 -
openai GSM8K - 逻辑与数学能力数据集
GSM8K(Grade School Math 8K)是一个包含8,500道高质量、语言多样的小学数学文字题的数据集。该数据集的创建旨在支持需要多步推理的基础数学问题问答任务。这些问题需要2到8个步骤来解决。解题过程主要涉及使用基本算术运算(+ − ×÷)进行一系列基础计算,最终得出答案。一名优秀的中学生应能解决所有题目:根据论文所述,“题目所涉及的概念不超过初级代数水平,且绝大多数问题无需显式定义变量即可求解。答案以自然语言形式提供,而非纯数学表达式。原创 2025-05-06 09:09:01 · 4836 阅读 · 0 评论 -
Qwen3-235B-A22B - 专注多模态推理与高效对话的2350亿参数MoE大模型
一、关于 Qwen3-235B-A22B基础信息Qwen3 亮点模型概览二、快速开始三、部署SGLangvLLM四、思维模式与非思维模式切换1、`enable_thinking=True`2、`enable_thinking=False`3、高级用法:通过用户输入切换思考与非思考模式五、智能体应用六、处理长文本六、最佳实践原创 2025-05-06 09:06:38 · 6071 阅读 · 0 评论 -
Qwen2.5-Omni - 端到端多模态模型
一、关于 Qwen2.5-Omni相关链接核心特性模型架构二、快速入门1、安装依赖2、🤗 Transformers 使用指南3、最低GPU显存需求4、视频URL资源使用5、批量推理三、使用技巧1、音频输出提示2、在视频中使用音频3、是否启用音频输出4、更改输出音频的语音类型5、使用 Flash-Attention 2 加速生成四、性能表现多模态转文本音频转文本图像转文本视频(无音频)转文本零样本语音生成文本到文本性能对比原创 2025-05-06 09:01:35 · 2868 阅读 · 0 评论 -
Meta Segment Anything Model 2 (SAM 2) - 跨视频与图像的通用分割模型
一、关于 Meta Segment Anything Model 2 (SAM 2)相关链接资源关键功能特性二、核心功能1、跨视频帧的对象选取与调整2、陌生场景的鲁棒分割3、实时交互体验三、技术优势1、业界领先的分割性能2、模型架构创新四、数据集与开源1、SA-V 视频分割数据集2、开放研究资源五、应用前景1、可扩展输出2、可扩展输入原创 2025-04-29 19:15:00 · 1883 阅读 · 0 评论 -
DeepCoder-14B-Preview
一、关于 DeepCoder-14B-Preview概述二、数据三、训练方法GRPO+迭代上下文长度增加四、评估五、DeepCoder 服务使用建议六、其它许可证致谢原创 2025-04-16 20:55:29 · 1390 阅读 · 0 评论 -
模型 - QwQ-32B
QwQ 是 Qwen 系列的推理模型。与传统的指令微调模型相比,QwQ 能够进行思考和推理,在下游任务中,尤其是在难题上,可以实现显著提升的性能。QwQ-32B 拥有 320 亿参数的模型,是中型推理模型。其性能可与具备 6710 亿参数(其中 370 亿被激活)的 DeepSeek-R1 媲美。原创 2025-03-06 21:29:28 · 2019 阅读 · 0 评论 -
模型 - Qwen 2.5
语言和多模态模型均在大规模、多语言、多模态数据上进行预训练,并在高质量语料上后训练以与人类偏好对齐。通义千问可以执行自然语言理解、文本生成、视觉理解、音频理解、工具调用、角色扮演、智能体等多种任务。更多信息可见 Alibaba Cloud Model Studio ()是由阿里巴巴通义千问团队开发的大规模语言和多模态系列模型。通义千问(英文: Qwen;有专有版本和开放权重版本。原创 2025-03-06 21:04:23 · 1363 阅读 · 0 评论 -
Grok - X AI 314B大模型
关于 Grok运行Model Specifications下载权重方式一:使用磁力链下载方式二:直接使用 🤗 HuggingFace Hub原创 2024-03-29 11:11:26 · 1502 阅读 · 0 评论 -
Meta Llama 3 简介
要点我们对 Llama 3 的目标最先进的性能模型架构训练数据扩大预训练规模指令微调与 Llama 3 一起建造系统级责任方法大规模部署 Llama 3Llama 3 的下一步是什么?立即尝试 Meta Llama 3原创 2024-04-19 11:08:50 · 2226 阅读 · 0 评论 -
Gemma
关于 Gemma使用 HuggingChat 体验使用示例Prompt 提示词格式使用 🤗 Transformers原创 2024-04-04 14:15:00 · 1751 阅读 · 0 评论 -
OpenAI GPT-4o - 介绍
一、关于 GPT-4o二、模型能力三、能力探索四、模型评估1、文本评价2、音频 ASR 性能3、音频翻译性能4、M3Exam 零样本结果5、视觉理解评估6、语言 tokenization六、模型安全性和局限性七、模型可用性原创 2024-05-14 11:14:29 · 1694 阅读 · 0 评论 -
OpenAI GPT-4o 使用介绍(Cookbook)
一、关于 GPT-4o背景当前 API 功能二、入门安装适用于 Python 的 OpenAI SDK配置OpenAI客户端并提交测试请求三、图像处理Base64 图像处理URL图像处理四、视频处理视频处理设置将视频处理成两个部分:帧和音频示例 1:SummaryVisual SummaryAudio SummaryAudio + Visual Summary示例2:问答五、结论原创 2024-05-14 10:37:35 · 3023 阅读 · 1 评论 -
OpenAI DALL·E 3
我们与红队成员(对模型进行压力测试的领域专家)合作,提高了风险领域的安全绩效,例如公众人物的产生以及与视觉过度/代表性不足相关的有害偏见,以帮助为我们在这些领域的风险评估和缓解工作提供信息比如宣传和错误信息。与 DALL·E 2 一样,您使用 DALL·E 3 创建的图像可供您使用,无需我们的许可即可重印、出售或销售它们。我们正在尝试来源分类器——一种新的内部工具,可以帮助我们识别图像是否是由 DALL·E 3 生成的——并希望使用该工具更好地理解生成图像的使用方式。2024-05-14(二)原创 2024-05-14 11:42:56 · 3410 阅读 · 0 评论 -
Llama3
关于 Llama3下载方式一:网站申请许可方式二:通过 Hugging Face快速开始推理预训练模型指令调整模型其他问题型号卡License问题原创 2024-04-19 11:12:07 · 1918 阅读 · 2 评论 -
OpenAI GPT-4
一、关于 GPT-4二、能力视觉输入Visual inputs: chart reasoningSample 2 of 7操纵性Steerability: Socratic tutorSample 1 of 3三、局限性四、风险与缓解措施五、训练流程可预测的扩展六、OpenAI 评估七、ChatGPT Plus八、API九、结论十、附录原创 2024-05-14 16:15:01 · 1430 阅读 · 0 评论
分享