<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[haleycat的博客]]></title><description><![CDATA[关注机器学习，人工智能]]></description><link>https://blog.csdn.net/weixin_40425640</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; weixin_40425640]]></copyright><item><title><![CDATA[Gemini 2.0刚发布多模态模式马上开源；自动生成模仿X上用户的AI对话机器人；独立艺术生成设备PaperPiAI]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144441846</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144441846</guid><author>weixin_40425640</author><pubDate>Fri, 13 Dec 2024 09:23:25 +0800</pubDate><description><![CDATA[该项目是使用Pipecat Web SDK和Gemini Multimodal Live API构建的聊天应用程序入门套件，支持多种聊天模式。Gemini Multimodal Live API结合Pipecat Web SDK，提供了一种构建实时聊天应用的完整解决方案。此工具包支持多种聊天模式，包括临时的WebSocket语音模式、文本和图像的HTTP聊天模式，以及基于WebRTC的语音、摄像头和屏幕共享聊天模式。此外，它还支持将对话记录存储在SQLite数据库中，以便持久化使用。]]></description><category></category></item><item><title><![CDATA[多语言高质量预训练数据集FineWeb2；谷歌推出量子计算免费课程；meta发布连续与离散流匹配算法]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144389961</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144389961</guid><author>weixin_40425640</author><pubDate>Wed, 11 Dec 2024 09:24:01 +0800</pubDate><description><![CDATA[它允许用户上传和分析本地的PDF文件，提取精确的信息，并基于文档中的高保真引用使用生成式AI生成答案，同时还可以查询外部知识数据库，如OpenAlex的2.5亿多文档。该应用程序的核心是pleias-Pico（350M），这是Pleias自有AI基础模型系列的成员，专为RAG任务优化，符合欧洲AI法案，并且完全开源（包括权重、语料和代码）。该库的详细信息和代码示例可以在其。该应用程序特别设计为在没有GPU的情况下本地高效运行，适用于普通的笔记本电脑或台式机，使用的是性能卓越、轻量化的模型。]]></description><category></category></item><item><title><![CDATA[OpenAI Canvas功能正式向所有ChatGPT用户开放]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144389440</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144389440</guid><author>weixin_40425640</author><pubDate>Wed, 11 Dec 2024 08:50:29 +0800</pubDate><description><![CDATA[OpenAI于12月11日宣布，Canvas功能现已向所有ChatGPT用户开放，旨在提升写作和编码项目的效率。用户可以在网页版以及Windows 10和11版本中使用该功能，未来还将推出Mac和移动平台版本。Canvas允许用户处理编辑和修改工作，提供丰富快捷键、Python代码执行及错误修复建议，同时支持定制GPT和评论功能，增强人机协作。首席执行官山姆·阿尔特曼表示，Canvas将使作品更具风格。]]></description><category></category></item><item><title><![CDATA[视频代理框架Director动处理复杂的视频任务；使用 PyAutoGUI 库高效精确地执行用户系统操作；Day 3 OpenAI 布了 Sora]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144363392</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144363392</guid><author>weixin_40425640</author><pubDate>Tue, 10 Dec 2024 09:19:48 +0800</pubDate><description><![CDATA[该课程涵盖了推荐系统的四个阶段架构、双塔模型的实现与训练、可扩展的机器学习系统设计原则、MLOps最佳实践、实时模型部署和基于大语言模型（LLM）的推荐增强等内容。是一个用于构建视频代理的框架，旨在处理复杂的视频任务，如搜索、编辑、编译和生成等，并能够即时流式传输结果。通过简单的命令，可以实现复杂的视频操作，大幅提升视频处理的效率和创意表达能力。：该服务通过 Plus 订阅提供基本功能，用户还可以选择 Pro 订阅，享受高达 10 倍的使用量和更高的分辨率，满足专业用户的需求。]]></description><category></category></item><item><title><![CDATA[Meta发布Llama 3.3 AI大模型]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144337338</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144337338</guid><author>weixin_40425640</author><pubDate>Mon, 09 Dec 2024 08:45:44 +0800</pubDate><description><![CDATA[Meta于12月6日发布了其最新的AI大模型Llama 3.3，该模型拥有700亿参数，但在性能上可媲美4050亿参数的Llama 3.1，具有更高的效率和更低的成本。Llama 3.3优化了多语言支持，支持8种语言，采用自回归模型架构，结合监督式微调和基于人类反馈的强化学习。模型具备128K的上下文长度和多个工具集成支持，并加强了安全防护措施，降低滥用风险。]]></description><category></category></item><item><title><![CDATA[OpenAI发布完整版o1模型及ChatGPT Pro订阅]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144281346</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144281346</guid><author>weixin_40425640</author><pubDate>Fri, 06 Dec 2024 09:12:51 +0800</pubDate><description><![CDATA[OpenAI于12月6日启动为期12天的新品发布周期，首次推出完整版o1模型，并推出月费200美元的ChatGPT Pro订阅。该服务允许无限使用o1、GPT-4o及Advanced Voice等功能，同时提供独家o1 Pro版本，旨在为复杂问题提供更优解答。常规的20美元Plus套餐仍然可用，包含新功能抢先体验和更强大的模型访问。]]></description><category></category></item><item><title><![CDATA[亚马逊推出的新一代基础模型Nova；AIMedia帮助用户自动抓取热点新闻、生成新闻内容，并自动发布到各大平台]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144256696</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144256696</guid><author>weixin_40425640</author><pubDate>Thu, 05 Dec 2024 09:44:38 +0800</pubDate><description><![CDATA[TinyFusion是一种可学习的深度剪枝方法，旨在优化扩散变换器（Diffusion Transformers）的结构，以提高模型的效率和性能。该方法通过结合多种优化策略，确保模型在剪枝后能够保留有效的信息，并在后续的调优过程中表现出较好的效果。此外，对于无图的纯文本内容，AIMedia 还可以使用 AI 生成相应的图片，以提高内容的原创性和阅读体验。由于内存使用受到分辨率和帧数的影响，即使是在24GB内存上也不能处理很高分辨率的视频，但好消息是即使在低分辨率下，模型也可以生成功能性的视频。]]></description><category></category></item><item><title><![CDATA[OpenAI CEO宣布12场直播发布新产品]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144255831</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144255831</guid><author>weixin_40425640</author><pubDate>Thu, 05 Dec 2024 09:14:46 +0800</pubDate><description><![CDATA[OpenAI CEO阿尔特曼宣布将于每个工作日进行一场直播，共计12场，内容将涉及新产品发布和演示。其中，新款文本转视频工具Sora备受期待，有望在2024年底前发布。Sora曾在测试阶段引发争议，部分艺术家因抗议“无偿劳动”泄露该模型。OpenAI在数据来源方面饱受批评，尚未确认Sora是否使用公共YouTube视频进行训练。目前，谷歌也推出了文本转视频模型Veo，正进行私人预览。]]></description><category></category></item><item><title><![CDATA[腾讯混元大模型上线，开源文生视频能力]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144228871</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144228871</guid><author>weixin_40425640</author><pubDate>Wed, 04 Dec 2024 08:45:00 +0800</pubDate><description><![CDATA[腾讯于12月3日宣布混元大模型正式上线，并开源其文生视频生成能力，支持中英文输入，参数量达130亿。该模型可生成超写实的高质量视频，拥有良好的光影反射效果。腾讯采用DiT架构，提升语义理解，支持更细致的描绘。目前，开发者可通过“腾讯元宝 App”申请试用，开源内容包含模型权重和推理代码，便于开发生态插件。]]></description><category></category></item><item><title><![CDATA[ChatGPT两周年：变革与挑战并存；马斯克指控OpenAI及微软反竞争行为]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144179011</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144179011</guid><author>weixin_40425640</author><pubDate>Mon, 02 Dec 2024 08:45:38 +0800</pubDate><description><![CDATA[ChatGPT自推出以来，已吸引2.5亿活跃用户，并助推全球科技公司总市值增长8万亿美元。OpenAI在两周年之际，正寻求新一轮融资，以支持每年高达50亿美元的支出。与此同时，马斯克对OpenAI提起诉讼，指控其不当竞争和转变盈利性质，要求法院颁发禁令。OpenAI计划在2025年推出新智能体，目标是10亿用户，但面临激烈市场竞争和成本上升等挑战。]]></description><category></category></item><item><title><![CDATA[阿里发布QwQ-32B-Preview模型，推理能力强劲；月之暗面Kimi与清华大学发布Mooncake开源项目]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144126506</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144126506</guid><author>weixin_40425640</author><pubDate>Fri, 29 Nov 2024 08:51:06 +0800</pubDate><description><![CDATA[摘要：AI模型企业Anthropic近日为其Claude聊天机器人推出“自定义样式”功能，用户可以根据具体场景调整文本生成风格。Claude现在提供“正式”、“简洁”和“解释性说明”三种预设样式，并允许用户上传自己的写作示例以进一步定制。GitLab极狐的AI技术产品主管表示，这一功能使得团队在多种场合下都能有效使用Claude，提升了文档撰写和项目管理的效率。]]></description><category></category></item><item><title><![CDATA[是宣传还是事故OpenAI Sora泄露API；完全开放语言模型OLMo 2；anthropic开放MCP旨在连接万物]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144102580</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144102580</guid><author>weixin_40425640</author><pubDate>Thu, 28 Nov 2024 09:33:59 +0800</pubDate><description><![CDATA[随着人工智能助手的广泛应用，行业对模型能力的投资不断增加，尽管取得了快速的推理和质量进步，但最复杂的模型仍然受限于与数据的隔离。OLMo 2 的开发聚焦于提高模型训练的稳定性和效率，通过引入阶段性训练、改进的后训练方法，以及明确的评价框架，来推动模型性能的提升。此外，OLMo 2 的预训练过程经历了两个阶段，第一阶段使用广泛的多样化数据集，第二阶段结合高质量领域特定的数据集，以确保模型在各种任务上的广泛适应性。OLMo 2是迄今为止最优秀的完全开放语言模型，推动了开放语言模型的发展。]]></description><category></category></item><item><title><![CDATA[微软准备开源LazyGraphRAG大大提升信息检索与生成的效果；浏览和管理 Cursor 编辑器的 AI 聊天记录，支持搜索和导出]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144073722</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144073722</guid><author>weixin_40425640</author><pubDate>Wed, 27 Nov 2024 09:12:44 +0800</pubDate><description><![CDATA[它主要用于简化和增强模型的生成能力，通过最小的设计实现了广泛的控制功能，支持基于主体和空间的控制（例如边缘引导和图像填充生成）。是一个智能且低延迟的语音到语音对话模型。地址：https://www.microsoft.com/en-us/research/blog/lazygraphrag-setting-a-new-standard-for-quality-and-cost/LazyGraphRAG代表了一种新的思路，通过有效地利用图结构和灵活的数据加载机制，提升了信息检索与生成的效果。]]></description><category></category></item><item><title><![CDATA[Anthropic发布AI模型统一协议]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144073265</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144073265</guid><author>weixin_40425640</author><pubDate>Wed, 27 Nov 2024 08:46:34 +0800</pubDate><description><![CDATA[Claude AI开发商Anthropic于11月25日推出开源协议Model Context Protocol，旨在为各类AI工具与模型数据库提供标准化对接接口。该协议允许AI工具通过单一协议访问多种数据源，提升模型响应速度与生成质量。Anthropic指出，现有数据隔离问题限制了模型性能，每新增数据源往往需定制集成方案。该协议包括规范、SDK及开源代码库，已被Block、Apollo等公司应用，方便开发者快速对接。]]></description><category></category></item><item><title><![CDATA[模仿OpenAI o1使用思维链开源项目Marco-o1；本地AI邮件自动化系统；蚂蚁集团开源一款先进的人类动画生成模型]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144019331</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144019331</guid><author>weixin_40425640</author><pubDate>Mon, 25 Nov 2024 09:44:06 +0800</pubDate><description><![CDATA[LAMBDA（Local Auto MailBox Draft Assistant）是一个本地化的 AI 邮件自动化系统，旨在从用户的邮件风格中学习，并为 Gmail 收件箱中的每一封未读邮件生成草稿回复。EchoMimicV2 是由蚂蚁集团的终端技术部门开发的一款先进的人类动画生成模型，旨在实现生动、简化的半身人类动画。该模型受到 OpenAI 的 o1 模型的启发，旨在突破标准化知识领域的限制，探索其在缺乏明确标准和难以量化奖励的更广泛领域中的通用性。由十个自主AI代理共同创作的小说。]]></description><category></category></item><item><title><![CDATA[TikTok推出免费生成式AI视频制作平台]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/144018388</link><guid>https://blog.csdn.net/weixin_40425640/article/details/144018388</guid><author>weixin_40425640</author><pubDate>Mon, 25 Nov 2024 08:55:05 +0800</pubDate><description><![CDATA[TikTok近日发布了“Symphony Creative Studio”，一款面向广告主和内容创作者的免费生成式AI视频制作平台。该平台允许用户上传品牌素材并自动生成短视频，具备视频编辑、字幕添加、翻译及语音合成等功能。支持30多种语言的翻译，并可调节发音与人物口型以实现同步。此外，平台未来将增加微调短视频及品牌专用广告台词等功能，以提高广告主的创作效率。]]></description><category></category></item><item><title><![CDATA[谷歌Gemini推出个性化记忆功能；DeepSeek推出全新推理模型R1-Lite]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/143931211</link><guid>https://blog.csdn.net/weixin_40425640/article/details/143931211</guid><author>weixin_40425640</author><pubDate>Thu, 21 Nov 2024 08:45:16 +0800</pubDate><description><![CDATA[谷歌近日为Gemini Advanced用户推出“记忆”功能，使AI能够记住用户的生活细节和个人偏好。这一功能类似于ChatGPT，能够根据用户的喜好提供个性化服务。例如，若用户曾提到喜欢某种菜系，Gemini会在推荐餐馆时据此调整建议。目前，该功能仅在网页版上线，需订阅Google One AI Premium，iOS和安卓用户尚未体验。用户可以随时管理和删除记忆信息，谷歌承诺不将这些信息用于模型训练。]]></description><category></category></item><item><title><![CDATA[阿里巴巴开源OmniSearch实时规划每个检索动作；智能交互的图像编辑系统MagicQuill；清华大学开源人与代理协作的新型平台iAgents]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/143901690</link><guid>https://blog.csdn.net/weixin_40425640/article/details/143901690</guid><author>weixin_40425640</author><pubDate>Wed, 20 Nov 2024 09:20:01 +0800</pubDate><description><![CDATA[每位用户都有一个个人代理，能够代表他们与其他代理协作。该平台利用大语言模型驱动的多代理系统，并提供了一个即时消息 Web 界面，用户可以像使用普通聊天应用一样，与代理进行互动。该项目利用 GPT-4 模型，能够以 100% 的准确率识别复杂的验证码图像，支持自动化操作，减轻人工处理的负担。该系统具有用户友好的界面，结合人工智能的建议，能够进行精准的局部编辑。OmniSearch通过其自适应特性和动态检索能力，为多模态信息检索和问题回答提供了强有力的支持，能广泛应用于需要实时获取和处理信息的各种场景。]]></description><category></category></item><item><title><![CDATA[微软在Ignite 2024发布Copilot+新功能]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/143900950</link><guid>https://blog.csdn.net/weixin_40425640/article/details/143900950</guid><author>weixin_40425640</author><pubDate>Wed, 20 Nov 2024 08:45:57 +0800</pubDate><description><![CDATA[微软在Ignite 2024大会上宣布，Microsoft 365 Copilot将利用Copilot+ PC中的NPU本地运行AI模型，减少网络依赖。此功能将提升用户在Outlook和Word中的AI写作辅助体验。同时，Windows Recall功能因安全问题推迟，微软承诺改进其安全性。新发布的Windows Copilot Runtime为开发者提供了图像处理API，计划在2025年推出，预计将吸引更多应用程序使用这一技术。]]></description><category></category></item><item><title><![CDATA[AI实验室发展遇阻，领导人对未来持乐观态度]]></title><link>https://blog.csdn.net/weixin_40425640/article/details/143872452</link><guid>https://blog.csdn.net/weixin_40425640/article/details/143872452</guid><author>weixin_40425640</author><pubDate>Tue, 19 Nov 2024 09:22:26 +0800</pubDate><description><![CDATA[近期有传言称OpenAI、谷歌和Anthropic等AI实验室在开发先进模型时遇到困难，原因是训练数据不足。对此，OpenAI CEO Sam Altman和Anthropic CEO Dario Amodei表示不同意见，认为仍有不少方法可克服障碍。前谷歌CEO埃里克・施密特预测未来五年内大型语言模型将快速迭代，性能持续增长，但同时也警告潜在风险增加，包括新型攻击和生物病毒的威胁。]]></description><category></category></item></channel></rss>