类别归档:LLM

LLM is short for Large Language Model,大语言模型。

RSS feed of LLM

用 Hy4 preview 维护老博客的几天试用记录

腾讯混元在 2026 年 8 月 28 日发布了 Hy4 preview,WorkBuddy、CodeBuddy、元宝、ima 同步上线,限时免费约两周。WorkBuddy 侧给出的截止时间是 9 月 10 日 23:59,CodeBuddy 的官方口径只说"两周",以客户端实际显示为准。免费期内每天有额度上限,触顶后消耗积分,繁忙时需要排队。

发布当天的报道集中在一组跑分上:12 项 benchmark,Terminal Bench 2.1 得 85.4,DeepSWE 从上一代的 28.0 涨到 64.3。需要说明的是,这些分数目前都出自腾讯官方自述——发布首日 Artificial Analysis 尚未收录,Hugging Face Open LLM Leaderboard 没有数据,第三方媒体基本是通稿转载,还没有看到独立的社区实测。

我自己更关心的是它在日常场景里的表现,所以把它拉到一个我维护了十余年的个人博客上试了几天。这篇记录一下过程和结果。

先说它是什么

能确认的基础信息如下:

项目 ...

继续阅读

让 AI 替你画 UML:CodeBuddy + DrawIO 工作流

为什么用 AI 画 UML

软件工程中,UML(统一建模语言)是沟通需求、设计与实现的通用语言。但传统手绘 UML 有两大痛点:绘图工具学习成本高,以及代码演进后图容易过时。本文介绍一套工作流:用 CodeBuddy(AI 编程助手)生成 drawio(.drawio / .xml)源码,再导入 app.diagrams.net 可视化编辑与导出,快速产出类图、时序图、用例图等软件工程 UML 图。

整体工作流

  1. 描述需求:向 CodeBuddy 说明要画什么图、包含哪些元素。
  2. 生成源码:让 CodeBuddy 直接输出符合 drawio XML 格式的 .drawio 文件。
  3. 导入查看:打开 app.diagrams.net ...

继续阅读

AWS AgentCore 搭 Chatbot 的真实体验:会话管理和上下文上限并非开箱即用

背景:从一次选型讨论说起

最近在评估用 AWS AgentCore 来搭一个 chatbot。官方文档把它描述成一个"企业级 agent 平台",看起来什么都有:Runtime 跑代码、Memory 管记忆、Gateway 接工具、Observability 看观测。但当我真正去核对"会话管理"和"确保上下文不超模型上限"这两个 chatbot 最核心的需求时,发现 OOTB(开箱即用)的程度和宣传里暗示的并不完全一致。这里把结论记下来,供同样在选型的人参考。

AgentCore 到底是不是 chatbot 框架?

先说定位:AgentCore 是"运行时 + 记忆 + 网关"平台,不是开箱即用的 chatbot 框架。你需要自己写 agent 的业务逻辑(跑在 AgentCore Runtime 里),它负责的是部署、扩缩容、身份认证、工具连接和可观测性。对话和会话能力由其中的 AgentCore Memory 模块提供。

也就是说,它给你的是"地基"和"水电煤",不是"精装修的房子"。对想快速拖一个聊天窗口的人来说,它偏底层;对要自己掌控 agent 行为、又要生产级运维能力的团队,它合适。 ...

继续阅读

GenAI视频生成的原理简介

GenAI,即生成式人工智能(Generative Artificial Intelligence),是一种利用人工智能技术自动生成各种内容的新型创作方式。在视频生成方面,GenAI通过学习和分析大量视频数据,能够自动生成视频内容,这包括视频剪辑、动画制作、视频特效等多种类型。

关于GenAI视频生成的原理,可以归纳为以下几点:

一、深度学习模型

GenAI视频生成主要依赖于深度学习模型,特别是生成对抗网络(GANs)、变分自编码器(VAEs)以及扩散模型(Diffusion Models)等。这些模型通过训练大量的视频数据,学习到视频内容的分布和特征,从而能够生成新的视频。

二、文本到视频的生成

  1. 文本解析:首先,GenAI会对输入的文本进行解析,理解文本中的语义和意图。这通常涉及到自然语言处理(NLP)技术,如词嵌入、句法分析等。
  2. 视频内容生成:在理解文本的基础上,GenAI会生成与文本描述相匹配的视频内容。这包括生成视频的帧、音频以及它们之间的时序关系。生成的视频内容需要符合文本的语义和语境,同时保持视觉和听觉上的一致性。
  3. 后处理:生成的视频可能还需要进行后处理,以提高其质量和真实性。这包括视频的渲染、特效的添加以及音频的混音等。

三、关键技术

  1. 高级视频生成能力:GenAI需要能够处理视频中的光线、物理效果和物体运动的真实性。例如,在生成火焰或水面反射等复杂场景时,GenAI需要能够模拟出逼真的光线和物理效果。
  2. 音频生成:除了视频内容的生成,GenAI还需要能够生成与视频场景相匹配的音效和背景音乐。这要求GenAI能够理解和生成连续的、自然的音效和音乐。
  3. 个性化扩展:通过个性化的扩展训练,GenAI能够根据用户提供的图像或文本生成特定人物或场景的视频。这为用户提供了更多的创作自由和灵活性。

四、应用场景

GenAI视频生成技术在多个领域都有广泛的应用前景。例如:

  1. 影视制作:可以快速生成高度真实的场景和人物动作,提高制作效率并降低成本。
  2. 广告营销:可以根据消费者的行为和偏好定制广告文案和视觉设计,提高个性化营销的效果。
  3. 游戏开发:可以快速生成逼真的场景和角色动作,缩短开发周期并提高游戏质量。

总的来说,GenAI视频生成的原理是基于深度学习模型对大量视频数据的学习和分析,通过文本到视频的生成过程以及关键技术的应用,实现了自动生成高质量视频的能力。随着技术的不断进步和应用场景的拓展,GenAI视频生成技术有望在多个领域中发挥更大的作用。

LLM入门有哪些推荐书籍

对于想要入门LLM(Large Language Model,大型语言模型)的读者,以下是一些推荐的书籍:

  1. 《GPT-3:使用大型语言模型构建创新的NLP产品》:由O’Reilly出版,本书深入探讨了GPT-3的功能,提供了使用GPT-3构建创新NLP产品的见解,涵盖了模型微调、检索增强生成和从人类反馈中进行强化学习等主题。这本书是希望在其应用程序中利用GPT-3功能的开发人员和企业的实用指南。
  2. 《大型语言模型快速入门指南:使用ChatGPT和其他LLM的策略和最佳实践》:同样由O’Reilly出版,本指南提供了使用大型语言模型的快速入门,重点介绍ChatGPT和其他LLM。它涵盖了模型选择、微调和部署等主题,对于希望快速将LLM集成到其应用程序中的开发人员和企业来说,是一本绝佳的资源。
  3. 《使用Transformer进行自然语言处理》:本书深入介绍了transformers,即在NLP中实现最先进成果的主要架构。它涵盖了transformers的底层机制以及如何将它们应用于各种NLP任务的实际方面,例如撰写真实的新闻报道和创建聊天机器人。这本书是了解transformers的宝贵资源。
  4. 《用于自然语言处理的Transformers》:本书由Packt出版,深入探讨了Transformer的世界,重点介绍了它们在NLP中的应用。它涵盖了Transformer的核心概念,包括自注意力机制,并探讨了如何使用这些模型来增强语言建模能力。这本书提供了Transformer架构的全面指南。
  5. 《Build a Large Language Model (From Scratch)》:本书旨在讲解从头开始构建大型语言模型的整个过程,包括如何创建、训练和调整大型语言模型。通过大量的图表和插图,让读者可以彻底了解LLM的工作原理。这本书主要使用的是pytorch框架,非常适合想要动手实践的读者。

此外,还有一些其他深度学习相关书籍,如《深度学习》(Ian Goodfellow著)和《Deep Learning for NLP》(Yoav Goldberg著)等,也可以作为入门LLM的辅助阅读材料。这些书籍提供了深度学习的理论基础和算法原理,有助于读者更好地理解LLM的工作原理和应用场景。

LLM领域是一个快速发展的领域,新的研究和进展不断涌现。因此,除了阅读书籍外,建议读者还要关注相关的学术论文、博客文章和在线课程等资源,以保持对最新技术和趋势的了解。