ニュース本文
詳細・参加申込はこちら
■ 高価なGPU投資を、どう成果につなげるか
生成AIの活用が本格化し、LLMの学習・推論を支えるAI基盤への投資が進んでいます。GPUクラウド事業者や、自社でAIを本格運用する企業では、多数のGPUを導入し、基盤を拡充する動きも見られます。
一方で、高性能GPUは高価です。投資を成果につなげるには、GPUを増やすだけでなく、導入した設備を安定して稼働させ、その性能を十分に引き出すことが求められます。
■ GPUの稼働率と推論性能を左右する、二つの課題
GPUが増えるほど、サーバーやネットワークを含めたクラスタ全体の運用は複雑になります。障害によってジョブが中断すれば、原因の特定や復旧、再実行に時間がかかり、GPUを十分に活用できません。
また、AI推論では、長い文章の処理や同時リクエストの増加に伴い、GPUメモリーが不足することがあります。GPUを増強しても、メモリーが制約となって期待したほど処理量が伸びない場合があります。
こうした課題に対応するには、クラスタの安定運用によって稼働率を高めることと、推論時のメモリー利用を最適化することの両方が必要です。
■ 稼働率50%台から90%台へ。改善事例から学ぶ運用設計
本セミナーでは、高価なGPUへの投資効果を高めるために、AI基盤の設計・構築・運用で押さえるべきポイントを解説します。
クラスタの安定運用とパフォーマンス最適化を支援する「ClusterWareAI」に加え、AI推論時に処理を高速化するための一時データ「KVキャッシュ」を大容量メモリーへ移し、GPUメモリーの負荷を軽減する「MemoryAI KV Cache Server」をご紹介します。
さらに、GPUの稼働率を50%台から90%台へ引き上げた過去の実績をもとに、インフラの設計・構築・運用で何に着目し、どのような改善を積み重ねたのかを事例とともに解説します。GPUサーバー、ストレージ、ネットワークから監視・保守まで、基盤全体を見据えた運用の考え方をお伝えします。
■ AIファクトリーを設計から運用まで支える、ペンギンソリューションズ
ペンギンソリューションズは、長年にわたりAI/HPC基盤の設計・構築・運用に携わり、約10万GPUの展開・運用、40億時間を超えるGPU稼働を支えてきました。
この経験をもとに、複数ベンダーの製品・技術を組み合わせ、お客様の課題に応じたAI基盤を提案。設計・構築から導入後の監視・保守・運用まで伴走する、AIファクトリー向けフルスタックサービスを提供しています。
■ こんな方におすすめ
・AIインフラを構築・運用しており、稼働率やリソース効率を改善したい方 ・障害によるジョブの中断や、AI推論時のメモリー不足に課題を感じている方 ・クラウド利用から、自社環境でのLLM学習・推論への移行を検討している方 ・GPUクラウドなど、AI基盤サービスを提供・検討している事業者の方 ・AIインフラ全体のTCOや投資対効果を最適化したい方
■主催・共催 ペンギンソリューションズ株式会社 ■協力 マジセミ株式会社
詳細・参加申込はこちら
マジセミは、今後も「参加者の役に立つ」ウェビナーを開催していきます。
過去セミナーの公開資料、他の募集中セミナーは▶こちらでご覧いただけます。
マジセミ株式会社
〒102-0094 東京都千代田区紀尾井町3番12号 お問合せ: https://majisemi.com/service/contact/