nevertheless diary

AIに聞いたことの備忘録

データセット の検索結果:

AIリテラシーをAIに教わる:応用編(概要~第1回)

…ョップ】最初の対話:データセットの健康診断 提供されたサンプルデータ(シンプルな売上データなど)をADAにアップロード。 「このデータはどんなデータですか?」「各列の意味を説明して」「欠損値や異常値はありますか?」といった基本的なプロンプトで、AIにデータを「検診」させる体験をする。 第2回:実践スキル① - データの可視化と探索的データ分析(EDA) 〜AIにグラフを描かせ、データの声を聞く〜 【学習目標】 AIへの指示によって、様々な種類のグラフを意図通りに作成し、データ…

AIリテラシーをAIに教わる:基礎編(概要~第1回)

…繁に引用される著名なデータセットです。 各データの代表的な情報源や根拠は以下の通りです。 ChatGPT (2ヶ月): この数値の最も有名な出典は、スイスの金融大手UBSの分析レポートです。2023年2月1日に発表されたこのレポートで、ChatGPTが公開からわずか2ヶ月で月間アクティブユーザー数1億人に到達したと推定され、歴史上最も速いペースで成長した消費者向けアプリケーションであると報告されました。 このUBSのレポート内容は、ロイター通信をはじめとする世界中の大手メディ…

AIの課題を人の認知に応用する:思考におけるハルシネーション

…ズムで発生します。 データセットの制約: 学習データに存在しない、または関連性の低い事柄について質問されたとき、モデルは既存のパターンを組み合わせてもっともらしいが虚偽の情報を生成します。 パターン認識の限界: LRMは確率的に最も確からしい単語の並びを予測します。この過程で、論理的整合性や事実確認よりも、文脈上の「滑らかさ」が優先されるため、虚偽の情報が生成されやすいのです。 因果関係の欠如: LRMは真の因果関係を理解しているわけではありません。単語や文の統計的関連性に基…

AIの限界から導かれる「推論力を高める方法」:メタ認知能力

…合わせる。 大規模なデータセットからパターンを学習。強化学習を通じて、より効率的なCoTを生成するように訓練される。 間違いへの対応 自分の間違いを認識し、その原因を内省し、根本的な思考プロセスを修正することができる。 自己無矛盾性やプロセス評価を通じて、間違いを修正しようとするが、必ずしも根本的な論理的欠陥を理解しているわけではない。 汎用性 異なる分野や状況に推論能力を適用する高い汎用性を持つ。 特定のタスクやドメインに特化している場合がある。一部の非常に複雑な問題では、…

ポチョムキン理解:人間の脳の模倣

…測定するベンチマークデータセットを構築しています。 汎用的な自動評価手順: ポチョムキン理解の発生率の下限を提供する、より一般的な自動評価手順も提示しています。 研究結果: これらの評価手順を複数のLLMに適用した結果、ポチョムキン理解がモデル、タスク、ドメインを問わず遍在していることを発見しました。 モデルが概念をほぼ完璧に定義できるにもかかわらず、それらの概念を正確に適用することに苦労していることが示されています。 これらの失敗は、単に概念の理解が不正確なだけでなく、概念…

プロンプトインジェクションとは:メモ投稿

AI

…に対する適切な応答のデータセットを用いてモデルを再学習させる。 安全性に関するトレーニングデータを充実させる。 ユーザーへの注意喚起と教育: AIの限界や安全な利用方法について、ユーザーに理解を促す。 人間による介入(Human-in-the-Loop): 特に機密性の高いタスクや、AIが判断に迷うような状況では、人間の最終確認や承認を挟む。 サンドボックス化: AIが外部のシステムやデータにアクセスする際、その権限を最小限に制限し、独立した環境(サンドボックス)で動作させる…

思考 ⊂ 情報処理:メモ投稿(追記あり)

AI

…、身体を持たず、主にデータセット(テキスト、画像など)から学習していました。これを「非身体性(Disembodied AI)」と呼びます。しかし、このアプローチだけでは、真の常識的推論、因果関係の理解、現実世界での問題解決能力には限界があるという認識が強まってきました。 AIと「入出力装置・センサーとしての身体の獲得」に関する研究の動向 「身体性AI」の研究では、AIをロボットなどの物理的な身体に搭載し、センサー(入力装置)とアクチュエーター(出力装置)を通じて現実世界と直接…

LRMの限界:AIと50音パズル

…非常に巨大なテキストデータセットを学習し、人間のような自然な言語を理解し、生成することができます。 LLMの主な役割は、与えられた入力に基づいて次にどのような単語が来るかを予測し、自然な文章を生成することです。これにより、質問応答、文章要約、翻訳、チャットボットなど、多岐にわたるテキストベースのタスクに対応できます。 代表的なLLMとしては、GPTシリーズ(GPT-3, GPT-4など)、LLaMA、Geminiなどがあります。 LRMとLLMの違い まとめると、LRMとLL…

ハルシネーションとRAG、DTA:回答内容の正しさ

…スソース、検証済みのデータセットなど、事前にキュレーションされ、信頼性が確認された情報源を基に知識ベース(ベクトルデータベースなど)が構築されます。 誤情報排除のポイント: AIが生成したブログ記事のような未検証の、あるいは誤情報が含まれる可能性のあるデータは、この段階で知識ベースから除外されるか、あるいは信頼性の低いものとして扱われます。 これにより、RAGシステムは「ゴミを入れればゴミが出る」(Garbage In, Garbage Out)という原則を回避し、「正確な情…

AIはマンガを読めるのか:Gemini編

…登場や、より大規模なデータセットを用いた学習などが、AIの理解力を飛躍的に向上させています。 当時のAIが苦手としていた、 視覚的な文脈の理解: 画像認識技術の向上により、コマ内の物体やキャラクター、背景などの認識精度が格段に上がっています。 話し言葉の深さの理解: 自然言語処理の進化により、口語表現や感情のニュアンス、比喩的な表現なども、以前よりは理解できるようになってきています。 文化的知識: 大規模な知識ベースと連携することで、特定の文化的背景や慣習なども学習できるよう…

Geminiと音楽:フェアポート・コンベンションの楽曲を調べてもらう

…AIは、より大規模なデータセットを学習しており、特定の音楽データベースと連携している可能性があります。また、ユーザーの質問に対する解釈の仕方も、私たちとは異なる点があるかもしれません。 より正確な情報を得るために より確実な情報を提供するためには、以下の情報があると大変助かります。 楽曲を聴いた場所: どのような媒体(CD、ストリーミングサービス、ライブなど)で聴きましたか? アルバム名: 曲が収録されているアルバムのタイトルは覚えていますか? リリース年: いつ頃にリリース…

jSTAT MAP:地図で見る統計

…ズすることで、特定のデータセットや指標を強調表示できます。複数のデータセットを重ねて表示することで、異なる指標の関係性を視覚的に分析することができます。 データのエクスポートと共有:作成した地図を画像として保存したり、他のユーザーと共有することができます。統計データ自体もCSV形式でエクスポートすることができ、他のアプリケーションでのさらなる分析が可能です。 利用方法 データの選択:jSTAT MAPにアクセスし、表示したい統計データを選択します。分野や指標ごとに整理されたメ…

Week3に出てきた統計用語:メモ

…ツールです。大規模なデータセットを整理し、さまざまな角度からデータを視覚的に表示するのに役立ちます。主にExcelやGoogle Sheetsなどのスプレッドシートソフトウェアで使用されます。 ピボットテーブルの主な要素 行ラベル: 集計するデータのカテゴリを表します。ピボットテーブルの左側に配置され、データの行ごとの分類を示します。 列ラベル: 集計するデータのカテゴリを列として表示します。ピボットテーブルの上部に配置され、データの列ごとの分類を示します。 値: 実際に集計…

統計学の基礎に出てきた用語:メモ

…解するために、以下のデータセットを使用して説明します。 データセット: 1, 2, 2, 3, 4, 5, 5, 5, 6 平均値 データの合計をデータの個数で割ったものです。例として、1, 2, 3, 4, 5の平均は (1+2+2+3+4+5+5+5+6)/9 = 3.67 中央値 データを小さい順に並べたとき、中央に位置する値です。データの数が奇数の場合は中央の値、偶数の場合は中央の二つの値の平均を取ります。この場合、データは既に並んでいますので、中央の値は5番目の値、…

暗黙知と形式知:ログミーTechのトークセッションから

AI

…業。 データ分析: データセットの分析やレポート作成。これにはトレンドの発見や予測分析が含まれます。 データクリーニング: データの検証と修正、異常値の処理など。 2. 文書作成 レポート作成: 事業報告書や市場調査レポートの作成。 契約書・文書のドラフト: 標準的な契約書やビジネス文書の作成。 コンテンツ生成: マーケティング資料、ブログ投稿、ソーシャルメディアコンテンツの作成。 3. カスタマーサポート チャットボット: 顧客からの問い合わせに対する自動応答。 FAQの提…

社会人のためのデータサイエンス入門:受講した(1)

…索結果から興味のあるデータセットを選び、詳細ページでデータを閲覧します。 データのダウンロード:必要に応じて、データをダウンロード形式を選んで取得します。 APIの利用:開発者向けページからAPIの利用方法を確認し、プログラムから統計データを取得します。 利便性 一元的なアクセス:複数の政府統計データを一つのプラットフォームで提供しているため、利用者は簡単にデータにアクセスできます。 使いやすいインターフェース:ユーザーフレンドリーなインターフェースにより、初心者でも簡単に利…

蒸留と分散:生成AI

AI

…練: まず、大規模なデータセットを使って高性能なティーチャーモデルを訓練します。 ソフトラベルの生成: ティーチャーモデルの出力を使って、スチューデントモデルの訓練に用いるソフトラベルを生成します。 スチューデントモデルの訓練: ソフトラベルを使って、より小規模なスチューデントモデルを訓練します。スチューデントモデルはティーチャーモデルの知識を引き継ぎます。 分散の制御方法 正則化: 過剰適合を防ぐために正則化手法(L1正則化、L2正則化など)を用います。これにより、モデルの…

『言語の本質』:まだ読んでいない本

…の理解: - 多様なデータセットからの学習により、機械は異なる文脈や使用例を蓄積し、より広範な意味の理解が可能になります。これにより、単語や記号の意味を異なる状況で適切に解釈する能力が向上します。 記号接地問題の変質 1. 意味の内在化の進展: - データ量が増えることで、記号の背後にある意味がより明確になり、機械がそれを内在化する能力が高まる可能性があります。これにより、記号と実世界の事物や概念との結びつきがより強固になることが期待されます。 2. 仮想的な「経験」の形成:…

社会人のためのデータサイエンス入門:加齢対策

…です。 3. 実際のデータセットで練習: 公開されているデータセットを使って練習し、データのクリーニング、分析、可視化を実際に体験します。例えば、KaggleやUCI Machine Learning Repositoryなどで無料のデータセットが入手できます。 4. 基本的な分析手法の習得: データの分布を理解するための平均、中央値、標準偏差などの統計量や、データの関連性を調べるための相関係数、回帰分析などの基本的な手法を習得します。 5. データの可視化: データを視覚的…